Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Qwen3.6-35B-A3B 모델에 규범 보존 이중 투영 기술을 적용하여, 모델의 지능 저하 없이 거부 메커니즘을 제거하는 데 성공했습니다. 하이브리드 어텐션과 3D 전문가 텐서 구조를 고려한 정밀한 Abliteration을 통해 거부율 0%와 벤치마크 성능 유지를 동시에 달성했습니다.
직접 라벨링한 900개의 의료 스캔 문서를 활용하여 의료 VQA 성능을 테스트한 결과입니다. 기존 코딩 벤치마크와는 다른 양상이 나타났으며, 모델별 추론 속도와 사고 과정의 차이를 분석했습니다.
VLM을 활용하여 로봇 비디오를 세부 하위 작업으로 자동 변환하는 새로운 파이프라인을 구축했습니다. 이 방식은 인간 주석 처리 대비 비용을 19배 절감하며, 장기적 과제 수행을 위한 정밀한 학습 신호 생성에 효과적입니다.
HuiHui abliterated 모델이 Vanilla 3.6-35B-a3B 모델보다 수학 및 코딩 벤치마크에서 더 높은 성능을 보였습니다. 거절 메커니즘을 제거하는 과정이 특정 추론 작업에서 긍정적인 영향을 미칠 수 있음을 시사합니다.
Qwen 3.5를 기반으로 미세 조정된 오픈 소스 모델 MaralGPT Mythos 9B 2606이 출시되었습니다. 이 모델은 검열이 없는 개방적인 특성을 가지며, 100만 토큰의 확장된 컨텍스트 윈도우를 지원합니다.
대형 모델의 절차적 기술을 소형 모델로 전이할 수 있는지 확인하기 위한 실험적 방법론을 소개합니다. Three.js를 활용해 모델의 계획 능력과 구조적 실행력을 테스트하며, 스캐폴딩(scaffolding)을 통해 소형 모델의 성능 개선 가능성을 탐색합니다.
이미지를 제어 가능한 캐릭터로 변환하는 로컬 실행형 800M 모델을 소개합니다. 디퓨전 포싱과 인과적 디퓨전 방식을 사용하여 프레임 간 안정성을 높였으며, 소비자용 GPU에서도 원활하게 작동합니다.
Ornith-1.0-35B GGUF 모델에 네이티브 MTP(Multi-Token Prediction) 투기적 디코딩 기술을 접목하여 추론 성능을 개선했습니다. IQ4_XS 양자화 모델에 MTP 헤드를 결합하여 단일 스트림 디코딩 속도를 약 1.3~1.35배 향상시켰으며, 높은 모델 충실도를 유지합니다.
3B 활성 파라미터를 가진 MoE(Mixture of Experts) 구조의 Ornith 1.0-35b 모델에 대한 리뷰입니다. 낮은 활성 파라미터에도 불구하고 속도, 정확도, 지능 측면에서 뛰어난 성능을 보여줍니다.
DeepSpec은 투기적 디코딩(Speculative Decoding)을 위한 초안 모델을 학습하고 평가하는 풀스택 코드베이스입니다. 데이터 준비부터 모델 구현, 평가 스크립트까지 포함하며 다양한 알고리즘과 체크포인트를 제공합니다.
Clark Labs가 Sana 1.6B 텍스트-이미지 변환기를 삼진법(ternary) 방식으로 양자화하여 공개했습니다. FP16 대비 모델 크기를 약 8.6배 줄이면서도 유사한 품질을 유지하는 것이 특징입니다.
55개의 LLM을 대상으로 수행한 상호 블라인드 평가 연구를 통해 모델 제품군 간의 평가 편향을 분석했습니다. 연구 결과, 대부분의 모델 제품군에서 자기 계열 모델에게 높은 점수를 주는 '내집단 편향'이 발견되었으며, Mistral의 경우 오히려 부정적인 편향이 나타나는 이례적인 결과도 확인되었습니다.
Qwen 3.5의 미세 조정 버전으로 추정되는 최적화된 오픈 모델들의 뛰어난 코딩 성능과 추론 속도를 분석합니다. 다양한 GPU 환경에서 테스트한 결과, 특정 코딩 작업에서 매우 높은 효율성을 보여줍니다.
양자화 수준이 Speculative Decoding(추측적 디코딩)의 MTP 초안 수락률에 미치는 영향을 분석한 연구입니다. 양자화 비트가 낮아질수록 초안 깊이가 깊어질 때 수락률이 감소하며, 하드웨어 아키텍처에 따라 최적의 초안 깊이가 다름을 보여줍니다.
소형 모델의 눈에 띄는 실패 사례를 측정하기 위한 새로운 벤치마크인 ObviousBench.com이 공개되었습니다. 모델의 크기, 비용, 속도 및 추론 능력 설정에 따른 성능 트레이드오프를 분석하는 데 중점을 둡니다.
Spectral Labs가 새로운 보정 인식 양자화 방식인 SpectralQuant를 통해 Qwen3.5 0.8B 모델의 성능을 극대화했습니다. 이 방식은 모델의 민감한 가중치를 보호하여 표준 Q4_K_M 용량에서도 BF16 모델과의 성능 격차를 96.5%까지 회복했습니다.
SupraLabs가 출시한 SupraSafety-18M은 18M 파라미터 규모의 초소형 콘텐츠 모더레이션 모델입니다. 에지 디바이스 및 저지연 환경에 최적화된 BERT 스타일의 이진 텍스트 분류기입니다.
NVIDIA의 Nemotron-3-Super-120B-A12B 모델이 hybrid Mamba와 MoE 구조를 통해 504K 토큰의 긴 컨텍스트에서도 높은 성능을 유지함을 입증했습니다. Mamba 레이어의 특성상 KV 캐시 비용이 적어 긴 문맥에서도 디코딩 속도가 안정적이며, Needle-in-haystack 테스트에서 완벽한 회상 능력을 보여주었습니다.
OpenAI가 GPT-5.6 제품군을 공식 프리뷰하며 Sol Ultra, Sol, Terra, Luna 모델을 공개했습니다. GPT-5.6 Sol Ultra는 TerminalBench 2.1에서 Claude Mythos 5를 능가하는 성능을 보여주었습니다.
VLM(Vision Language Model)을 실제 운영 환경과 유사한 비디오 데이터로 평가할 수 있는 오픈소스 프레임워크를 공개했습니다. 프레임 샘플링과 장면 경계 설정 등 최적의 평가 구성을 위한 방법론과 트레이스 실행 기능을 제공합니다.