Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Google DeepMind가 텍스트, 이미지, 오디오를 처리하는 멀티모달 오픈 웨이트 모델 Gemma 4를 출시했습니다. 다양한 모델 크기와 MoE 아키텍처를 통해 온디바이스부터 서버까지 폭넓은 배포를 지원합니다.
28가지 LLM 신뢰성 기술을 단일 API로 통합한 오픈소스 라이브러리 AgentCodec을 소개합니다. 통신 이론 프레임워크를 기반으로 적응형 라우터를 도입하여, 동일 품질 대비 추론 비용을 최대 56% 절감할 수 있음을 입증했습니다.
PapersWithCode에서 주목받는 최신 AI 연구 기술인 On-policy distillation(OPD)을 소개합니다. OPD는 모델의 롤아웃 과정 중 발생하는 특정 오류를 정밀하게 억제하기 위해 힌트 토큰을 활용하는 사후 학습 기술입니다.
Huawei가 오픈 소스로 공개한 KVarN은 속도 저하 없이 KV-cache를 3~5배 압축하는 새로운 양자화 기술입니다. 기존 TurboQuant와 달리 처리량과 추론 품질을 동시에 유지하며, vLLM에서 단일 플래그로 즉시 적용 가능합니다.
KVarN은 Hadamard 회전과 분산 정규화를 결합하여 KV-Cache를 양자화하는 새로운 방법론입니다. AIME24와 같은 벤치마크에서 정확도 저하를 최소화하면서 3-4배의 압축률을 달성했으며, vLLM 환경에서 추론 속도 향상까지 입증했습니다.
SupraLabs가 사고 체인(Thinking chain)을 생성하는 추론 특화 모델인 Supra-50M-Reasoning을 출시했습니다. Qwen3 1.7B로 생성한 합성 데이터셋을 활용해 미세 조정되었으며, 향후 더 큰 파라미터 규모의 모델 출시를 계획하고 있습니다.
SPEAR는 저비트 LLM 서빙 시 발생하는 양자화 오차를 줄이기 위한 적응형 복구 시스템입니다. 토큰별 게이트와 경량 오차 보상기를 활용해 모델 성능 저하를 최소화하면서도 효율적인 서빙을 가능하게 합니다.
TokenAI가 이집트에서 개발한 첫 번째 오픈 소스 이미지 생성 모델인 Horus Lens 1.0을 출시했습니다. 이 모델은 Apache License 2.0을 따르며, 다양한 하드웨어 환경에 맞춘 5가지 양자화 버전을 제공합니다.
LLM의 KV-cache를 f32 대비 36배 무손실로 압축할 수 있는 오픈 소스 기술인 proveKV를 소개합니다. PPL 저하 없이 메모리 효율을 극대화하며, 자동화된 감사 스크립트를 통해 수치의 투명성을 검증했습니다.
Gemma 4 12B 모델의 도구 호출(Tool Calling) 기능 오류를 해결하기 위한 특수 채팅 템플릿 사용법을 안내합니다. llama.cpp 환경에서 특정 Jinja 템플릿을 적용하면 모델의 코딩 및 도구 활용 능력을 정상적으로 평가할 수 있습니다.
RedNote(Xiaohongshu)에서 출시한 2B 파라미터 규모의 오픈 소스 TTS 모델인 dots.tts를 소개합니다. 코덱 토큰 없이 완전 연속 구조를 채택하여 48kHz 고음질 합성과 제로샷 음성 복제가 가능합니다.
AMD 7900 XTX 환경에서 Gemma 4 QAT(양자화 인식 학습) 모델의 성능을 벤치마크한 결과입니다. QAT 모델은 기존 양자화 모델 대비 품질 저하 없이 속도는 향상시키고 VRAM 사용량은 줄이는 탁월한 효율성을 보여주었습니다.
AMD Strix Halo 플랫폼에서 StepFun 3.7 Flash 모델의 MTP(Multi-Token Prediction) 성능을 벤치마크한 결과입니다. MTP 적용 시 프리필 성능 저하 없이 디코딩 속도가 약 27.5% 향상됨을 확인했습니다.
Domino는 Speculative Decoding 과정에서 인과적 모델링과 자기회귀 초안 작성을 활용하는 새로운 방법론을 제안합니다. 이를 통해 Qwen3 모델에서 최대 5.8배의 처리량 향상을 달 수 있음을 입증했습니다.
Cohere가 공식 출시 전 테스트를 위해 30B 규모의 새로운 코딩 모델을 Hugging Face에 공개했습니다. 이 모델은 3B의 활성 파라미터를 사용하여 로컬 환경에서도 효율적인 실행이 가능하며, 사용자 피드백을 통해 모델을 개선할 계획입니다.
Gemma 4 QAT 모델의 추측적 디코딩(MTP) 성능을 최적화하기 위한 QAT 매칭 어시스턴트 헤드가 HuggingFace에 공개되었습니다. 또한 llama.cpp 및 Atomic 포크에서 발생하던 PARALLEL=2 충돌 문제를 수정하고 관련 벤치마크 수치를 업데이트했습니다.
1,700개의 Arxiv LLM 논문을 연구 관점과 '탐구 라인(inquiring lines)'으로 연결한 큐레이션 컬렉션을 공개했습니다. 주제별 분류를 넘어 공유된 연구 질문을 바탕으로 논문 간의 관계를 구조화하여 제공합니다.
Qwen 3.6 27B 모델을 대상으로 다양한 KV cache 양자화 방식(q8, q6, q5, q4 등)의 성능을 벤치마크한 결과입니다. BeeLlama.cpp 엔진을 사용하여 KVarN, TurboQuant 등 최신 양자화 기법의 효율성을 분석했습니다.
DeepSWE 벤치마크에서 Qwen 3.6 27B 모델의 성능을 분석한 결과입니다. 이 모델은 Haiku 4.5 등을 상회하는 성능을 보였으며, 로컬 환경에서 가성비 좋은 SOTA 모델로서의 가능성을 보여주었습니다.
Gemma 4 12b QAT 모델이 도구 호출(tool calling) 및 일관성 측면에서 기존 Q5_K_L 양자화 버전보다 성능이 퇴보했다는 사용자 리뷰입니다. 모델이 도구 응답 태그를 잘못 구성하여 구조화된 함수 실행이 깨지는 기술적 결함이 지적되었습니다.