Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
GLM-5.2는 Terminal-Bench에서 80% 이상의 성능을 기록한 최초의 오픈 웨이트 모델입니다. 기존의 모든 오픈 모델과 Gemini를 능가하며, 저비용으로 프런티어 급 성능을 제공하는 게임 체인저로 평가받습니다.
LLM의 아첨(Sycophancy)과 환각(Hallucination)을 측정하기 위한 오픈 벤치마크인 HalBench v2.3을 소개합니다. 33개의 모델을 대상으로 테스트한 결과, Sonnet 4.6이 가장 높은 반박률을 기록했으며 Qwen 모델이 오픈 소스 모델 중 가장 우수한 성능을 보였습니다.
사이버 보안 작업에 특화된 오픈 웨이트 LLM인 OpenMythos를 공개했습니다. RLVR(검증 가능한 보상을 통한 강화 학습) 기법을 활용하여 보안 취약점 식별 및 코드 수정의 정확도를 높였습니다.
DiffusionGemma 26B A4B 모델의 양자화 버전(Q6_K, Q4_K_M)에 대한 개인 튜닝 및 성능 테스트 결과입니다. RTX 5090 환경에서 llama.cpp를 활용하여 컨텍스트 제한, VRAM 사용량, 최적 파라미터 및 실행 명령어를 분석했습니다.
비디오의 시각적 복잡성에 따라 토큰을 동적으로 할당하는 적응형 비디오 토큰화 기술을 제안합니다. 잠재 공간의 시간적 중복성을 활용해 계산 오버헤드를 줄이고, LIT 구조를 통해 누락된 위치를 효율적으로 재구성합니다.
LLM as a judge 방식을 통해 Qwen 모델들의 요약 성능을 벤치마킹한 결과, 30B 파라미터 규모에서는 Qwen 2.5가 가장 우수한 성능을 보였습니다. 최신 Qwen 모델들이 요약보다는 에이전트적 작업에 더 최적화되어 있을 가능성을 시사합니다.
Gemma4 모델에서 안전성 확보를 위해 소비되는 계산 및 인지적 오버헤드인 '정렬 세금(Alignment Tax)'을 측정하는 방법론을 다룹니다. CoT 추출을 통한 정량적 계산법과 컨텍스트 포화를 이용한 안전 가중치 희석 현상을 분석합니다.
DiffusionGemma의 환각 문제를 해결하고 추론 성능을 최적화하기 위한 다양한 방법론을 제안합니다. 샘플러 조정, 엔트로피 제한, 사고 모드 활용 등 Tier별 기술적 접근법을 통해 dLLM의 효율성을 높이는 방안을 다룹니다.

SCAIL-2는 중간 포즈 표현 없이 드라이빙 비디오를 통해 캐릭터를 애니메이션화하는 오픈 소스 모델입니다. 통합 모션 전송 인터페이스를 통해 캐릭터 교체 및 다중 캐릭터 시나리오를 지원하며, 동물 드라이빙과 같은 창발적 능력을 보여줍니다.
새로운 Abliteration 도구인 Apostate의 성능을 Heretic, Huihui와 비교 분석한 연구 결과입니다. Qwen 2.5 7B 모델을 대상으로 거부 메커니즘 제거 성능과 파라미터 변화량을 벤치마크하여 각 도구의 효율성을 검증했습니다.

Microsoft가 Microsoft Build 2026에서 온디바이스 최적화 모델인 Aion 1.0 Instruct와 Aion 1.0 Plan을 발표했습니다. Instruct는 효율적인 SLM으로 오픈 웨이트로 제공되며, Plan은 로컬 에이전트 추론 및 도구 호출에 특화된 모델입니다.

Google DeepMind가 텍스트, 이미지, 오디오를 처리하는 멀티모달 오픈 웨이트 모델 Gemma 4를 출시했습니다. 다양한 모델 크기와 MoE 아키텍처를 통해 온디바이스부터 서버까지 폭넓은 배포를 지원합니다.
28가지 LLM 신뢰성 기술을 단일 API로 통합한 오픈소스 라이브러리 AgentCodec을 소개합니다. 통신 이론 프레임워크를 기반으로 적응형 라우터를 도입하여, 동일 품질 대비 추론 비용을 최대 56% 절감할 수 있음을 입증했습니다.

PapersWithCode에서 주목받는 최신 AI 연구 기술인 On-policy distillation(OPD)을 소개합니다. OPD는 모델의 롤아웃 과정 중 발생하는 특정 오류를 정밀하게 억제하기 위해 힌트 토큰을 활용하는 사후 학습 기술입니다.

Huawei가 오픈 소스로 공개한 KVarN은 속도 저하 없이 KV-cache를 3~5배 압축하는 새로운 양자화 기술입니다. 기존 TurboQuant와 달리 처리량과 추론 품질을 동시에 유지하며, vLLM에서 단일 플래그로 즉시 적용 가능합니다.
KVarN은 Hadamard 회전과 분산 정규화를 결합하여 KV-Cache를 양자화하는 새로운 방법론입니다. AIME24와 같은 벤치마크에서 정확도 저하를 최소화하면서 3-4배의 압축률을 달성했으며, vLLM 환경에서 추론 속도 향상까지 입증했습니다.
SupraLabs가 사고 체인(Thinking chain)을 생성하는 추론 특화 모델인 Supra-50M-Reasoning을 출시했습니다. Qwen3 1.7B로 생성한 합성 데이터셋을 활용해 미세 조정되었으며, 향후 더 큰 파라미터 규모의 모델 출시를 계획하고 있습니다.
LLM의 KV-cache를 f32 대비 36배 무손실로 압축할 수 있는 오픈 소스 기술인 proveKV를 소개합니다. PPL 저하 없이 메모리 효율을 극대화하며, 자동화된 감사 스크립트를 통해 수치의 투명성을 검증했습니다.
Gemma 4 12B 모델의 도구 호출(Tool Calling) 기능 오류를 해결하기 위한 특수 채팅 템플릿 사용법을 안내합니다. llama.cpp 환경에서 특정 Jinja 템플릿을 적용하면 모델의 코딩 및 도구 활용 능력을 정상적으로 평가할 수 있습니다.
RedNote(Xiaohongshu)에서 출시한 2B 파라미터 규모의 오픈 소스 TTS 모델인 dots.tts를 소개합니다. 코덱 토큰 없이 완전 연속 구조를 채택하여 48kHz 고음질 합성과 제로샷 음성 복제가 가능합니다.