Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 글은 Gemma 4 12B를 활용하여 유튜브 스크립트 요약본을 생성하고, 모델이 자체적으로 최적의 결과물을 선택하는 과정을 테스트한 연구 내용을 공유합니다. 여러 후보 요약본 간의 비교 및 평가 과정에서 유의미한 패턴과 효율적인 평가 방법을 제시합니다.

Wan-Animate-2는 Diffusion Transformer를 기반으로 구동 비디오를 직접 사용하여 캐릭터 애니메이션을 생성하는 엔드투엔드 프레임워크입니다. 중간 모션 추출 과정을 생략하여 높은 충실도와 정체성 보존 능력을 갖추었으며, 텍스트 기반 시점 제어 기능을 제공합니다.

LabyrinthBench는 다단계 에이전트 작업 중 발생하는 컨텍스트 회상(Context Recall) 능력을 결정론적으로 측정하는 새로운 벤치마크입니다. LLM 심판 없이 로컬 환경에서 모델의 컨텍스트 관리 전략과 정보 유지 능력을 객관적으로 평가할 수 있도록 설계되었습니다.

LiquidAI의 초소형 모델 LFM2.5-2.6B에 대한 양자화 성능 분석 보고서입니다. 다양한 GGUF 및 KV 캐시 양자화 조합을 통해 메모리 제한 환경에서의 성능 저하를 실험적으로 검증했습니다.
Gemma 4 26b QAT 모델과 최신 Q4_K 양자화 모델을 비교 분석한 결과입니다. QAT가 메모리 효율은 높지만, 정밀도가 중요한 코드 생성 및 창의적 글쓰기 분야에서는 Q4_K 방식보다 성능 퇴보가 발생할 수 있음을 지적합니다.

EschaLabs의 Qwen3.6-35B-A3B-Escha-W2 모델에 대한 벤치마크 분석 결과입니다. 낮은 양자화(W2)를 사용했음에도 불구하고 높은 추론 속도와 뛰어난 성능을 유지하며, 특히 VRAM 효율성이 매우 높음을 확인했습니다.

Scotoma-2는 Gemma4를 기반으로 하며, 특정 클리셰(예: 'It's not x, it's y')와 과도한 어시스턴트 페르소나 습관을 줄여 문장력을 개선한 모델입니다. 제작자는 DPO(Direct Preference Optimization) 방식으로 4개의 별도 데이터셋을 구축하여 Gemma4의 고유한 문제점을 타겟팅했습니다.

BeeLlama.cpp v0.4.0을 사용하여 Qwen 3.6 27B 및 Gemma 4 31B 모델의 KV 캐시 양자화 성능을 벤치마크한 결과입니다. KVarN 및 Precision Tail 기법을 포함한 다양한 양자화 옵션의 메모리 절감 효과와 품질(KLD)을 분석했습니다.

NVIDIA가 문서 이미지를 구조화된 텍스트와 레이아웃 정보로 변환하는 Nemotron Parse 2.0 모델을 공개했습니다. 차트 인식 기능과 다국어 지원이 강화되었으며, RAG 및 데이터 추출 워크플로우에 최적화되어 있습니다.
1,001개의 노트를 활용해 32개의 로컬 모델을 대상으로 사실 추출 성능을 직접 비교 테스트한 결과입니다. 대부분의 모델 간 성능 차이가 통계적으로 유의미하지 않았으나, LFM2.5 모델은 크기가 더 작은 모델들에게 성능이 뒤처지는 예외적인 결과를 보였습니다.
Qwen3.8-Max(Qwen3.8-2.4T-A95B) 모델이 다음 주 수요일에 오픈 출시될 예정입니다.

기존 벤치마크의 무작위 데이터 사용 문제를 해결하기 위해 개발된 BetterBench를 소개합니다. 콘텐츠 유형에 따른 성능 편차를 줄이고 일관성을 1% 이내로 유지하며 정확한 PP 및 TPS 측정을 지원합니다.
Xiaomi-Robotics-1은 10만 시간 이상의 조작 데이터를 학습한 로봇 파운데이션 모델입니다. VLM과 DiT를 결합한 2단계 학습 패러다임을 통해 미지의 환경에서도 효율적인 모바일 조작과 작업 적응력을 보여줍니다.
Gemma 모델을 기반으로 표준 잔차 스트림을 어텐션 기반 라우팅 메커니즘인 AttnRes로 교체하는 연구 프로젝트를 소개합니다. 지식 증류(distillation)와 데이터 다양성 확보를 통해 모델의 성능과 매니폴드를 보존하는 전략을 다룹니다.
Liquid AI의 LFM2.5 2.6B 모델을 llama.cpp를 통해 도구 호출 및 코딩 성능을 테스트했습니다. M5 Pro 환경에서 높은 추론 속도를 기록했으나, 도구 호출 및 OpenCode 작업에서는 경쟁 모델 대비 성능이 낮게 나타났습니다.

Ling-3.0-flash MXFP4 모델이 출시되었으며, DGX Spark 1대 환경에서 로컬 실행이 가능함을 안내합니다.

Qwen 개발팀의 AMA를 통해 곧 출시될 27B 모델의 성능과 비디오 이해 기술에 대한 정보를 공유합니다. 27B 모델은 완전히 새로운 역량을 갖출 예정이며, 계층적 비디오 메모리 시스템을 통해 장시간의 비디오 추론을 지원합니다.
GPT-OSS 출시 1주년을 맞아 20B 및 120B 모델의 성능을 분석합니다. Qwen 3.5 및 Nemotron 3 Super와 비교하여 GPT-OSS 120B의 속도와 로컬 친화적 형식(MXFP4)의 우수성을 강조합니다.
Qwen 3.8 Max 모델이 Debate Benchmark에서 이전 버전인 Qwen 3.7 Max보다 향상된 성능을 기록했습니다. 이 벤치마크는 LLM이 다회차 토론 환경에서 논리적 일관성과 사실 관계를 얼마나 잘 유지하는지 측정합니다.

DeepSeek v4 Flash, Qwen 시리즈, Gemma 4 31B 모델을 대상으로 에이전트 기반 코딩 벤치마크를 수행한 결과입니다. 모델별 추론 노력(Reasoning efforts)에 따른 성공률, 디프(Diff) 품질, 토큰 소비량 및 비용 효율성을 상세히 비교 분석했습니다.