Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

TokenAI가 이집트에서 개발한 첫 번째 오픈 소스 이미지 생성 모델인 Horus Lens 1.0을 출시했습니다. 이 모델은 Apache License 2.0을 따르며, 다양한 하드웨어 환경에 맞춘 5가지 양자화 버전을 제공합니다.
Gemma 4 12b QAT 모델이 도구 호출(tool calling) 및 일관성 측면에서 기존 Q5_K_L 양자화 버전보다 성능이 퇴보했다는 사용자 리뷰입니다. 모델이 도구 응답 태그를 잘못 구성하여 구조화된 함수 실행이 깨지는 기술적 결함이 지적되었습니다.

LFM2.5, Gemma 4 E2B, E4B 모델을 대상으로 대화 맥락 유지 능력을 테스트한 결과, 모델 크기가 클수록 오히려 대화 초반의 정보를 더 빨리 망각하는 경향이 발견되었습니다. 이는 모델의 아키텍처 문제라기보다 안전성 및 지시어 튜닝의 부산물로 분석됩니다.

Qwen3.6-35B-A3B 모델의 도구 호출(Tool Calling) 성능을 ByteShape와 Unsloth의 양자화 모델을 중심으로 비교 분석했습니다. 양자화 방식과 KV 캐시 설정이 성능에 미치는 영향을 실험했으며, 특히 긴 문맥 환경에서의 성능 저하를 확인했습니다.
Gemma 4 26B 모델의 다양한 양자화 방식(4-bit, 6-bit, 8-bit QAT)에 대한 성능 벤치마크 결과입니다. MMLU_PRO와 HumanEval 테스트를 통해 QAT 모델이 기존 6-bit 양자화 모델보다 성능이 낮을 수 있음을 시사합니다.
1980년부터 2013년까지의 Usenet 게시물 4억 개를 포함하는 103B 토큰 규모의 대규모 코퍼스를 구축했습니다. AI 오염이 전혀 없는 순수한 인간의 텍스트로 구성되어 모델의 미세 조정 및 도메인 학습에 최적화되어 있습니다.
Eric Hartford와 Lazarus AI가 ReAligned-Qwen3.5 모델 시리즈를 출시했습니다. 이 모델은 중국의 이데올로기적 편향과 검열, 거부 행동을 줄이기 위해 SFT와 GRPO 파이프라인을 사용하여 미세 조정되었습니다.
llama.cpp 프로젝트에 13B 규모의 빈티지 언어 모델인 talkie-1930-13b-it 지원이 추가되었습니다. 이 모델은 1931년 이전의 텍스트로 학습되어 과거의 언어 스타일을 시뮬레이션하도록 설계되었습니다.
Qwen 2.5 모델을 자기회귀(AR) 방식에서 확산(Diffusion) 방식으로 재정렬하는 open-dllm 연구를 기반으로, RTX 5090을 활용한 로컬 학습 시도를 다룹니다. QLoRA와 nvfp4를 사용하여 VRAM 한계를 극복하고 학습 효율을 높이는 실험적 과정을 기록하고 있습니다.
LLM의 추론 시간 탐색 성능을 높이기 위해 다양한 보상 함수를 예측하고 솔루션의 다양성을 확보하는 벡터 정책 최적화(VPO) 알고리즘을 제안합니다. 기존 스칼라 보상 최적화 방식의 한계를 극복하여, 테스트 시간 탐색 시 더 넓은 탐색 공간을 제공합니다.
NuExtract3는 문서 이해를 위해 설계된 4B 파라미터 규모의 비전-언어 추론 모델입니다. 구조화된 정보 추출과 이미지-마크다운 변환 기능을 결합하여 OCR 및 RAG 전처리에 최적화되어 있습니다.
LLM의 긴 문맥 추론 시 발생하는 Full Attention의 비용 문제를 해결하기 위해 RTPurbo를 제안합니다. 모델의 본질적인 희소성을 활용하여 단 수백 번의 학습 단계만으로 Full Attention 모델을 효율적인 Sparse 모델로 전이할 수 있습니다.
Qwen 모델을 활용하여 로그라이크 게임인 DCSS를 플레이하는 실험 결과입니다. MTP(Multi-Token Prediction) 버전의 도구 호출 버그를 확인했으며, 일반 Qwen 모델은 게임 플레이 및 길 찾기에서 준수한 성능을 보였습니다.
HRM 1B는 표준 베이스라인 대비 훨씬 적은 학습 토큰과 연산량을 사용하여 2~7B 규모의 모델과 경쟁하는 성능을 보여주는 베이스 모델입니다. 저자들은 학습 코드와 논문을 공개하였으며, 효율적인 사전 학습과 지시어 튜닝의 결합을 특징으로 합니다.
개인 프로젝트용 로컬 TTS 도구 선택을 돕기 위해 직접 제작한 TTS 벤치마크 프로젝트를 소개합니다. Windows와 Mac 환경에서의 테스트 결과를 제공하며, GitHub를 통해 누구나 확인하고 참여할 수 있습니다.
CPU 환경에서 Needle 26M과 Qwen3-0.6B 모델의 도구 호출(Function Calling) 성능을 비교 분석했습니다. Needle은 도구 선택 단계에서 실수가 잦지만 인자 추출이 정확한 반면, Qwen3는 호출 자체를 생략하는 경향을 보였습니다.
LongCat-Video-Avatar 1.5는 오디오 기반의 고품질 인간 비디오 생성을 위한 오픈 소스 프레임워크입니다. Whisper-Large 인코더와 DMD2 기반 증류 기술을 통해 자연스러운 입술 움직임과 빠른 추론 속도를 제공하며, 다양한 도메인에 대한 일반화 성능을 갖추었습니다.
WebVoyager 벤치마크를 통해 브라우저 에이전트의 '실행 비용(Agent Execution Tax)' 개념을 분석했습니다. 단순히 토큰당 가격이 아닌, 재시도와 낭비된 추론을 포함한 작업당 실제 비용이 모델 성능 평가의 핵심 지표임을 강조합니다.
프리필링과 디코딩 단계의 서로 다른 병목 현상과 양자화 특성을 분석한 논문을 소개합니다. 프리필링에는 W4A4 양자화를 적용해 속도를 높이되, 오류 누적에 민감한 디코딩 단계는 고정밀도를 유지하는 전략을 제안합니다.
Qwen3.5-VL을 기반으로 구축된 Marlin-2B는 비디오 내 이벤트의 '무엇'과 '언제'를 추출하는 데 특화된 2B 규모의 초소형 VLM입니다. 초 단위의 정밀한 타임스탬프와 구조화된 캡션을 생성하며, 특정 벤치마크에서 동급 최강의 성능을 보여줍니다.