Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Glint Research에서 공개한 10,000 파라미터 규모의 초소형 언어 모델 Glimmer-1을 소개합니다. FineWeb-Edu 데이터셋 500K 토큰을 사용하여 학습되었으며, 표준 Llama 아키텍처를 기반으로 합니다.
VibeThinker-1.5B를 3B 규모로 확장하여 수학 및 코딩 분야에서 프론티어급 성능을 달리는 모델을 공개했습니다. 소형 모델(SLM)이 검증 가능한 추론 영역에서 스케일링 법칙을 보완할 수 있음을 입증했습니다.
Weibo AI가 출시한 VibeThinker-3B는 소규모 모델임에도 불구하고 AIME 2026에서 94.3점을 기록하며 거대 모델과 대등한 성능을 보였습니다. 초최적화된 학습 파이프라인을 통해 수학과 코딩 분야에서 압도적인 벤치마크 수치를 증명했습니다.
Qwen이나 Claude의 데이터를 활용한 소규모 증류(Distillation) 모델들이 베이스 모델보다 성능이 낮을 수 있음을 경고합니다. 충분한 데이터 없이 진행된 미세 조정은 성능 개선보다는 환각 현상이나 일관성 저하를 초래할 위험이 큽니다.
Qwen3-8B 모델을 기반으로 파인튜닝된 MechaEpstein8000 모델에 대한 소개입니다. 해당 모델의 구체적인 추론 설정값(Temperature, Top P 등)을 포함하고 있습니다.
Anthropic의 Claude Fable-5 모델을 증류하여 개발한 오픈 웨이트 모델 Qwable-v1이 공개되었습니다. Qwen3.6-35B를 기반으로 하며, Fable-5의 에이전트 코딩 흔적을 학습하여 도구 호출 능력을 갖추고 있습니다.
Tower-Plus-72B-Ultra-Uncensored-Heretic 모델이 공개되었습니다. 이 모델은 다국어 작업과 검열이 없는 번역 작업에 최적화되어 있으며, 원본 모델의 작문 품질과 다국어 능력을 향상시킨 것이 특징입니다.
Gemma 4 모델의 QAT(양자화 인식 학습)를 적용한 GGUF 파일 생성 프로세스와 그 결과에 대해 설명합니다. 오차를 최소화하기 위해 F32 정밀도를 사용하여 대칭/비대칭 양자화를 결정하는 새로운 패치 방식을 제안합니다.
Qwen-3.6-27B와 Gemma-4-31B 모델의 테스트 시간 연산(test-time compute)을 확장하여 코드 최적화 성능을 높이는 새로운 스캐폴드 연구를 소개합니다. 반복적인 브랜치 탐색과 솔루션 풀을 통해 모델이 로컬 미니마에 빠지지 않고 최적의 알고리즘을 찾도록 설계되었습니다.
Zyphra가 8B 파라미터 규모의 차세대 실시간 TTS 모델인 ZONOS2를 오픈 소스로 공개했습니다. Sparse MoE 구조를 통해 높은 품질과 빠른 속도를 동시에 달성하며, 뛰어난 음성 복제 성능을 제공합니다.
LLM 접근성 제한에 대비하여 오픈 모델을 안전하게 배포하기 위한 탈중앙화된 모델 공유 방식을 제안합니다. 원본 베이스 모델의 우선적 유통과 다운로드 크기 최적화를 통한 커뮤니티 참여 유도를 핵심으로 합니다.
GLM 5.2 모델의 출시 소식과 함께 원샷(One-shot) 프롬프팅을 통한 Pac-Man 게임 구현 테스트 결과를 공유합니다. 모델의 추론 능력과 코드 생성 성능을 분석하며, 미세한 버그는 후속 프롬프트로 쉽게 해결 가능함을 보여줍니다.
SupraLabs가 컨텍스트 윈도우가 5배 확장된 Supra-1.5-50M 모델 제품군을 출시했습니다. Base, Instruct, GGUF 버전을 포함하며, 지속적 사전 학습을 통해 성능을 개선한 실험적 모델입니다.
Llama 3.2, Phi-4, Qwen3, Gemma 4 등 소형 LLM을 대상으로 에이전트 루프 내 성능을 벤치마킹한 결과, 루프 횟수를 2회로 제한했을 때 성능이 오히려 향상됨을 발견했습니다. 소형 모델이 반복적인 자기 수정 과정에서 기존의 올바른 코드를 망가뜨리는 '자기 파괴 현상'이 주요 원인으로 분석되었습니다.
양자화 과정에서 발생하는 스케일(scale) 값의 중복성을 활용하여 저장 공간을 절약하는 새로운 아이디어를 제안합니다. 스케일 값 자체 대신 인덱스를 저장함으로써 Qwen 3.6 27B 모델 기준 약 318MB의 용량을 줄일 수 있습니다.
2026년 6월 기준 최신 로컬 VLM(Vision Language Model)들의 성능을 벤치마크한 결과입니다. Qwen3-VL 4B가 속도 면에서 우수했으며, 다양한 모델의 아키텍처와 실행 환경을 비교 분석했습니다.
GPTQ 양자화 과정에서 가중치 손실을 보상하기 위해 주변 가중치를 업데이트하는 수학적 원리를 상세히 분석합니다. 역 헤시안(Inverse Hessian)과 라그랑주 승수법을 사용하여 업데이트 규칙을 유도하고, 이를 PyTorch 코드로 구현하는 과정을 다룹니다.
Cohere에서 30B 파라미터 규모의 코딩 특화 모델인 North Mini Code 1.0을 출시했습니다. 이 모델은 특정 코딩 인덱스에서 Gemma 4 26B보다 높은 경쟁력을 보여줍니다.

DeepSeek-V4 기반의 FlashMemory-DeepSeek-V4는 Lookahead Sparse Attention(LSA)을 통해 초장기 컨텍스트 서빙 시 발생하는 GPU 메모리 병목을 해결합니다. 분리형 학습 전략을 사용하여 백본 모델 없이도 인덱서를 독립적으로 학습할 수 있으며, KV 캐시 점유율을 획기적으로 낮추면서 성능을 유지합니다.
Google DeepMind가 개발한 DiffusionGemma 26B A4B IT는 이산 확산 방식을 사용하는 오픈 웨이트 멀티모달 모델입니다. MoE 아키텍처와 양자화 기술을 통해 고속 멀티모달 텍스트 생성을 지원하며, 다양한 언어와 복잡한 추론 작업을 수행할 수 있습니다.