Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Nanbeige4.2-3B는 Looped Transformer 아키텍처를 사용하여 파라미터 수를 늘리지 않고도 모델 용량을 확장한 컴팩트한 에이전트 모델입니다. 3B 규모임에도 불구하고 강력한 에이전트 동작, 추론 및 정렬 능력을 갖추어 일반 및 코드 에이전트 작업에서 뛰어난 성능을 보여줍니다.

SenseNova-U1-8b-MoT-Infographic-V3 모델이 출시되었습니다. 이 모델은 텍pick 텍스트 및 콘텐츠 편집, 글로벌 스타일 및 레이아웃 편집 기능을 제공하며, T2I와 편집 기능을 공동 학습하여 높은 품질을 유지합니다.
3.5조 개의 토큰만으로 학습된 20B Looping 모델에 관한 연구 내용입니다. 기존 모델 대비 적은 토큰과 비용으로도 효율적인 사전 학습이 가능함을 시사합니다.

SWE-Pruner Pro는 코딩 에이전트의 내부 표현을 활용하여 도구 출력의 컨텍스트를 효율적으로 가지치기하는 기술입니다. 별도의 분류기 없이 에이전트 자체의 인코딩을 사용하여 토큰을 최대 39% 절약하며 작업 품질을 유지합니다.

CPU 네이티브 LLM 구축을 위한 30M 파라미터 규모의 파일럿 학습 실험 과정을 공유합니다. 삼진 양자화와 멀티 GPU 스케일링 등은 성공했으나, 서로 다른 토크나이저를 사용하는 교사 모델로부터의 지식 증류(Distillation) 실험은 교차 엔트로피 방식에 미치지 못해 실패했음을 밝힙니다.

Gemma4-12B 모델을 업사이클링하여 구축한 22.5B 파라미터 규모의 Solon-MoE 모델 아키텍처를 소개합니다. 중간 15개 레이어에만 MoE 구조를 적용한 '소시지' 형태의 독특한 설계를 통해 효율적인 전문가 배치를 구현했습니다.

8GB VRAM 환경에서 Ternary-Bonsai-27B(2-bit) 모델의 성능을 Terminal-Bench 2.0을 통해 테스트한 결과입니다. 2-bit 양자화 모델은 GPU 메모리 효율은 높으나, 기존 Qwen 모델 대비 정확도가 낮고 1-bit 모델은 에이전트 루프에서 불안정한 모습을 보였습니다.

Qwythos-9B-v2는 기존 모델의 반복(looping) 문제를 FTPO 기술로 해결한 개선된 GGUF 모델입니다. 심층 사고 체인(CoT) 능력을 유지하면서도 탐욕적 디코딩 시의 퇴화 현상을 0%로 낮추었으며, MTP 지원을 통해 추론 효율을 높였습니다.
DWARF 아키텍처를 기반으로 한 최초의 모델인 DWARF-55M-Base를 공개합니다. 이 모델은 동적 희소 쿼리-게더(DSQG) 레이어를 활용하여 컨텍스트 길이에 관계없이 KV-캐시 대역폭과 어텐션 연산량을 O(1) 수준으로 유지하는 혁신적인 희소 어텐션 구조를 제안합니다.

Qwen 3.8 Max Preview가 Minimax M3 및 GPT 5.6 시리즈와 비교했을 때 입력 토큰 사용 측면에서 훨씬 효율적임을 분석합니다. Qwen은 불필요한 서브 에이전트 생성이나 과도한 파일 읽기를 지양하고 체계적인 분석을 수행하여 비용 효율성을 높였습니다.
OvisOCR2는 Qwen3.5-0.8B를 기반으로 한 엔드투엔드 문서 파싱 VLM으로, OmniDocBench v1.6에서 1위를 기록했습니다. 기존 파이프라인 방식과 달리 레이아웃 탐지 단계 없이 단일 모델로 마크다운 형식을 생성하여 높은 정확도와 효율성을 보여줍니다.
Bonsai-27B 및 Ternary-Bonsai-27B 모델의 llama.cpp 및 MLX 백엔드 지원 현황을 업데이트합니다. Binary Q1_0 및 Ternary 지원을 위한 다양한 백엔드(CPU, Metal, CUDA, Vulkan)의 마이그레이션 상태와 향후 GGUF 파일 형식 변경 계획을 다룹니다.

4개국 14대의 소비자용 Mac을 활용하여 인터넷을 통해 분산된 환경에서 RL 사후 학습(Post-training)을 성공적으로 수행한 사례를 소개합니다. MLX를 통한 int8 추론과 B200을 이용한 bf16 업데이트를 결합하여 데이터 센터 간 연결 없이도 효율적인 학습이 가능함을 입증했습니다.
MacBook Pro 환경에서 실행 가능한 5가지 로컬 AI 모델의 성능과 RAM 사용량을 벤치마크한 결과입니다. 특히 8GB RAM 환경에서 구동되는 2-bit Bonsai-27B 모델이 높은 효율성을 보이며 종합 2위를 기록했습니다.

양자화 모델 평가 시 KLD(KL Divergence)와 Perplexity 지표가 실제 모델 품질과 일치하지 않는 '침묵 구역(Silent zone)'의 존재를 분석합니다. 특정 임계값 이하에서는 KLD가 품질 저하를 제대로 반영하지 못함을 실험적으로 증명합니다.

Transformer의 잔차 스트림을 병렬로 확장하는 xHC 아키텍처를 제안합니다. 기존 방식의 병목 현상인 정보 부족과 연산 비용 문제를 해결하여, N=16 이상의 대규모 확장에서도 효율적인 성능 향상을 달성했습니다.

MiniCPM에서 로봇의 이해와 행동을 지원하는 Embodied AI 모델 시리즈인 MiniCPM-Robot을 오픈 소스로 공개했습니다. 로봇 조작을 위한 VLA 모델과 타겟 추적 모델, 그리고 고성능 추론 프레임워크인 PhyAI를 포함합니다.
DeepSeek V4 Flash 모델의 두 가지 양자화 방식(IQ3_XXS-AS, IQ2_S)에 대한 성능 벤치마크 결과입니다. llama.cpp의 특정 포크 버전과 메인라인 빌드 간의 비교를 통해 양자화 방식에 따른 추론 속도 및 효율성을 분석했습니다.
1비트 양자화의 한계를 넘어서는 '음수 비트 양자화(NBQ)'라는 풍자적 개념을 다룬 글입니다. 위상 반전 텐서 임베딩(PITE)을 통해 VRAM을 오히려 확보한다는 역설적인 이론을 제시합니다.
LLM이 자신의 불확실성을 수치화하는 다양한 방법론을 분석합니다. 화이트박스 방식과 블랙박스 방식의 차이점을 설명하며, 텍스트 기반 신뢰도 유도 및 언어적 불확실성 활용법을 다룹니다.