Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
양자화 과정에서 가중치 그룹별 중요도를 KL 발산(KL divergence)을 통해 수치로 측정하는 자동화 도구를 개발했습니다. 이를 통해 Qwen3.6-27B 모델을 성능과 압축률의 균형에 따라 세 가지 버전(Bedrock, Tightrope, Gambit)으로 제작했습니다.

VibeVoice-ASR-BitNet은 엣지 CPU에서 실시간 추론이 가능하도록 최적화된 ASR 모델입니다. 이질적 양자화를 통해 모델 크기를 약 1/3로 압축했으며, Whisper.cpp 대비 최대 2.3배 빠른 성능을 보여줍니다.
AI 코딩 에이전트가 세션마다 컨텍스트를 잃고 계획에서 벗어나는 문제를 해결하기 위한 로컬 도구 Cairn을 소개합니다. Cairn은 프로젝트 지도와 설계도를 작성하여 에이전트가 일관된 결정을 유지하도록 돕습니다.
Qwen 3.6 27B 모델의 KV 캐시 및 양자화 설정을 변경하여 에이전트의 성능을 개선한 사례를 공유합니다. IQ4_NL에서 Q4_M 양자화로 전환한 결과, 메모리 점유율은 비슷하면서도 도구 사용 능력과 지침 준수 능력이 크게 향상되었습니다.
다양한 LLM을 대상으로 정치 성향 테스트를 실시한 결과, Grok을 포함한 대부분의 모델이 자유지상주의 좌파 성향을 보였습니다. 모델의 자기 인식과 실제 측정값 사이의 차이를 분석하며, 모델 간의 상대적인 정치적 편향성을 비교했습니다.

Kimi K3 모델을 구동하기 위해 필요한 하드웨어 자재 명세서(BoM)와 기술적 고려사항을 다룹니다. 2304GB VRAM 확보를 위한 4대의 호스트 구성과 PCIe 5.0 병목 현상, 결함 허용(fault tolerance) 문제 등을 분석합니다.

Mac의 MLX 프레임워크를 활용하여 로컬 LLM이 실제 게임 Perfect Dark를 플레이하는 에이전트 프로젝트를 소개합니다. LLM은 상위 수준의 행동을 결정하고, 빠른 전투 레이어가 실시간 조준 및 이동을 처리하는 계층적 구조를 가집니다.
실제 계량기 및 영수증 사진 32장을 활용하여 6개 비전 모델의 필드 수준 정확도를 벤치마크한 결과입니다. 실험 결과, 비용이 높은 모델이 반드시 더 높은 정확도를 보장하지는 않으며, 특정 모델들은 어려운 환경에서 높은 성능을 유지했습니다.

AMD Ryzen 7 6800H APU 환경에서 Gemma 4 및 Qwen 3.6 MoE 모델의 추론 성능을 벤치마킹했습니다. Vulkan 백엔드를 통해 iGPU와 공유 메모리(UMA)를 활용한 다양한 양자화 방식의 성능을 분석했습니다.

Nifer는 Qwen 3.6 35B 모델을 사용하여 단일 인스턴스에서 최대 700t/s의 압도적인 추론 속도를 구현한 도구입니다. RTX 5090에 최적화되어 설계되었으며, No thinking 모드를 통해 Cerebras 수준의 성능을 제공합니다.
35B 규모의 코딩 에이전트 모델 4종(Stock, Ornith, KAT-Coder 등)을 대상으로 120회 실행 비교 테스트를 진행한 결과입니다. KAT-Coder-V2.5-Dev가 가장 적은 토큰을 사용하면서도 가장 높은 통과율과 안정적인 도구 호출 성능을 보여주었습니다.
특허 문서의 복잡한 구조와 수식을 정확히 인식하기 위해 5,000만 개의 샘플로 학습된 0.3B 규모의 MOSS-OCR 모델을 공개했습니다. 이 모델은 레이아웃 탐지를 제외한 블록 레벨 인식에 집중하여 매우 작고 빠른 성능을 제공합니다.
Ling-3.0-flash 모델의 가중치 공개에 따른 주요 추론 엔진(SGLang, vLLM, llama.cpp)의 지원 현황을 분석합니다. SGLang은 당일 지원을 약속했으나, llama.cpp는 아키텍처 변환 문제로 인해 지원이 불투명한 상태입니다.
Intel Arc iGPU 환경에서 Google의 LiteRT-LM과 llama.cpp의 성능을 비교한 벤치마크 결과입니다. LiteRT-LM은 Gemma-4 E2B 모델 사용 시 llama.cpp보다 프롬프트 처리 속도에서 최대 3.5배 빠른 성능을 보여주었습니다.

Unsloth가 Laguna-S-2.1 모델을 지원하는 llama.cpp 업데이트를 발표했습니다. vLLM 조합보다 빠른 속도와 높은 정확도를 제공하며, 모델의 사고 과정을 유도하기 위한 채팅 템플릿 수정 방법도 포함되었습니다.
Inflect-Nano/Micro-v2 모델을 사용자의 목소리나 특정 언어로 파인튜닝할 수 있는 새로운 툴킷이 공개되었습니다. 단일 화자 데이터와 전사 데이터를 활용해 학습을 재개하고 PyTorch 또는 ONNX 형식으로 내보낼 수 있는 워크플로우를 제공합니다.
Moonshot의 Kimi K3 모델 가중치가 공개되었으며, 2.8T 파라미터 규모의 MoE 구조를 가집니다. A100, H200, B300 등 다양한 GPU 환경에서의 배포 및 성능 벤치마크가 진행될 예정입니다.
MoE 중심 런타임인 Krasis를 사용하여 단일 RTX PRO 6000 Blackwell GPU에서 397B 규모의 Ornith 모델을 실행하는 기술을 소개합니다. CPU RAM과 GPU VRAM을 동적으로 관리하여 대규모 모델을 제한된 VRAM 환경에서도 효율적으로 구동할 수 있습니다.
Keel-opencore는 약 15일 동안 중단 없이 자기 재귀적 반복을 수행할 수 있는 에이전트 스웜 프레임워크입니다. 실시간 검증 장치를 통해 에이전트의 탈주를 방지하며, 장기적인 자기 개선 프로세스를 안전하게 관리할 수 있도록 설계되었습니다.
FPGA의 하드웨어 제약 사항인 지수 연산 문제를 해결하기 위해 Softmax를 근사하는 방법을 다룹니다. Taylor series와 Pade approximants를 활용하여 속도와 정확도 사이의 트레이드오프를 분석합니다.