Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Qwen3.8-Max(Qwen3.8-2.4T-A95B) 모델이 다음 주 수요일에 오픈 출시될 예정입니다.

기존 벤치마크의 무작위 데이터 사용 문제를 해결하기 위해 개발된 BetterBench를 소개합니다. 콘텐츠 유형에 따른 성능 편차를 줄이고 일관성을 1% 이내로 유지하며 정확한 PP 및 TPS 측정을 지원합니다.
MTP(Multi-Token Prediction) 기술이 긴 컨텍스트 환경에서 초안 수락률 1.000을 달성하며 성능 향상을 입증했습니다. 로그 데이터에 따르면 토큰 처리량과 유사도 기반 슬롯 선택을 통해 효율적인 추론이 이루어지고 있습니다.

Prime Agent는 코딩 및 장기적 자율 작업을 위해 설계된 오픈 소스 자기 개선형 RLM 하네스입니다. 도구 호출과 멀티 에이전트 메시징을 통해 토큰 효율성을 높였으며, ARC-AGI-3 벤치마크에서 인간 전문가 수준의 성능을 입증했습니다.
AI 에이전트 설계 시 모델이 인자를 임의로 생성(Hallucination)하지 않도록, 인자의 출처를 추적하는 조회(Lookup) 기반 아키텍처를 제안합니다. 데이터의 출처 체인을 통해 검증하고, 불확실한 정보는 '알 수 없음'으로 처리하여 사용자에게 질문하도록 유도하는 것이 핵심입니다.
Xiaomi-Robotics-1은 10만 시간 이상의 조작 데이터를 학습한 로봇 파운데이션 모델입니다. VLM과 DiT를 결합한 2단계 학습 패러다임을 통해 미지의 환경에서도 효율적인 모바일 조작과 작업 적응력을 보여줍니다.
Gemma 모델을 기반으로 표준 잔차 스트림을 어텐션 기반 라우팅 메커니즘인 AttnRes로 교체하는 연구 프로젝트를 소개합니다. 지식 증류(distillation)와 데이터 다양성 확보를 통해 모델의 성능과 매니폴드를 보존하는 전략을 다룹니다.

LangGraph 기반의 GraphARC는 로컬 LLM을 사용하여 복잡한 조사 과정을 그래프 구조로 변환하고 실행하는 에이전트 프레임워크입니다. 결정론적 승인 게이트를 통해 모델의 제안을 검토하고, 정책에 따른 거절(refusal) 메커니즘을 활용하여 안전하고 통제된 실행을 보장합니다.
MacBook M5 Pro 64GB 환경에서 SSD 스트리밍 기술을 활용하여 DeepSeek V4 Flash 0731 모델을 구동한 결과, 초당 10~17 토큰의 속도를 달성했습니다.

B200 GPU를 위한 faster megakernel을 통해 MoE(Mixture of Experts) 학습 속도를 약 40% 가속화할 수 있는 오픈 소스 기술이 공개되었습니다. 순전파(forward) 단계에서 최대 140%의 성능 향상을 주장하며, Apache 2.0 라이선스로 제공됩니다.

Scenema Audio가 ComfyUI용 네이티브 커스텀 노드로 출시되었습니다. 8GB VRAM에서도 실행 가능하도록 양자화되었으며, 제로샷 음성 복제와 감정 표현이 가능한 TTS 기능을 제공합니다.
Liquid AI의 LFM2.5 2.6B 모델을 llama.cpp를 통해 도구 호출 및 코딩 성능을 테스트했습니다. M5 Pro 환경에서 높은 추론 속도를 기록했으나, 도구 호출 및 OpenCode 작업에서는 경쟁 모델 대비 성능이 낮게 나타났습니다.

Mference 프로젝트를 통해 Inkling-Small 276B-A12B와 같은 대규모 MoE 모델을 10GB 미만의 메모리 환경에서 구동하는 방법을 소개합니다. Swift와 Metal 기반으로 제작되어 Mac 하드웨어에 최적화되었으며, 소비자급 기기에서의 대형 모델 실행을 목표로 합니다.

3x3090 및 DDR5 환경에서 1MM 컨텍스트 손실 없이 300PP를 달성한 기술적 성과를 다룹니다. llama.cpp 커스텀 빌드와 MoE 전문가 오프로드 방식을 통해 대규모 컨텍스트 처리 성능을 최적화했습니다.

llama.cpp 실행 시 API 키를 설정하지 않고 --tools 또는 -ag 옵션을 사용할 경우 원격 코드 실행(RCE) 취약점이 발생할 수 있습니다. 에이전트 설정과 보안 구성을 반드시 점검해야 합니다.

Ling-3.0-flash MXFP4 모델이 출시되었으며, DGX Spark 1대 환경에서 로컬 실행이 가능함을 안내합니다.

TensorSharp의 MoE CPU-offload 기능이 메인 브랜치에 병합되었습니다. 이 기능은 MoE 모델의 전문가 가중치를 시스템 RAM에 유지하여 저사양 GPU에서도 대규모 모델을 실행할 수 있게 하며, llama.cpp 대비 우수한 성능을 보여줍니다.
llama.cpp와 DSpark를 활용하여 Spark GB10 환경에서 DeepSeek-V4-Flash 모델의 추론 성능을 최적화하는 가이드입니다. 특정 NVIDIA 드라이버 및 CUDA 설정, 펌웨어 업데이트를 통해 코드 생성 시 최대 33 tok/s의 속도를 달성하는 방법을 다룹니다.

Qwen 개발팀의 AMA를 통해 곧 출시될 27B 모델의 성능과 비디오 이해 기술에 대한 정보를 공유합니다. 27B 모델은 완전히 새로운 역량을 갖출 예정이며, 계층적 비디오 메모리 시스템을 통해 장시간의 비디오 추론을 지원합니다.

Kokoro 82M, Qwen, llama.cpp를 활용하여 모든 기능을 로컬에서 실행하는 PDF/EPUB 전용 데스크톱 앱 Speechfony를 소개합니다. 클라우드 연결 없이 온디바이스 임베딩과 TTS를 통해 보안성이 높고 오프라인 작동이 가능한 오디오북 제작 환경을 제공합니다.