Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
저사양 RTX 4050 노트북 환경에서 1.56TB 규모의 거대 MoE 모델을 실행하기 위한 벤치마크 결과입니다. 메모리 부족 문제를 해결하기 위해 밀집 가중치를 SSD에서 직접 스트리밍하는 패치된 엔진을 사용하였으며, 극심한 디스크 I/O 병목 현상을 확인했습니다.
Google이 Gemini Enterprise Agent Platform에 대형 모델의 추론을 활용해 소형 모델을 학습시키는 증류(Distillation) 기능을 추가했습니다. 수동 레이블링 없이 Gemini 3.1 Pro를 교사 모델로 사용하여 Gemini 2.5 Flash를 미세 조정할 수 있는 파이프라인을 제공합니다.
의료 NLP 스택인 OpenMed 2.0이 출시되었습니다. 279M 및 560M 파라미터의 경량 모델을 사용하여 클라우드 전송 없이 오프라인에서 개인 건강 정보(PHI)를 비식별화할 수 있습니다.
GGUF 기반 모델을 활용하여 90GiB VRAM 환경에서 DeepSeek-V4-Flash를 효율적으로 학습하는 기술적 업데이트를 소개합니다. Triton 커널 최적화를 통해 CPU 오프로딩 없이도 빠른 학습 속도를 구현했습니다.
llama.cpp의 최신 업데이트를 통해 Mamba-2 가속을 위한 ggml-cuda의 chunked SSD matmul 추가 및 Metal 백엔드용 FWHT 커널이 도입되었습니다. 또한 GPT-OSS 모델을 위한 Eagle3-v3 지원과 다양한 버그 수정이 포함되었습니다.

OS나 커널 없이 Rust로 작성된 UEFI 앱만으로 USB 스틱에서 로컬 LLM을 직접 부팅하는 기술을 소개합니다. Llama 3.2, Qwen3 등 표준 GGUF 모델을 지원하며 Raspberry Pi 5에서도 구동 가능합니다.

DSpark를 활용한 추측적 디코딩(Speculative Decoding) 실험 및 관련 모델 사례를 소개합니다. DeepSeek-V4 및 Bonsai 모델 등에 적용된 DSpark의 성능 개선 효과를 확인하고 공유할 것을 권장합니다.

Ami는 사용자의 작업 스타일과 커뮤니케이션 방식을 학습하는 로컬 우선 오픈 소스 에이전트입니다. 그래프 메모리를 활용해 앱, 데이터, 도구 간의 복잡한 업무를 자율적으로 수행하며 개인화된 코파일럿 역할을 합니다.
LLM 에이전트가 bash 명령어를 안전하게 실행할 수 있도록 돕는 로컬 Python 샌드박스 도구인 Vivarium을 소개합니다. E2B의 대안으로 설계되었으며, 단일 사용자 환경에서 에이전트의 코드 실행을 격리하여 안전하게 관리할 수 있습니다.
llama.cpp 사용 시 특정 GGUF 파일의 채팅 템플릿 동작 오류로 인해 코딩 에이전트의 성능이 저하되는 문제가 발생했습니다. 이를 해결하기 위해 DeepSeek-V4용 jinja 템플릿 파일을 직접 지정하는 방법이 권장됩니다.
양자화 과정에서 가중치 그룹별 중요도를 KL 발산(KL divergence)을 통해 수치로 측정하는 자동화 도구를 개발했습니다. 이를 통해 Qwen3.6-27B 모델을 성능과 압축률의 균형에 따라 세 가지 버전(Bedrock, Tightrope, Gambit)으로 제작했습니다.

VibeVoice-ASR-BitNet은 엣지 CPU에서 실시간 추론이 가능하도록 최적화된 ASR 모델입니다. 이질적 양자화를 통해 모델 크기를 약 1/3로 압축했으며, Whisper.cpp 대비 최대 2.3배 빠른 성능을 보여줍니다.
AI 코딩 에이전트가 세션마다 컨텍스트를 잃고 계획에서 벗어나는 문제를 해결하기 위한 로컬 도구 Cairn을 소개합니다. Cairn은 프로젝트 지도와 설계도를 작성하여 에이전트가 일관된 결정을 유지하도록 돕습니다.
Qwen 3.6 27B 모델의 KV 캐시 및 양자화 설정을 변경하여 에이전트의 성능을 개선한 사례를 공유합니다. IQ4_NL에서 Q4_M 양자화로 전환한 결과, 메모리 점유율은 비슷하면서도 도구 사용 능력과 지침 준수 능력이 크게 향상되었습니다.

Mac의 MLX 프레임워크를 활용하여 로컬 LLM이 실제 게임 Perfect Dark를 플레이하는 에이전트 프로젝트를 소개합니다. LLM은 상위 수준의 행동을 결정하고, 빠른 전투 레이어가 실시간 조준 및 이동을 처리하는 계층적 구조를 가집니다.

Nifer는 Qwen 3.6 35B 모델을 사용하여 단일 인스턴스에서 최대 700t/s의 압도적인 추론 속도를 구현한 도구입니다. RTX 5090에 최적화되어 설계되었으며, No thinking 모드를 통해 Cerebras 수준의 성능을 제공합니다.
Ling-3.0-flash 모델의 가중치 공개에 따른 주요 추론 엔진(SGLang, vLLM, llama.cpp)의 지원 현황을 분석합니다. SGLang은 당일 지원을 약속했으나, llama.cpp는 아키텍처 변환 문제로 인해 지원이 불투명한 상태입니다.

Unsloth가 Laguna-S-2.1 모델을 지원하는 llama.cpp 업데이트를 발표했습니다. vLLM 조합보다 빠른 속도와 높은 정확도를 제공하며, 모델의 사고 과정을 유도하기 위한 채팅 템플릿 수정 방법도 포함되었습니다.
Inflect-Nano/Micro-v2 모델을 사용자의 목소리나 특정 언어로 파인튜닝할 수 있는 새로운 툴킷이 공개되었습니다. 단일 화자 데이터와 전사 데이터를 활용해 학습을 재개하고 PyTorch 또는 ONNX 형식으로 내보낼 수 있는 워크플로우를 제공합니다.
MoE 중심 런타임인 Krasis를 사용하여 단일 RTX PRO 6000 Blackwell GPU에서 397B 규모의 Ornith 모델을 실행하는 기술을 소개합니다. CPU RAM과 GPU VRAM을 동적으로 관리하여 대규모 모델을 제한된 VRAM 환경에서도 효율적으로 구동할 수 있습니다.