Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Qwythos-9B-v2는 기존 모델의 반복(looping) 문제를 FTPO 기술로 해결한 개선된 GGUF 모델입니다. 심층 사고 체인(CoT) 능력을 유지하면서도 탐욕적 디코딩 시의 퇴화 현상을 0%로 낮추었으며, MTP 지원을 통해 추론 효율을 높였습니다.

1,310만 개의 파라미터를 가진 Conformer 모델을 ESP32-S3 마이크로컨트롤러에서 실행하기 위해 증류 및 양자화 기술을 적용한 프로젝트입니다. 모델 크기를 14MB 플래시 메모리 수준으로 줄여 저가형 하드웨어에서도 오디오 전사가 가능하도록 최적화했습니다.

llama.cpp를 활용하여 GStreamer 내에서 로컬 LLM을 통해 텍스트를 번역 및 변환할 수 있는 플러그인을 소개합니다. Whisper 플러그인과 결합하면 자동 자막 생성 및 번역이 가능하며, 미디어 플레이어나 화상 회의 소프트웨어에 통합하기 용이합니다.
DWARF 아키텍처를 기반으로 한 최초의 모델인 DWARF-55M-Base를 공개합니다. 이 모델은 동적 희소 쿼리-게더(DSQG) 레이어를 활용하여 컨텍스트 길이에 관계없이 KV-캐시 대역폭과 어텐션 연산량을 O(1) 수준으로 유지하는 혁신적인 희소 어텐션 구조를 제안합니다.
저사양 홈랩 환경에서 Qwen3.6-35B 모델을 활용한 로컬 에이전트가 수학적 난제인 Jacobian 추측에 대한 반증 가능성을 탐색한 사례입니다. 에이전트는 14개의 파이썬 코드를 자율적으로 작성 및 실행하며 복잡한 수학적 계산을 수행했습니다.
KVarN 논문의 기술을 Bonsai 런타임에 포팅하여 27B 모델을 10GB 미만의 VRAM으로 120K 컨텍스트에서 실행하는 방법을 소개합니다. KV 캐시 양자화를 통해 속도는 68% 향상시키고 VRAM 사용량은 획기적으로 줄였습니다.

Qwen 3.8 Max Preview가 Minimax M3 및 GPT 5.6 시리즈와 비교했을 때 입력 토큰 사용 측면에서 훨씬 효율적임을 분석합니다. Qwen은 불필요한 서브 에이전트 생성이나 과도한 파일 읽기를 지양하고 체계적인 분석을 수행하여 비용 효율성을 높였습니다.
Prism Bonsai 27B 모델을 실행하기 위한 llama.cpp 컴파일 및 설정 방법을 설명합니다. Mac의 Metal 환경과 CUDA 환경에 맞춘 빌드 명령어와 huggingface-cli를 활용한 모델 다운로드 과정을 다룹니다.
RTX 5090 단일 GPU 환경에서 Qwen3.6 모델의 추론 속도를 극대화하기 위해 설계된 커스텀 C++/CUDA 엔진 NInfer를 공개했습니다. 커스텀 양자화와 커널 최적화 등을 통해 65K 토큰 디코딩 시 543 tok/s라는 압도적인 성능을 달성했습니다.

Unsloth가 AMD 하드웨어를 공식 지원하며 로컬 추론, 미세 조정, 강화학습 및 배포가 가능해졌습니다. Radeon, Instinct GPU 및 AMD CPU를 지원하며 VRAM 사용량을 획기적으로 절감할 수 있습니다.
Apple Silicon 환경에서 Diffusion LLM(LLaDA2.1 & Sumi)의 성능 최적화를 위한 다양한 실험 결과를 공유합니다. 양자화 레이아웃, KV 캐시 재사용, 멀티 블록 언마스킹 및 자동 추측 기법을 M1 및 M2 Ultra 플랫폼에서 테스트했습니다.
OvisOCR2는 Qwen3.5-0.8B를 기반으로 한 엔드투엔드 문서 파싱 VLM으로, OmniDocBench v1.6에서 1위를 기록했습니다. 기존 파이프라인 방식과 달리 레이아웃 탐지 단계 없이 단일 모델로 마크다운 형식을 생성하여 높은 정확도와 효율성을 보여줍니다.
Bonsai-27B 및 Ternary-Bonsai-27B 모델의 llama.cpp 및 MLX 백엔드 지원 현황을 업데이트합니다. Binary Q1_0 및 Ternary 지원을 위한 다양한 백엔드(CPU, Metal, CUDA, Vulkan)의 마이그레이션 상태와 향후 GGUF 파일 형식 변경 계획을 다룹니다.

Trellis.cpp에 사용 편의성을 높인 Studio 기능이 추가되었습니다. 이제 사용자는 복잡한 커맨드 라인 조작 없이도 백엔드 자동 선택, 가중치 자동 다운로드, Three.js 기반의 3D 에셋 프리뷰 기능을 활용할 수 있습니다.

Grok 4.5 기반의 자율 AI 에이전트 Neo를 활용하여 Parakeet CPU ASR 모델의 성능을 최적화한 사례입니다. 자동화된 연구 루프를 통해 인코더의 정적 QDQ MinMax 방식을 찾아냈으며, 결과적으로 STT 처리량을 약 2.1배 향상시켰습니다.
API 속도 제한(Rate Limit) 문제를 해결하기 위해 에이전트를 일시 중단하고 체크포인트를 통해 재개하는 'agentpause' 라이브러리를 소개합니다. KV-cache를 활용한 웜 스타트 방식과 컨텍스트 관리 전략을 통해 재시작 시 발생하는 비용과 시간을 획기적으로 단축할 수 있습니다.
동일한 베이스 모델을 기반으로 한 여러 파인튜닝 체크포인트의 용량을 획기적으로 줄여주는 'deltatensors' 라이브러리를 소개합니다. 베이스 모델과의 가중치 차이(diff)를 계산하고 양자화하여, 모델 품질을 유지하면서도 저장 공간을 약 1/4 수준으로 압축합니다.

4개국 14대의 소비자용 Mac을 활용하여 인터넷을 통해 분산된 환경에서 RL 사후 학습(Post-training)을 성공적으로 수행한 사례를 소개합니다. MLX를 통한 int8 추론과 B200을 이용한 bf16 업데이트를 결합하여 데이터 센터 간 연결 없이도 효율적인 학습이 가능함을 입증했습니다.

지속적인 오디오 입력과 이벤트 기반 인식을 통해 LLM 에이전트의 청각 능력을 확장하는 오픈 소스 프레임워크를 소개합니다. CLAP, Whisper, sqlite-vec 등을 활용하여 로컬에서 실행되며, 사용을 통해 새로운 개념을 학습하고 메모리를 확장하는 구조를 가집니다.

Kimi K2 라인업의 4개 모델을 대상으로 에이전트 기반 버그 수정 능력을 비교 실험했습니다. 모델이 최신일수록 테스트 결과 시뮬레이션의 정확도가 높아지며, 특히 K2.7 Code 모델이 환각 없이 가장 안정적인 성능을 보였습니다.