Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM 배포를 탈중앙화하고 가속화하기 위해 토렌트 기술을 활용하는 llama.garden 프로젝트를 소개합니다. HTTP 웹 시드와 캐싱 API를 통해 다운로드 속도를 최적화하며, 모델의 무결성을 검증할 수 있는 구조를 제공합니다.

Hugging Face CEO는 오픈소스 AI에 대한 규제가 방어자에게 더 큰 피해를 주어 세상을 위험하게 만든다고 경고했습니다. 특히 미국의 AI 가드레일이 방어를 저해함에 따라, 자율 사이버 공격에 대응하기 위해 중국 AI 모델을 활용했다는 점을 밝혔습니다.

Intel Arc Pro b70 그래픽 카드의 3D 모델링 데이터와 이를 활용한 하드웨어 구성 사례를 소개합니다. 사용자가 직접 캘리퍼스로 측정하여 FreeCAD 및 STL 형식으로 설계한 모델을 공유합니다.

SWE-Pruner Pro는 코딩 에이전트의 내부 표현을 활용하여 도구 출력의 컨텍스트를 효율적으로 가지치기하는 기술입니다. 별도의 분류기 없이 에이전트 자체의 인코딩을 사용하여 토큰을 최대 39% 절약하며 작업 품질을 유지합니다.

CPU 네이티브 LLM 구축을 위한 30M 파라미터 규모의 파일럿 학습 실험 과정을 공유합니다. 삼진 양자화와 멀티 GPU 스케일링 등은 성공했으나, 서로 다른 토크나이저를 사용하는 교사 모델로부터의 지식 증류(Distillation) 실험은 교차 엔트로피 방식에 미치지 못해 실패했음을 밝힙니다.
GGUF 포맷을 활용하여 16GB VRAM 환경에서 Qwen3.6-35B-A3B 모델을 LoRA로 학습하는 방법을 소개합니다. APEX 양자화와 전용 커널을 통해 CPU 오프로딩 없이 효율적인 학습이 가능함을 보여줍니다.

Gemma4-12B 모델을 업사이클링하여 구축한 22.5B 파라미터 규모의 Solon-MoE 모델 아키텍처를 소개합니다. 중간 15개 레이어에만 MoE 구조를 적용한 '소시지' 형태의 독특한 설계를 통해 효율적인 전문가 배치를 구현했습니다.

디스크 저장 방식 최적화를 통해 ML 모델 학습 파이프라인의 속도를 약 30% 개선한 사례를 공유합니다. 작은 파일들을 TAR나 WebDataset 같은 블롭(blobs) 형태로 묶어 순차적 읽기를 유도함으로써 HDD의 성능 한계를 극복하는 방법을 다룹니다.

vLLM과 SGLang 환경에서 Qwen3.6-27B 모델을 대상으로 다양한 Speculative Decoding 기법의 성능을 비교 분석했습니다. 실험 결과 DFlash 방식이 가장 압도적인 속도 향상을 보였으며, EAGLE3와 MTP 등 각 기법별 특이점을 확인했습니다.

Motif-Technologies가 Motif 3 Beta 모델을 출시했습니다. 이는 한국 정부가 추진하는 K-AI 파운데이션 모델 프로젝트의 일환으로, 정부는 2027년까지 4개 기업에 총 5,300억 원을 투자할 계획입니다.

2x5060 Ti 환경에서 vLLM을 사용하여 nvfp4 데이터 타입을 활용한 KV-cache 구현 사례를 소개합니다. 특정 모델과 환경 설정을 통해 메모리 효율을 높이고 추론 성능을 최적화하는 구체적인 실행 구성을 다룹니다.

8GB VRAM 환경에서 Ternary-Bonsai-27B(2-bit) 모델의 성능을 Terminal-Bench 2.0을 통해 테스트한 결과입니다. 2-bit 양자화 모델은 GPU 메모리 효율은 높으나, 기존 Qwen 모델 대비 정확도가 낮고 1-bit 모델은 에이전트 루프에서 불안정한 모습을 보였습니다.

PrismML의 Bonsai 8B와 같은 진정한 sub-2-bit 삼진(Ternary) 모델을 Metal 환경에서 파인튜닝하는 방법을 다룹니다. 기존 양자화 방식과 달리 네이티브 삼진 모델의 특성을 이해하고, Straight-through estimator를 활용한 양자화 인식 학습(QAT) 과정을 설명합니다.
llama.cpp 환경에서 OSCAR2 KV Cache 기술의 성능을 벤치마크한 결과입니다. NVIDIA RTX 5090 하드웨어를 사용하여 Qwen3 모델 시리즈의 생성 속도를 테스트했습니다.
Dual 3090 환경에서 Gemma 4 31B 모델을 구동할 때, MTP(Multi-Token Prediction) 사용 시 오히려 TPS가 저하되는 현상을 분석합니다. 단일 3090 환경과 달리 텐서 병렬화 환경에서는 MTP 적용 시 성능이 불안정해지는 특이점을 보고합니다.

llama.cpp의 포크 버전인 BeeLlama v0.4.0이 출시되었습니다. KVarN 양자화와 KV 캐시 정밀도 테일(Precision Tail) 기술을 통해 VRAM 사용량을 최소화하면서도 모델의 추론 정밀도를 크게 개선했습니다.
Mac Studio 환경에서 Qwen3.5-122B 모델을 실행할 때 발생하는 긴 문맥 프리필 지연 문제를 해결하기 위한 3가지 버그 수정 사례를 공유합니다. qMLX 포크를 통해 KV 캐시 매칭, 중단 경로, 체크포인트 오염 문제를 해결하여 프리필 시간을 분 단위에서 초 단위로 단축했습니다.

Molt는 수백 B 규모의 MoE 모델을 위한 PyTorch 네이티브 RL 사후 학습 프레임워크입니다. 약 9,000라인의 간결한 코드로 구성되어 연구자가 빠르게 실험할 수 있으며, Ray, vLLM, FSDP2를 활용해 대규모 모델 학습을 지원합니다.
Spiritbuun의 llama.cpp 포크에 도입된 VBR(Variable Bit Rate) KV 캐시 기술을 소개합니다. VRAM 예산에 맞춰 컨텍스트 길이에 따라 KV 캐시의 양자화 계층을 동적으로 조절하여 효율적인 메모리 관리를 지원합니다.

Qwythos-9B-v2는 기존 모델의 반복(looping) 문제를 FTPO 기술로 해결한 개선된 GGUF 모델입니다. 심층 사고 체인(CoT) 능력을 유지하면서도 탐욕적 디코딩 시의 퇴화 현상을 0%로 낮추었으며, MTP 지원을 통해 추론 효율을 높였습니다.