Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
CLI 에이전트형 하네스의 성능을 평가하기 위해 직접 구축한 개인용 평가 생성 도구인 eval-harness를 소개합니다. 모델 자체의 성능뿐만 아니라 에이전트가 도구와 상호작용하며 작업을 수행하는 능력을 검증하는 데 중점을 둡니다.
SupraLabs에서 51M 파라미터 규모의 초소형 프롬프트 라우팅 모델인 Supra-Router-51M을 출시했습니다. 이 모델은 사용자 요청을 적절한 크기의 LLM으로 전달하여 저지연 환경을 구현하며, 학습에 사용된 데이터셋도 함께 공개되었습니다.
Qwen 3.6 27B 모델을 대상으로 vLLM 환경에서 다양한 양자화 방식(BF16, FP8, NVFP4)의 성능을 벤치마크한 결과입니다. NVFP4는 속도가 매우 빠르지만 루핑 문제가 발생하며, FP8이 성능과 안정성 측면에서 가장 적절한 선택으로 분석되었습니다.
32GB VRAM 환경에서 Qwen2.5-27B Q8 양자화 모델을 사용하여 100K 컨텍스트 길이를 확보하기 위한 실험적 시도를 다룹니다. KV 캐시 양자화와 특정 옵션 설정을 통해 제한된 메모리 내에서 컨텍스트 길이를 극대화하는 방법을 공유합니다.
에이전트의 작업 메모리 형식을 Markdown에서 TOON(Token-Oriented Object Notation)으로 전환하여 성능을 측정한 결과입니다. TOON은 기존 JSON 방식 대비 토큰 효율성을 크게 높여, 제한된 컨텍스트 예산 내에서 더 정확한 추론을 가능하게 합니다.
DeepSeek V4 모델을 지원하기 위해 llama.cpp의 DeepSeek V4 브랜치에 양자화된 KV 캐시(Quantized KV Cache) 수정 사항이 병합되었습니다. 이번 업데이트는 모델의 효율적인 추론을 위한 최적화 작업을 포함하며, 다양한 정밀도에서의 퍼플렉서티(Perplexity) 테스트 결과가 공유되었습니다.
9800X3D와 RTX 5090 환경에서 llama.cpp를 활용해 Qwen3.6 27B 모델의 추론 성능을 최적화한 결과입니다. MTP 및 KV 캐시 설정을 튜닝하여 샘플 토큰/s 분포를 분석하고 실제 구동 성능을 공유합니다.
Gemma 4 모델 업스케일링 시 모델 성능 유지를 위해 layer_scalar 값을 비례적으로 조정해야 함을 설명합니다. 레이어 복제 횟수에 따라 곱셈 방식의 스칼라 값을 계산하는 공식을 제시합니다.
KV 캐시 양자화 수준을 Q8에서 Q5로 낮추었을 때 품질 저하를 거의 느끼지 못하면서도 컨텍스트 길이를 크게 확장할 수 있음을 확인했습니다. 이는 동일한 VRAM 내에서 더 많은 토큰을 처리할 수 있는 실질적인 이점을 제공합니다.
Gemma-4-31B-it 모델의 컨텍스트 길이를 35k에서 80k로 확장하는 Docker 실행 방법과 설정 팁을 공유합니다. llama.cpp 환경에서 Flash Attention 및 특정 파라미터 설정을 통해 성능을 최적화하는 방법을 다룹니다.
모델 사양에 명시된 최대 컨텍스트 길이와 실제 사용 가능한 쾌적한 컨텍스트 길이 사이에는 큰 차이가 있습니다. 소비자용 하드웨어에서는 약 160K를 기점으로 생성 속도가 급격히 저하되는 현상이 발생합니다.
llama.cpp에 실험적인 'Particle Scattering Sampler'가 추가되었습니다. 이 샘플러는 전체 확률 분포를 무작위로 만드는 온도(Temperature) 방식과 달리, 상위 후보군 내에서만 확률을 국소적으로 재조정하여 생성의 경직성을 완화합니다.
Pi를 활용하여 셀프 호스팅이 가능한 개인용 AI 에이전트 하네스 구축 사례를 소개합니다. 브라우저 기반의 멀티 디바이스 지원, 지속성 메모리, 야간 자동화 에이전트 등 전문적인 업무를 위한 강력한 기능을 포함합니다.
RAG 시스템의 성능 병목은 디코딩이 아닌 프리필(prefill) 단계에 있으며, 통합 메모리 시스템은 대량의 컨텍스트 처리 시 외장 GPU보다 느릴 수 있습니다. 대화형 RAG를 원활하게 구축하려면 프리필 부하를 감당할 수 있는 하드웨어 구성이 필요합니다.
Gemma 4 31B 모델을 활용하여 3D 아바타와 실시간 음성 대화가 가능한 시스템을 소개합니다. 오픈 모델 스택을 사용하여 사용자의 음성을 경청하고, LLM이 스스로 표정과 제스처를 결정하여 반응합니다.
Hugging Face가 어떤 코딩 에이전트들이 Hub를 사용하고 있는지 분석한 공개 데이터셋을 출시했습니다. User Agent 토큰을 기반으로 생성된 이 데이터셋은 에이전트들의 Hub 활용 패턴을 보여줍니다.
llama.cpp의 커스텀 브랜치를 사용하여 DeepSeek V4 Pro 모델의 성능 최적화 및 벤치마크 결과를 공유합니다. 메모리 효율성 개선과 전문가 오프로딩(expert offloading)을 통한 실행 성능 향상을 다룹니다.
로컬 환경에서 실행되는 DeepSeek V4 Flash가 API 기반의 Claude Sonnet 및 Opus보다 실제 코딩 작업 완료 속도 면에서 더 뛰어난 성능을 보인다는 벤치마크 결과입니다. 품질은 Opus가 우세하지만, 속도와 효율성 측면에서 로컬 모델의 실용성이 입증되었습니다.
4개의 DGX Spark 환경에서 GLM-5.2 NVFP4 모델을 실행할 때 발생하던 MTP(Multi-Token Prediction) 수락률 저하 버그를 해결한 보고서입니다. vLLM 설정 파이프라인의 오류를 수정하여 128K 컨텍스트에서도 성능 저하 없이 높은 토큰 생성 속도를 확보했습니다.
audio.cpp가 GGML 기반의 대규모 오디오 확장 기능을 출시했습니다. 음악 및 효과음 생성, 음원 분리 기능을 포함하며, C++/GGML 네이티브 경로를 통해 기존 Python 대비 빠른 추론 성능을 제공합니다.