Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
에이전트의 작업 메모리 형식을 Markdown에서 TOON(Token-Oriented Object Notation)으로 전환하여 성능을 측정한 결과입니다. TOON은 기존 JSON 방식 대비 토큰 효율성을 크게 높여, 제한된 컨텍스트 예산 내에서 더 정확한 추론을 가능하게 합니다.
DeepSeek V4 모델을 지원하기 위해 llama.cpp의 DeepSeek V4 브랜치에 양자화된 KV 캐시(Quantized KV Cache) 수정 사항이 병합되었습니다. 이번 업데이트는 모델의 효율적인 추론을 위한 최적화 작업을 포함하며, 다양한 정밀도에서의 퍼플렉서티(Perplexity) 테스트 결과가 공유되었습니다.
9800X3D와 RTX 5090 환경에서 llama.cpp를 활용해 Qwen3.6 27B 모델의 추론 성능을 최적화한 결과입니다. MTP 및 KV 캐시 설정을 튜닝하여 샘플 토큰/s 분포를 분석하고 실제 구동 성능을 공유합니다.
Gemma 4 모델 업스케일링 시 모델 성능 유지를 위해 layer_scalar 값을 비례적으로 조정해야 함을 설명합니다. 레이어 복제 횟수에 따라 곱셈 방식의 스칼라 값을 계산하는 공식을 제시합니다.
KV 캐시 양자화 수준을 Q8에서 Q5로 낮추었을 때 품질 저하를 거의 느끼지 못하면서도 컨텍스트 길이를 크게 확장할 수 있음을 확인했습니다. 이는 동일한 VRAM 내에서 더 많은 토큰을 처리할 수 있는 실질적인 이점을 제공합니다.
Gemma-4-31B-it 모델의 컨텍스트 길이를 35k에서 80k로 확장하는 Docker 실행 방법과 설정 팁을 공유합니다. llama.cpp 환경에서 Flash Attention 및 특정 파라미터 설정을 통해 성능을 최적화하는 방법을 다룹니다.
모델 사양에 명시된 최대 컨텍스트 길이와 실제 사용 가능한 쾌적한 컨텍스트 길이 사이에는 큰 차이가 있습니다. 소비자용 하드웨어에서는 약 160K를 기점으로 생성 속도가 급격히 저하되는 현상이 발생합니다.
llama.cpp에 실험적인 'Particle Scattering Sampler'가 추가되었습니다. 이 샘플러는 전체 확률 분포를 무작위로 만드는 온도(Temperature) 방식과 달리, 상위 후보군 내에서만 확률을 국소적으로 재조정하여 생성의 경직성을 완화합니다.
Pi를 활용하여 셀프 호스팅이 가능한 개인용 AI 에이전트 하네스 구축 사례를 소개합니다. 브라우저 기반의 멀티 디바이스 지원, 지속성 메모리, 야간 자동화 에이전트 등 전문적인 업무를 위한 강력한 기능을 포함합니다.
RAG 시스템의 성능 병목은 디코딩이 아닌 프리필(prefill) 단계에 있으며, 통합 메모리 시스템은 대량의 컨텍스트 처리 시 외장 GPU보다 느릴 수 있습니다. 대화형 RAG를 원활하게 구축하려면 프리필 부하를 감당할 수 있는 하드웨어 구성이 필요합니다.
Gemma 4 31B 모델을 활용하여 3D 아바타와 실시간 음성 대화가 가능한 시스템을 소개합니다. 오픈 모델 스택을 사용하여 사용자의 음성을 경청하고, LLM이 스스로 표정과 제스처를 결정하여 반응합니다.
Hugging Face가 어떤 코딩 에이전트들이 Hub를 사용하고 있는지 분석한 공개 데이터셋을 출시했습니다. User Agent 토큰을 기반으로 생성된 이 데이터셋은 에이전트들의 Hub 활용 패턴을 보여줍니다.
llama.cpp의 커스텀 브랜치를 사용하여 DeepSeek V4 Pro 모델의 성능 최적화 및 벤치마크 결과를 공유합니다. 메모리 효율성 개선과 전문가 오프로딩(expert offloading)을 통한 실행 성능 향상을 다룹니다.
로컬 환경에서 실행되는 DeepSeek V4 Flash가 API 기반의 Claude Sonnet 및 Opus보다 실제 코딩 작업 완료 속도 면에서 더 뛰어난 성능을 보인다는 벤치마크 결과입니다. 품질은 Opus가 우세하지만, 속도와 효율성 측면에서 로컬 모델의 실용성이 입증되었습니다.
4개의 DGX Spark 환경에서 GLM-5.2 NVFP4 모델을 실행할 때 발생하던 MTP(Multi-Token Prediction) 수락률 저하 버그를 해결한 보고서입니다. vLLM 설정 파이프라인의 오류를 수정하여 128K 컨텍스트에서도 성능 저하 없이 높은 토큰 생성 속도를 확보했습니다.
audio.cpp가 GGML 기반의 대규모 오디오 확장 기능을 출시했습니다. 음악 및 효과음 생성, 음원 분리 기능을 포함하며, C++/GGML 네이티브 경로를 통해 기존 Python 대비 빠른 추론 성능을 제공합니다.
합성 의료 데이터를 활용한 RAG 벤치마크를 통해 모델 수정보다 데이터 표현 방식의 개선이 성능 향상에 더 결정적임을 입증했습니다. Small-to-Big 검색과 집계 정보를 담은 롤업 문서를 활용할 때 가장 높은 성능을 보였습니다.
llama.cpp의 DSA lightning indexer 지원 문제를 해결하기 위해 CUDA 커널을 직접 패치하여 DeepSeek V4 Flash 모델의 1M 컨텍스트 실행을 가능하게 했습니다. RTX 5090 환경에서 VRAM 사용량을 획기적으로 줄여 대규모 컨텍스트를 로컬에서 효율적으로 처리할 수 있음을 검증했습니다.
6개의 NVIDIA P40 GPU를 활용하여 Minimax M2.7_Q3_XL 모델을 구동하는 홈 랩 구축 사례와 벤치마크 결과를 공유합니다. 다양한 컨텍스트 길이와 배치 사이즈에 따른 성능 변화를 분석하여 최적의 설정을 제안합니다.
Gemma 4 모델을 WebGPU 커널을 통해 구현하여 초당 255 토큰의 빠른 속도를 달성했습니다. 이는 로컬 프라이빗 모델이 고성능 작업을 효율적으로 수행할 수 있는 가능성을 보여줍니다.