Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
SupraLabs가 코딩 에이전트의 복잡한 사고 흔적(thinking traces)을 JSON 형태로 요약해주는 800M 규모의 초소형 모델을 출시했습니다. 개발자는 이 모델을 통해 에이전트의 추론 과정을 사용자에게 더 직관적이고 구조화된 방식으로 전달할 수 있습니다.
H200 환경에서 FP8 및 FP8 KV를 적용한 GLM 5.2 모델의 Terminal-Bench 2.1 성능을 테스트한 결과입니다. 총 89개 작업 중 79.8%의 통과율을 기록하며 모델의 효율성을 검증했습니다.
Qualcomm이 Windows 노트북 환경에서 LLM을 효율적으로 실행할 수 있도록 돕는 GenieX를 출시했습니다. 이 SDK를 통해 Gemma 4 및 Qwen 모델 등을 GPU와 NPU에서 구동하여 최적화된 성능을 얻을 수 있습니다.
2억 7천만 파라미터 규모의 언어 모델을 처음부터 직접 개발한 연구 프로젝트입니다. RoPE, RMSNorm, SwiGLU 등 최신 아키텍처를 적용하여 로컬 추론에 최적화된 커스텀 트랜스포머 모델을 구축했습니다.
LLM에 영업 전략을 부여하기 위해 모델 프리 강화학습(Model-free RL)을 활용하는 새로운 연구 방법론을 공개했습니다. 합성 데이터셋 대신 수치 기반의 영업 규칙을 사용하여 PPO 모델을 훈련시키고, 이를 LLM의 잔차 스트림에 주입하여 응답을 보강합니다.
LivePortrait 모델을 WebGPU 환경에서 실행하기 위해 모델 증류(Distillation)를 통해 경량화한 프로젝트입니다. Chrome 브라우저 내에서 25fps의 속도로 실시간 실행이 가능하도록 구현되었습니다.
CLI 에이전트형 하네스의 성능을 평가하기 위해 직접 구축한 개인용 평가 생성 도구인 eval-harness를 소개합니다. 모델 자체의 성능뿐만 아니라 에이전트가 도구와 상호작용하며 작업을 수행하는 능력을 검증하는 데 중점을 둡니다.
SupraLabs에서 51M 파라미터 규모의 초소형 프롬프트 라우팅 모델인 Supra-Router-51M을 출시했습니다. 이 모델은 사용자 요청을 적절한 크기의 LLM으로 전달하여 저지연 환경을 구현하며, 학습에 사용된 데이터셋도 함께 공개되었습니다.
Qwen 3.6 27B 모델을 대상으로 vLLM 환경에서 다양한 양자화 방식(BF16, FP8, NVFP4)의 성능을 벤치마크한 결과입니다. NVFP4는 속도가 매우 빠르지만 루핑 문제가 발생하며, FP8이 성능과 안정성 측면에서 가장 적절한 선택으로 분석되었습니다.
GitHub Copilot이 BYOK(Bring Your Own Key)를 통한 인라인 자동 완성을 차단하는 문제와 그에 대한 비판을 다룹니다. 사용자가 커스텀 모델을 사용할 수 있도록 돕는 오픈 소스 대안인 'GitHub Copilot LLM Gateway' 확장 프로그램을 소개합니다.
MrFlow는 별도의 학습 없이 사전 학습된 Flow Matching 모델의 생성 속도를 획기적으로 높이는 다중 해상도 가속 전략을 제안합니다. 저해상도 구조 생성 후 GAN 기반 초해상도와 고주파 재샘플링을 결합하여, 품질 저하를 최소화하면서 최대 10배 이상의 엔드투엔드 가속을 달성합니다.
에이전트 워크로드에서 65K-128K 롱 컨텍스트 성능을 분석하기 위해 13개 모델을 벤치마킹한 결과입니다. 분석 결과, 토큰 생성 속도보다 프리필(prefill) 단계가 성능을 지배하며, KV 헤드 수가 파라미터 수보다 성능에 더 큰 영향을 미침을 확인했습니다.
32GB VRAM 환경에서 Qwen2.5-27B Q8 양자화 모델을 사용하여 100K 컨텍스트 길이를 확보하기 위한 실험적 시도를 다룹니다. KV 캐시 양자화와 특정 옵션 설정을 통해 제한된 메모리 내에서 컨텍스트 길이를 극대화하는 방법을 공유합니다.
NVIDIA Blackwell GPU 환경에서 vLLM을 활용해 Qwen3.6-35B-A3B-NVFP4 모델의 대량 이미지 캡셔닝 성능을 테스트한 결과입니다. 30개의 동시 스트림 실행 시 약 2000 TPS를 기록하며, MoE 모델의 효율적인 전문가 선택과 NVFP4 양자화의 성능 이점을 분석합니다.
에이전트의 작업 메모리 형식을 Markdown에서 TOON(Token-Oriented Object Notation)으로 전환하여 성능을 측정한 결과입니다. TOON은 기존 JSON 방식 대비 토큰 효율성을 크게 높여, 제한된 컨텍스트 예산 내에서 더 정확한 추론을 가능하게 합니다.
DeepSeek V4 모델을 지원하기 위해 llama.cpp의 DeepSeek V4 브랜치에 양자화된 KV 캐시(Quantized KV Cache) 수정 사항이 병합되었습니다. 이번 업데이트는 모델의 효율적인 추론을 위한 최적화 작업을 포함하며, 다양한 정밀도에서의 퍼플렉서티(Perplexity) 테스트 결과가 공유되었습니다.
여름철 DGX-Spark 사용 중 발생하는 과열 및 락업 문제를 해결하기 위해 nvidia-smi를 이용한 언더클러킹 방법을 소개합니다. GPU 클럭을 제한함으로써 온도를 85°C에서 60°C로 낮출 수 있습니다.
RTX 3090, 5090, Dual RTX 6000 등 다양한 하드웨어 구성에 따른 로컬 LLM 추론 속도를 비교 분석합니다. 각 GPU 설정별 토큰 생성 속도와 프롬프트 처리 성능을 통해 하드웨어 계층별 실질적인 성능 차이를 보여줍니다.
9800X3D와 RTX 5090 환경에서 llama.cpp를 활용해 Qwen3.6 27B 모델의 추론 성능을 최적화한 결과입니다. MTP 및 KV 캐시 설정을 튜닝하여 샘플 토큰/s 분포를 분석하고 실제 구동 성능을 공유합니다.
8개의 로컬 모델을 대상으로 판타지 RP 및 에이전틱 능력을 평가한 벤치마크 결과입니다. gemma-4-31B가 가장 높은 합격률을 기록했으며, 모델별로 특정 하위 작업에서 성능 저하가 발생하는 불균형 현상이 관찰되었습니다.