Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
합성 의료 데이터를 활용한 RAG 벤치마크를 통해 모델 수정보다 데이터 표현 방식의 개선이 성능 향상에 더 결정적임을 입증했습니다. Small-to-Big 검색과 집계 정보를 담은 롤업 문서를 활용할 때 가장 높은 성능을 보였습니다.
llama.cpp의 DSA lightning indexer 지원 문제를 해결하기 위해 CUDA 커널을 직접 패치하여 DeepSeek V4 Flash 모델의 1M 컨텍스트 실행을 가능하게 했습니다. RTX 5090 환경에서 VRAM 사용량을 획기적으로 줄여 대규모 컨텍스트를 로컬에서 효율적으로 처리할 수 있음을 검증했습니다.
6개의 NVIDIA P40 GPU를 활용하여 Minimax M2.7_Q3_XL 모델을 구동하는 홈 랩 구축 사례와 벤치마크 결과를 공유합니다. 다양한 컨텍스트 길이와 배치 사이즈에 따른 성능 변화를 분석하여 최적의 설정을 제안합니다.
Gemma 4 모델을 WebGPU 커널을 통해 구현하여 초당 255 토큰의 빠른 속도를 달성했습니다. 이는 로컬 프라이빗 모델이 고성능 작업을 효율적으로 수행할 수 있는 가능성을 보여줍니다.
대화 컨텍스트 제한 문제를 해결하기 위해 JLC 코덱을 활용하여 장기 기억을 유지하는 터미널 에이전트 'jarvis-code'를 개발했습니다. 매 턴마다 대화 기록을 압축된 상태로 변환하여 컨텍스트 사용량을 최소화하면서도 10,000턴 이상의 연속적인 세션을 유지하는 데 성공했습니다.
PAiERA의 기술적 검증을 위해 실제 재현 가능한 런타임 데모 저장소를 공개했습니다. 합성 데이터와 SQLite를 사용하여 인물 식별, 안전 사실 투영, 데이터 유출 방지 기능을 로컬 환경에서 테스트할 수 있습니다.
Ornith 35B 모델에 MTP(Multi-Token Prediction)를 이식하여 vLLM 환경에서 추론 속도를 18% 향상시킨 기술을 소개합니다. FP8 양자화와 256k 컨텍스트 윈도우를 지원하여 고성능 에이전틱 코딩 환경을 구축할 수 있습니다.
로컬 DeBERTa NER 모델을 사용하여 클라우드로 데이터가 전송되기 전 개인 식별 정보(PII)를 자동으로 제거하고 복원하는 데스크톱 AI 'Primnox'를 소개합니다. 지식 그래프 구축, 딥 리서치 모드, AI 액션이 포함된 Markdown 노트 등 다양한 생산성 기능을 제공합니다.
audio.cpp 제작자가 VibeVoice 1.5B 모델 지원을 발표하며, C++/ggml 기반의 로컬 오디오 런타임 성능을 공개했습니다. RTX 5090 기준 실시간보다 4.08배 빠른 생성 속도를 보여주며, 긴 형태의 다중 화자 TTS 최적화를 목표로 합니다.
llama.cpp에서 MoE 모델의 추론 속도를 최적화하기 위해 -fitt 옵션과 Claude를 활용하여 최적의 텐서 오버라이드 설정을 찾아내는 과정을 다룹니다. 사용자는 특정 텐서를 CUDA_Host로 할당함으로써 VRAM 사용량을 늘리고 추론 성능을 크게 향상시켰습니다.
35B 파라미터 규모의 Qwen3.5-MoE 기반 에이전트 모델인 Agents-A1의 GGUF 양자화 버전을 소개합니다. Blackwell GPU를 위한 NVFP4 빌드와 투기적 디코딩을 위한 MTP(multi-token prediction) 결합을 통해 성능과 속도를 최적화했습니다.
코딩 에이전트의 콜드 스타트 문제를 해결하기 위해 지속적 저장소 메모리 레이어인 Greplica를 제안합니다. SQLite 지식 그래프를 활용해 저장소의 맥락을 유지함으로써 토큰 사용량과 도구 호출 비용을 획기적으로 절감합니다.
2x4060 환경에서 DFlash와 MTP(Multi-Token Prediction) 기술을 비교 벤치마크한 결과, 현재는 MTP+Tensor 조합이 DFlash보다 더 빠른 성능을 보였습니다. Hugging Face의 DFlash 양자화 모델 사용 시 주의사항과 직접 빌드하는 과정을 공유합니다.
자율 개발 파이프라인인 Lullabeast를 오픈 소스로 공개하며, 로컬 4090 기반 모델과 클라우드 LLM의 성능을 비교했습니다. 에이전트 간 결정론적 게이트를 통해 오류를 제어하고, 재시도 및 단계 격상 메커니즘을 통해 안정성을 확보한 것이 특징입니다.
BitTorrent와 Nostr 프로토콜을 결합하여 오픈 웨이트 LLM을 탈중앙화 방식으로 공유하고 검증하는 프로젝트 llama.garden을 소개합니다. 웹시드(webseeds)를 통해 HuggingFace 데이터의 무결성을 검증하고, Nostr의 수요 신호 전달을 통해 모델 배포의 지속 가능성을 확보합니다.
TurboOCR v3는 C++와 CUDA를 기반으로 한 고속 로컬 문서 OCR 서버입니다. RTX 5090 환경에서 초당 약 520장의 이미지를 처리하며, 레이아웃 분석부터 표, 수식, 마크다운 변환까지 지원합니다.
GLM 5.2 모델을 활용하여 다중 파일 기반의 컴퓨터 비전 스튜디오 구축 프로젝트를 수행한 실무 테스트 결과입니다. 모델이 복잡한 계획 수립, 다중 파일 간의 일관성 유지, 합리적인 기술적 트레이드오프 결정 능력을 갖추었음을 확인했습니다.
Cerebras와 Gemma 해커톤을 통해 제작된 프로젝트로, 로봇 Reachy Mini와 Eliza가 Gemma 31B VLM을 사용하여 실시간으로 포커 게임을 즐기는 시스템입니다. 웹캠과 로봇 카메라를 통해 카드를 추적하며, 음성 명령만으로 게임을 진행하는 오케스트레이션 기술을 보여줍니다.
llama.cpp의 루프 방지 기능을 개선한 개인 포크 버전을 소개합니다. 실시간 토큰 모니터링을 통해 반복적인 출력 사이클을 감지하고, 온도를 조절하여 모델이 루프에서 벗어나도록 돕는 샘플러를 구현했습니다.
Qwen3.5/3.6 모델의 토큰 생성 속도를 높이기 위해 MTP(Multi-Token Prediction) 텐서만을 포함한 GGUF 서브셋을 공개했습니다. 이 모델들은 특정 모델의 성능 가속화나 MTP 텐서 이식(grafting) 실험을 목적으로 설계되었습니다.