Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
단일 RTX 5090 환경에서 DeepSeek-V4-Flash-0731 모델을 1M 컨텍스트로 구동하기 위한 최적화 기술을 소개합니다. 이중 CUDA 그래프와 phase-adaptive DSpark 패치를 통해 추론 단계와 생성 단계의 수락률 차이를 극복하고 처리량을 개선했습니다.
RTX 4090과 128GB RAM 환경에서 DeepSeek V4 Flash 모델을 64k 컨텍스트로 실행한 설정과 성능 측정 결과를 공유합니다. MoE 구조를 활용해 어텐션과 KV 캐시는 GPU에, 전문가 FFN은 시스템 RAM에 배치하는 최적화 방식을 다룹니다.

16x GB10 클러스터 환경에서 Kimi K3 풀 모델을 dspark를 통해 실행한 성능 결과입니다. 평균 20+ tps의 속도를 기록했으며, 향후 vLLM 이미지와 상세 사용 지침을 공유할 예정입니다.
Krasis를 활용하여 단일 RTX PRO 6000 GPU에서 DeepSeek-V4-Flash-0731 모델의 프리필(prefill) 속도를 대폭 향상시킨 성능 측정 결과입니다. VRAM 제한을 극복하기 위해 전문가(experts)를 스트리밍하고 관리하는 최적화 기법을 적용했습니다.
RTX 5090 8장을 활용하여 Deepseek V4 Flash 모델에서 시간당 2.5달러의 비용으로 2000+ TPS를 달성한 실험 결과입니다. REAP mxfp4 이미지를 통해 높은 KV 캐시 효율을 확보하고 다수의 동시 세션을 구성하는 최적화 방법을 다룹니다.
srt2speech는 SRT 자막의 타이밍에 맞춰 음성을 생성하고 자동으로 길이를 매칭하는 오픈 소스 다국어 내레이션 도구입니다. 외부 API 없이 로컬 환경에서 음성 복제와 다중 화자 지원이 가능하며, 경량화된 설계를 통해 다양한 하드웨어에서 구동됩니다.
RTX 5090과 대용량 DDR5 RAM을 활용하여 DeepSeek-V4-Flash 모델을 vLLM의 CPU/RAM 오프로딩 기술로 구동하는 방법을 다룹니다. FlashInfer 라이브러리의 CUDA 라이브러리 경로 인식 오류를 해결하기 위한 로컬 패치 방법과 최적화된 실행 환경 설정을 공유합니다.

저사양 기기에서도 대규모 언어 모델을 구동할 수 있도록 설계된 QuarkStar 추론 엔진을 소개합니다. Vulkan과 Metal을 지원하며, 16GB 메모리 환경에서 Qwen3.6-35B-A3B 모델을 효율적으로 실행할 수 있는 최적화 기술을 제공합니다.
LokalBot은 macOS 전용 로컬 LLM 기반 업무 보조 앱으로, 개인정보 보호를 위해 모든 데이터를 기기 내에서 처리합니다. 회의 녹음, 요약, 자동 완성, MCP 기반 코딩 에이전트 연동 등 강력한 생산성 기능을 무료로 제공합니다.
M5 Air 32GB 환경에서 DeepSeek v4 Flash 모델을 구동하며 prefill 속도를 최적화하는 실험 결과입니다. Streamed experts 기법과 자체적인 트릭을 통해 50tps 이상의 prefill 속도를 달성했습니다.
GH200 듀얼 시스템 환경에서 DSv4-Flash 모델의 추론 성능을 극대화하는 최적화 방법을 소개합니다. vLLM과 SGLang을 활용하여 매우 긴 컨텍스트에서도 높은 Prefill 및 Decode 속도를 달성하는 구체적인 설정과 트릭을 다룹니다.
MiniMax의 새로운 멀티모달 모델 H3를 SGLang Diffusion을 통해 로컬 환경에서 실행하는 방법을 소개합니다. RTX 5090 2개 또는 RTX Pro 6000 1개만으로 텍1스트, 이미지, 비디오, 오디오를 통합 처리하는 고해상도 비디오 생성이 가능합니다.

ESP32S3 환경에서 클라우드 연결 없이 완전히 오프라인으로 작동하는 에스프레소 Q/A 전용 소형 모델 'barista v0.1'을 소개합니다. 메모리 효율을 위해 레이어별 임베딩과 비대칭 어휘 기술을 사용하여 제한된 하드웨어 자원에서 텍스트 생성을 구현했습니다.
DeepSeek-V4-Flash 모델을 llama.cpp 환경에서 최적화하여 구동한 성능 테스트 결과입니다. 특정 설정(--cpu-moe)을 통해 높은 처리 속도를 달성했으나, FP8 캐시 미지원 및 배치 크기 제한 등의 기술적 한계와 하드웨어 구성 방안을 다룹니다.

Windows 검색 기능을 활용하여 llama.cpp의 Router Mode를 빠르고 편리하게 실행하는 설정 방법을 소개합니다. 배치 스크립트와 config.ini 파일을 사용하여 여러 모델을 관리하고 서버를 즉시 구동할 수 있습니다.
Google의 새로운 OKF 포맷과 클래식 벡터 RAG의 성능을 로컬 환경에서 비교 벤치마크한 결과입니다. OKF와 RAG를 결합했을 때 정답률은 높아지지만 토큰 소모가 증가하며, 데이터의 최신성 문제나 청킹 오류 등 여전히 해결해야 할 한계점이 존재함을 보여줍니다.
자동차 생산 라인의 '실수 방지(Poka Yoke)' 원리를 AI 에이전트 워크플로우에 적용하는 관점을 제시합니다. 개별 AI 모델의 지능에 의존하기보다, 실수가 불가능하도록 설계된 정교한 프로세스와 시스템 구축의 중요성을 강조합니다.
M3 Pro 칩에서 실행 가능한 로컬 GPT-Live 클론인 Parlor v2를 소개합니다. 전이중(Full-duplex) 모델 구현 시도와 실패를 거쳐, 현재는 캐스케이드(Cascade) 시스템 방식을 채택하여 구현되었습니다.
WASTE는 C 언어로 작성된 임베디드 추론 엔진으로, NVMe에서 가중치를 직접 스트리밍하여 RAM 용량을 초과하는 대규모 모델을 실행할 수 있게 합니다. 모델 트렁크는 메모리에 유지하고 필요한 전문가(experts)만 디스크에서 불러와 효율적인 추론을 지원합니다.

llama.cpp 팀에서 개발한 공식 Mac용 앱 llama.app과 llama serve를 소개합니다. Ollama와 유사한 사용자 경험을 제공하며, Mac 환경에서 로컬 LLM을 더욱 쉽고 간편하게 설치하고 사용할 수 있도록 지원합니다.