
DKV: 로컬 LLM 추론을 위한 오픈 소스 KV-cache 압축 프레임워크 (CLI + 기술 보고서)
요약
로컬 LLM의 긴 컨텍스트 추론 시 발생하는 KV-cache 메모리 문제를 해결하기 위한 오픈 소스 압축 프레임워크 DKV를 소개합니다. 앵커 기반 표현과 저차원 압축 기술을 통해 메모리 요구 사항을 줄이며, CLI와 MLX/CUDA 백엔드를 지원합니다.
핵심 포인트
- KV-cache 압축을 통한 로컬 LLM 추론 효율화
- 앵커 기반 표현 및 결합 저차원 압축 기술 적용
- CLI 및 MLX, CUDA 백엔드 지원
- llama.cpp, vLLM 등 주요 프로젝트와의 통합 가능성
안녕하세요 여러분! 지난 5개월 동안 저는 긴 컨텍스트(long-context) 로컬 LLM 추론을 위한 KV-cache 압축을 탐구하는 오픈 소스 프로젝트인 DKV (DifferentialKV)를 작업해 왔습니다. 목표는 앵커 기반 표현(anchor-based representations), 결합 저차원 압축(joint low-rank compression), 정확한 잔차 보존(exact residual preservation), 그리고 희소 라우팅 어텐션(sparse routed attention)을 통해 KV-cache 메모리 요구 사항을 줄이는 것입니다. 현재 저장소에는 다음이 포함되어 있습니다:
- 직접 통합 코드를 작성하지 않고도 실험을 시작할 수 있는 CLI
- MLX 백엔드
- CUDA 백엔드 (현재 검증 중)
- 설계 및 평가를 설명하는 기술 보고서 (technical report)
- 완전한 오픈 소스 구현
저는 여전히 프로젝트를 활발히 개선하고 있으며, 주로 로컬 추론(local inference) 작업을 하는 분들로부터 기술적인 피드백을 받기 위해 이곳에 게시합니다. 아키텍처, 벤치마킹, 또는 llama.cpp, vLLM, SGLang과 같은 프로젝트와의 잠재적인 통합 등 프로젝트를 더 유용하게 만들 수 있는 방법에 대한 의견을 듣고 싶습니다. 살펴보고 싶으시다면 GitHub 저장소와 기술 보고서 링크를 아래에 첨부합니다.
GitHub: https://github.com/Omc12/Differential-KV
기술 보고서 (Technical Report): https://doi.org/10.5281/zenodo.21539110
직접 사용해 보신다면, 문제에 부딪히거나 개선 아이디어가 있는 경우 등 여러분의 경험을 들려주시면 정말 감사하겠습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기