zzpanic vllm-radiance의 1x R9700 GPU용 최종 수정본, qwen3.8-27b
요약
새로운 radiance 추론 엔진 출시로 인해 기존 vllm-radiance 빌드는 구식이 되었으며, 최신 버전은 성능 향상을 보입니다. 주요 개선 사항으로는 vllm의 시작 캐싱을 통한 재컴파일 방지, 메모리 절약을 위한 kv-offload 기능 등이 포함되어 있습니다.
핵심 포인트
- vllm-radiance는 새로운 radiance 엔진으로 대체됨
- 시작 캐싱(startup caching)으로 재시작 시 컴파일 시간 단축
- kv-offload 기능을 통해 긴 컨텍스트에서 다중 에이전트 작업 가능
프로젝트 상태 지표 요약: StillDeadcode가 새로운 radiance 추론 엔진을 출시함에 따라, 기존 vllm-radiance 빌드는 시대가 끝났음을 알 수 있습니다. 사람들은 더 새롭고 나은 것으로 이동했습니다. 저는 몇 가지 단일 자릿수 퍼센트의 속도 향상을 볼 수 있지만, 아마 그것들을 쫓지는 않을 것 같습니다. 마지막 5%의 노력을 들여 개인적인 빌드를 완성하려고 했습니다. 이것은 Launch80 Discord에서 작업한 여러 사람들의 결과물을 차용한 것이며 결코 저 혼자만의 작업이 아닙니다. 제가 개인적으로 수행한 몇 가지 작업들은 다음과 같습니다:
- vllm의 시작 캐싱(startup caching)을 통해 재시작 시 다양한 요소들을 다시 컴파일하는 것을 방지함
- 메모리 절약을 위한 메모리 얇게 하기(memory thinning)를 갖춘, vram-sysram-disk 전반에 걸친 작동 가능한 kv-offload 기능. 이는 긴 컨텍스트에서 단일 카드로 다중 에이전트 작업을 가능하게 합니다.
- /u/KriptacMessage가 제출한 zzpanic/qwen3.6-vllm-gfx1201-launchers의 가끔 발생하는 버그 수정 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기