
2 x 5070ti 환경에서 Qwen 27B 전체 설정 및 통계
요약
2 x 5070ti 환경에서 Qwen 27B 모델을 최적화하여 실행하는 설정과 성능 통계를 공유합니다. vLLM의 KV 캐시 수정 사항을 통해 생성 속도 저하 없이 동시 스레드 실행과 대규모 컨텍스트 확보가 가능함을 보여줍니다.
핵심 포인트
- 2 x 5070ti 환경에서 Qwen 27B 모델 최적화 실행
- vLLM cu129-nightly 기반 KV 캐시 성능 향상 확인
- 디코딩 속도 최대 87tps 및 대규모 컨텍스트 지원
- 로컬 에이전트 작업을 위한 쾌적한 메모리 환경 구축
성능과 KV 캐시를 극대화하면서 모두가 선호하는 모델들을 2 x 16GB 카드에서 실행하는 것에 관한 어제의 게시물에 이어 후속 내용을 공유합니다. 이전 게시물의 데이터는 더 이상 사용되지 않는 Cu130 VLLM 이미지를 사용했습니다. 여기의 통계는 KV 캐시 커넥터 수정 사항과 성능 향상이 포함된 cu129-nightly를 기준으로 작성되었습니다. 주요 하이라이트 - 생성 속도 저하 없이 2개의 동시 스레드(concurrent threads)를 여유롭게 실행할 수 있습니다. 디코딩(Decode) 속도는 0-120k 컨텍스트에서 94-87tps까지 올라갔으며, 프리필(prefill)은 4.6k-2.4k를 기록했습니다. 170k의 GPU KV를 확보할 수 있으며, 8GB의 RAM을 통해 추가로 246k를 더 사용할 수 있습니다. 이는 로컬 에이전트 작업(agentic work)을 수행하기에 매우 쾌적한 환경을 제공합니다. 메모리 사용량 등에 대한 많은 추가 정보가 포함된 전체 compose 파일 링크를 첨부합니다. 곧 출시될 작은 규모의 Qwen 3.8 모델도 이 설정에 잘 맞기를 바랍니다!
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기