Qwen3.8-27B의 속도가 단일 RTX 3090에서 ~82 tok/s에서 381 tok/s로 향상됨
요약
Qwen3.8-27B 모델의 추론 속도가 최적화된 스택을 통해 크게 향상되었습니다. 특히 RAG나 문서 재작성 같은 기존 컨텍스트 활용 작업에서 381 tok/s라는 높은 성능을 달성했습니다. 이는 단순히 새로운 토큰 생성 속도 증가가 아닌, 프롬프트 내 정보를 효율적으로 검증하는 방식 덕분입니다.
핵심 포인트
- 최적화된 스택으로 Qwen3.8-27B의 추론 속도가 크게 향상됨 (82 tok/s -> 381 tok/s).
- 속도 향상은 기존 컨텍스트 정보를 효율적으로 검증하는 '컨텍스트 룩업' 덕분임.
- RAG, 문서 Q&A, 코딩 에이전트 등 정보 재현 작업에 최적화된 모드임.
- 접두사 캐싱을 통해 연속적인 질문 시 첫 토큰 생성 시간이 대폭 감소함.
Qwen3.8-27B가 단일 RTX 3090에서 약 82 tok/s에서 381 tok/s로 속도가 빨라졌습니다.
동일한 24GB GPU를 사용했으며, 전력 소모는 약 250W입니다. 큰 변화는 추론 스택(inference stack)이 프롬프트에 이미 존재하는 정보를 활용하는 방식에 있습니다.
진행 과정은 다음과 같습니다:
• ~82 tok/s: 초기 단일 사용자 설정
• ~114 tok/s: 최적화된 MTP
• ~138 tok/s: DFlash2 + 룩업 드래프팅(lookup drafting)
• ~381 tok/s: 더 긴 검증 블록(verification blocks) + 컨텍스트 룩업
이 설정은 최적화된 vLLM, DFlash2 투기적 디코딩(speculative decoding), 룩업 증강 드래프팅(lookup-augmented drafting), 접두사 캐싱(prefix caching) 및 양자화된 KV 캐시 헤드와 활성화(activations)를 결합합니다.
여기서 영리한 트릭은 DFlash2가 일반적으로 드래프트하는 7개의 토큰으로 검증을 제한할 필요가 없다는 것입니다.
작업이 프롬프트에 이미 있는 자료를 재현하거나 편집하는 것을 포함할 때, 런타임(runtime)은 해당 컨텍스트에서 추가적인 드래프트 위치를 직접 채울 수 있습니다. 그러면 대상 모델은 한 단계에서 최대 16개의 토큰까지 검증할 수 있게 됩니다.
약 25K 토큰 분량의 문서 재현 작업의 경우:
• DFlash2 단독: ~260 tok/s
• 더 긴 검증 + 컨텍스트 룩업: ~382 tok/s
• 승인된 토큰: 검증 단계당 약 16개 중 15개
이것이 헤드라인 수치가 나오는 이유입니다. 모델이 임의의 프롬프트에 대해 초당 381개의 완전히 새로운 토큰을 생성하는 것은 아닙니다. 기존 컨텍스트에서 종종 복구될 수 있는 토큰들을 효율적으로 검증하고 있기 때문입니다.
일반적인 채팅의 경우, 동일한 설정으로 약 133 tok/s에 도달한다고 보고되었으며, 이는 단일 RTX 3090에서 27B 모델로서는 여전히 인상적인 수치입니다.
381 tok/s 모드는 다음 작업에 더 적합합니다:
• RAG 및 문서 Q&A
• 편집을 적용하는 코딩 에이전트(Coding agents)
• 문서 재작성 및 인용
• 긴 프롬프트에서 정보 추출
접두사 캐싱은 또 다른 유용한 최적화를 추가합니다. 동일한 25K 토큰 문서를 가지고 두 번째 질문을 할 때, 런타임이 모든 것을 다시 처리하는 대신 캐시된 접두사를 재사용할 수 있기 때문에 첫 토큰까지 걸리는 시간이 22.4초에서 0.56초로 감소합니다.
트레이드오프가 존재합니다: 고속 복제 모드는 요청 슬롯을 적게 사용하고 일부 컨텍스트 용량을 희생합니다. 모든 워크로드에 가장 좋은 구성은 아닙니다.
하지만 이것이 이 실험을 흥미롭게 만듭니다.
추론(inference)에 더 많은 하드웨어를 투입하는 대신, 개발자는 모델이 프롬프트로부터 이미 알고 있는 것에 맞춰 작업을 재설계했습니다.
가장 빠른 토큰은 다시 계산할 필요가 없는 토큰일 때가 있습니다. https://t.co/AlxGxC0hoI
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: RAG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기