DeepSeek-V4-Flash-0731: 낮음(Low)이 높음(High)보다 더 높을 때
요약
DeepSeek-V4-Flash-0731 모델의 네 가지 추론 노력 모드(None, Low, High, Max)에 따른 토큰 사용량과 성능을 비교 분석했습니다. 실험 결과 'Low' 모드가 예상과 달리 매우 장황한 출력을 생성하는 특이 현상이 발견되었습니다.
핵심 포인트
- DeepSeek-V4-Flash-0731의 4가지 추론 노력 모드 분석
- Low 모드가 다른 모드에 비해 비정상적으로 장황한 토큰 사용량 기록
- 로컬 양자화 버전과 공식 API 간의 결과 검증 수행
- OpenRouter 사용 시 추론 노력 모드 관련 버그 주의 필요
저는 DeepSeek-V4-Flash-0731을 대상으로 몇 가지 질문을 테스트해 보기로 했습니다. 로컬(Locally) 환경에서는 Unsloth의 UD-Q2_K_XL 양자화(quant) 버전을 실행했습니다. 결과의 놀라운 형태를 확인한 후, 제가 무언가 잘못하지 않았음을 확인하기 위해 DeepSeek의 공식 API를 대상으로 테스트를 진행했습니다. OpenRouter를 사용하는 분들은 추론 노력 모드(reasoning effort modes)를 망가뜨리는 심각한 버그가 있다는 점을 유의하십시오. 저는 로컬 결과를 검증하는 과정에서 그 문제를 겪었습니다. DeepSeek-V4-Flash-0731은 추론 없음(no reasoning), 낮음(low), 높음(high), 최대(max)로 구성된 네 가지 서로 다른 노력 모드를 지원합니다. 또한 이러한 모드들이 모델에 어떻게 전달되는지도 확인할 수 있습니다. 제가 발견한 바와 같이, '낮음(Low)' 모드는 놀라울 정도로 장황합니다. 모드당 20개의 요청을 평균 내었을 때, 각 모드에서 사용된 토큰 수는 다음과 같습니다:
모드 | 로컬 Q2 전체 / 추론 / 최종 | DeepSeek API 전체 / 추론 / 최종
None | 801.7 / 0 / 801.7 | 948.9 / 0 / 948.9
Low | 1,227.5 / 874.4 / 353.2 | 1,349.2 / 889.6 / 459.7
High | 605.8 / 410.5 / 195.4 | 481.5 / 253.9 / 227.7
Max | 1,301.4 / 1,031.8 / 269.6 | 698.7 / 473.9 / 224.8
DeepSeek와 Artificial Analysis가 '최대(max)' 모드뿐만 아니라 모든 노력 모드에 대한 벤치마크(benchmarks)를 게시했더라면 정말 좋았을 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기