1개의 RTX 5090에서 Qwen-3.8-Flash-Next 성능: TG=50 t/s, PP=2300 t/s - FreeToken 사용
요약
RTX 5090 단일 GPU 환경에서 Qwen 3.8 Flash Next 모델의 성능을 테스트한 내용입니다. llama.cpp 사용 시 Expert Caching 부재가 문제로 지적되었으며, 'FreeToken'이라는 도구를 활용하여 성능 개선을 시도하고 있습니다.
핵심 포인트
- RTX 5090에서 Qwen 3.8 Flash Next 모델 테스트 진행
- llama.cpp의 MoE Expert Caching 미구현이 주요 병목 지점임
- 'FreeToken' 도구를 활용하여 성능 최적화 시도 중
저는 llama.cpp를 사용하여 단일 RTX 5090에서 Qwen 3.8 Flash Next의 성능에 다소 실망했습니다. 한 가지 문제는 llama.cpp가 여전히 MoE 모델을 위한 Expert Caching을 구현하지 않았다는 것입니다. 다양한 PR과 논의(예: 여기 참조)가 있지만, 아직 아무것도 병합되지 않았습니다. 그러다가 'FreeToken'이라는 것을 발견했는데, 이 도구는
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기