Halogen + Qwen Flash Next의 성능 향상
요약
Halogen 버전 0.17.2 업데이트를 통해 128GB Strix Halo 환경에서 Qwen 3.8 Flash Next 모델을 구동했을 때, 긴 컨텍스트 길이에서도 일관되게 높은 디코딩 속도(약 45 tps)가 유지되는 성능 향상을 확인했습니다.
핵심 포인트
- Halogen 0.17.2 업데이트로 성능 개선이 이루어짐.
- Strix Halo 환경에서 Qwen 3.8 Flash Next의 속도가 안정적임.
- 긴 컨텍스트 길이에서도 높은 디코딩 속도(45 tps)를 유지함.
최신 Halogen 버전 업데이트(0.17.2)를 사용했을 때, 128GB Strix Halo에서 높은 컨텍스트 길이에서도 Qwen 3.8 Flash Next로 디코딩 속도가 일관되게 약 45 tps를 유지합니다. u/peonist-ai님의 정말 대단한 작업입니다. QFN으로 커밋을 계속해서 내고 있습니다. 1770억 개에 달하는 모델치고는 정말 놀랍습니다. 😂 Opus 5.5 계획이 QFN에 의해 구현되고 검토된 것은 매우 높은 품질입니다 ❤️ https://preview.redd.it/yyji811t28uh1.png?width=1358&format=png&auto=webp&s=99d119ea46982d0b8710b1ff6a817551096a26c4 /u/deepu105가 제출했습니다. [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기