Qwen3.8-Flash-Next가 5090에서 Claude Code Opus 5.5를 능가하다
요약
Qwen3.8-Flash-Next 모델을 5090 GPU 환경에서 Strata와 pi 도구를 사용하여 테스트한 결과, 일상적인 작업을 비교하는 airbench 테스트 스위트에서 Claude Code Opus 5.5를 능가하는 성능을 보여주었습니다. 이 글은 구체적인 하드웨어 요구사항과 Docker 명령어를 포함하여 모델 서버 설정 및 실행 방법을 상세히 안내합니다.
핵심 포인트
- Qwen3.8-Flash-Next가 airbench 테스트에서 Claude Code Opus 5.5보다 빠름.
- 테스트는 일상적 작업을 비교하는 벤치마크(airbench)에 초점을 맞춤.
- 실행을 위해 24GB 이상의 NVIDIA GPU와 64GB RAM 이상이 필요함.
- Strata 및 pi 도구를 이용해 OpenAI 호환 API 서버를 구축할 수 있음.
제목이 오해의 소지가 있다는 점을 수정합니다: Qwen3.8-Flash-Next Strata pi는 일상적인 작업을 비교하는 데 전념한 벤치마크에서 5090으로 Claude Code Opus 5.5를 능가했습니다. 최첨단 모델을 차별하려는 것이 아닙니다. --- 원문 게시글: 저는 Qwen3.8-Flash-Next를 Strata와 pi로 사용하고 있으며, 이를 통해 airbench 테스트 스위트에서 11분 만에 100% 점수를 얻을 수 있었습니다. 같은 작업을 수행한 Claude Code는 동일한 점수를 받았지만 14분이 걸렸습니다. (Airbench는 일상생활에 유용한 다양한 작업을 테스트합니다. 최첨단 모델을 차별하는 벤치마크가 아닙니다.) 모델: https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF Strata: https://github.com/Niko1221/Strata pi: https://github.com/earendil-works/pi 그리고 설정을 검증하기 위해 airbench: https://airbench.ai/ 더 자세한 내용: 재현에 필요한 하드웨어: 24GB 이상의 NVIDIA GPU, 시스템 RAM 약 64GB 이상, 그리고 90GB의 여유 디스크 공간이 필요합니다. RAM이 실제 한계입니다. IQ3_S 양자화는 전문가(experts) 약 50GB를 RAM에 유지합니다. 제 64GB 장비에서는 작동하지만 빠듯했습니다. 실행 중 약 5GB가 남아 있었고, 스왑 사용도 약간 있었습니다. Strata 자체 추정치에 따르면 256k 컨텍스트에서의 IQ3_S는 약 78GB입니다.
모델 서버 설정 (Strata)
모델: ISTA-DASLab GSQ-RCO 양자화된 Qwen3.8-Flash-Next, IQ3_S (3.5비트). Strata가 처음 시작할 때 이를 다운로드합니다(약 84GB). 이미지를 한 번 빌드하세요 (저는 커밋 99f3dbd를 사용했고; CUDA_ARCHITECTURES는 5090의 경우 120, 3090의 경우 86입니다):
git clone https://github.com/Niko1221/Strata<br>cd Strata<br>git checkout 99f3dbd<br>docker build -t strata:99f3dbd --build-arg CUDA_ARCHITECTURES=120 .<br><br>IQ3_S 양자화와 256k 컨텍스트로 실행합니다:
docker run -d --gpus all --net=host --shm-size=8gb --ulimit memlock=-1 -v /path/to/strata-data:/data -e HOST=127.0.0.1 -e PORT=9000 -e FAMILY=qwen -e MODEL=IQ3_S -e CONTEXT=262144 -e VISION=yes --name strata strata:99f3dbd<br><br>이는 http://127.0.0.1:9000/v1에서 OpenAI와 호환되는 API를 제공하며, 모델 ID는 qwen3.8-flash-next-iq3_s입니다. 그 외 모든 것은 Strata의 기본 설정입니다.
엔진이 설정한 플래그는 다음과 같습니다: --expert-cache auto --prefill auto --spec 4 --spec-min-p 0.5 --mtp /data/mtp/rt --max-context 262144 --kv int8 --vision --vram-reserve-mib 700 Harness 설정 (pi) pi 버전 0.73.1 (npm 패키지 u/mariozechner), node:22-bookworm-slim 컨테이너에서 실행, 비대화형: pi -p --mode json --model qwen3.8-flash-next-iq3_s "<airbench 체크업 프롬프트>" pi의 설정 디렉토리(PI_CODING_AGENT_DIR)에는 두 개의 파일이 있습니다. models.json: {"providers": {"local": {"baseUrl": "http://127.0.0.1:9000/v1", "api": "openai-completions", "apiKey": "sk-local", "compat": {"supportsDeveloperRole": false, "supportsReasoningEffort": false}, "models": [{"id": "qwen3.8-flash-next-iq3_s", "reasoning": true, "input": ["text", "image"], "contextWindow": 262144, "maxTokens": 32768}]}}} settings.json: {"defaultProvider": "local", "defaultModel": "qwen3.8-flash-next-iq3_s", "quietStartup": true, "compaction": {"enabled": true, "reserveTokens": 65536, "keepRecentTokens": 20000}} 두 설정은 pi의 기본값과 다릅니다: 32k 출력 제한 및 64k 압축 예약(pi의 기본값 16k 대비, 이미지 결과 하나만으로도 프롬프트를 창을 넘어서게 할 수 있음). 벤치마크 실행 airbench.ai에서 airbench 체크업을 시작하려면, 도전 과제를 포함하는 프롬프트를 복사하여 결과를 기다리기만 하면 됩니다. (저는 자체 오케스트레이터 스크립트를 사용했는데, 이 스크립트는 체크업을 생성하고, pi 설정을 작성하며, pi를 실행하고, 세션 로그를 업로드하며, 등급을 가져옵니다. 또한 pi와 Strata 사이에 작은 프록시를 배치하여: 요청은 변경 없이 전달하지만, 컨텍스트를 초과할 것 같은 출력 요청(최소 8k 토큰의 여유 공간이 남아 있을 때)은 축소하고, 오버플로우 오류는 pi가 인식하고 압축하도록 재작성합니다. 동일한 설정의 다른 하네스 Same Strata IQ3_S 256k 서버 on the RTX 5090, 각 하나 실행: omp 18.4.2: 48/49 (1 실패) in 16 min. https://airbench.ai/checkup/2d3a4f0c-0b3c-4eec-ac79-c177815c5720 opencode 1.18.29: 46/49 (3 실패) in 11 min.
https://airbench.ai/checkup/a3121ebe-3221-40f4-a565-32a44e329d20 dsh (DeepSeek Harness) 0.2.0-rc.2: 47/49 (2 실패) in 11분. https://airbench.ai/checkup/9e464769-409c-440d-a179-1587940928da 제출자 /u/dh7net [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기