이번 달에 본 것 중 최고 수준의 성능
요약
Qwen3.8-27b 모델이 RTX 4060 (8GB VRAM) 환경에서 로컬로 구동되는 성능을 보여주었습니다. Unsloth의 iq4_xs 양자화 덕분에 64k 컨텍스트를 처리할 수 있으며, 프리필 및 디코딩 속도 등 기술적 세부 사항이 제시되었습니다. 또한, 이 모델이 코딩 벤치마크(swe-bench pro)에서 플래그십 모델을 능가하는 성능을 기록했다는 점을 강조합니다.
핵심 포인트
- Qwen3.8-27b가 RTX 4060 (8GB VRAM)에서도 로컬 구동이 가능함.
- Unsloth의 iq4_xs 양자화로 64k 컨텍스트 처리가 가능해짐.
- 코딩 벤치마크(swe-bench pro)에서 플래그십 모델을 능가하는 성능을 보임.
- 저사양 GPU에서도 고성능 LLM 구동이 가능하다는 것을 입증함.
놀랍다. qwen3.8-27b 모델이 8GB VRAM을 가진 rtx 4060에서 로컬로 구동되고 있다.
64k 컨텍스트를 unsloth의 iq4_xs 양자화 덕분에, 디스크에 14.6GB가 필요하다. 프리필은 초당 약 150 토큰, 네이티브 mtp 사용 시 디코딩은 초당 약 5 토큰이다. 8GB 제한을 지키기 위해 단지 25개 레이어만 오프로드되었고, 오버플로우는 없다.
그리고 이 벤치마크 주장은 실제로 성립한다. 대부분의 경우와 달리: swe-bench pro에서 qwen3.8-27b가 61.7점을 기록했고, opus 4.6 max는 같은 테스트에서 53.4점을 기록했다.
$300짜리 GPU로 claude 플래그십 모델을 실제 코딩 벤치마크에서 능가하는 27B 모델이라니.
이 사실을 한번 곱씹어보라.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @cyrilxbt (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기