동일한 10개의 Terminal-Bench 태스크에서 DeepSeek-V4 (IQ2/FP8)와 Qwen 3.6 27B 테스트 — Qwen이
요약
DeepSeek-V4와 Qwen 3.6 27B 모델을 대상으로 Terminal-Bench 2.0을 활용한 성능 비교 실험을 진행했습니다. 실험 결과, 풀 프리시전(Full-precision)으로 구동된 Qwen 3.6 27B 로컬 모델이 심하게 양자화된 플래그십 모델보다 에이전트 작업에서 우수한 성능을 보일 수 있음을 확인했습니다.
핵심 포인트
- Qwen 3.6 27B 로컬 모델이 고난도 병렬 처리 태스크를 유일하게 통과함
- 2-bit IQ2 양자화 모델이 FP8 API 모델과 유사한 성능을 유지함
- 풀 프리시전 중소형 모델이 양자화된 대형 모델을 능가할 가능성 제시
- 단일 시도 실험으로 인한 통계적 유의성 및 샘플링 변수 통제 한계 존재
*실험
- 이 설정의 이유: 저는 **RTX PRO 6000 (96 GB)**를 사용하고 있어, 27–70B 모델을 Full Precision (전정밀도)으로 여유롭게 구동할 수 있습니다. 저의 관심사는 해당 크기의 로컬 서버 모델(locally-served models)을 사용할 때, 양자화된 플래그십(quantized flagships) 모델이나 API 호출과 비교하여 실제로 무엇을 얻을 수 있는가입니다. 따라서 저는 네 가지 서빙 설정(API 호출을 기준점으로 사용했습니다. 이는 동일한 모델을 Full Quality로 사용하는 것이므로, Q2 버전을 로컬에서 실행할 때 얼마나 손실이 발생하는지 알려줍니다)에 대해 10개의 Terminal-Bench 2.0 파일럿 테스트(Harbor
terminus-2에이전트, JSON 파서, 태스크당 1회 시도, 동일한 사전 등록된 하위 집합: 쉬움 3개 / 중간 5개 / 어려움 2개)를 수행했습니다.
설정 / 하드웨어 / 스택:
- DeepSeek-V4 Flash UD-IQ2_XXS 로컬, llama.cpp, ~2-bit
- DeepSeek-V4 Flash FP8 OpenRouter (Novita 고정)
- Qwen 3.6 27B (abliterated) BF16 로컬, vLLM + llama-swap, MTP spec decode
- Laguna S 2.1 Q4_K_M 로컬, llama.cpp (2개 태스크 후 중단)
*결과
- 설정 / 점수 / Wall time (실제 소요 시간) / 비용
- DeepSeek-V4 FP8 (API): 9/10, 56m, $0.14
- Qwen 3.6 27B (local): 8/10, 58m, $0
- DeepSeek-V4 IQ2 (local): 7/10, 1h06m, $0
흥미로운 점:
- Qwen은
cancel-async-tasks(어려움)를 통과한 유일한 설정이었습니다. — 이는 IQ2, FP8, Laguna가 모두 실패한 병렬 처리 정리(concurrency-cleanup) 태스크입니다. - 2-bit IQ2 양자화(quant)는 7/10을 유지했습니다 — 약 2-bit 가중치를 사용하는 FP8 API 실행 결과와 놀라울 정도로 근접했습니다.
- Qwen의 유일한 실패:
build-cython-ext및sqlite-db-truncate(타임아웃, 15m — 수동 SQLite 페이지 파싱을 깊게 시도했습니다).
*한계점
- 태스크당 단 한 번의 확률적(stochastic) 시도 — 안정적인 점수가 아님.
- 샘플링 혼란 변수(Sampling confound): llama-swap는 클라이언트의 temp/top_p를 제거하고, vLLM은 서버 측 튜닝된 기본값(temp 0.7, top_k 20)을 강제했으므로, 로컬 실행은 API 실행과 같은 진정한 temp-1.0 상태가 아니었습니다.
- 양자화(Quantization)가 서빙 스택(llama.cpp vs vLLM vs API)과 혼재되어 있습니다 — 순수한 가중치(weights) 실험이 아닙니다.
- 통제된 디코딩 벤치마크가 없음; Wall time에는 에이전트 루프가 포함되어 있으며, 순수 tok/s(초당 토큰 수)가 아닙니다.
- 한 번의 시행은 하네스(harness) 버그로 인해 무효화되어 재실행되었습니다; 재실행은 전체 스위트가 아닌 태스크별로 이루어졌습니다.
핵심 요약: 풀 프리시전 (full-precision) 27B 로컬 모델이 에이전트적 작업 (agentic work)에서 심하게 양자화된 플래그십 모델을 이길 수 있습니다 — 하지만 이는 단 한 번의 테스트 결과일 뿐, 최종적인 결론은 아닙니다. /u/Saber-tooth-tiger가 r/LocalLLaMA에 게시함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기