Swift-Qwen3.8-27B: 추론 효율성 개선 모델
요약
Swift-Qwen3.8-27B는 Qwen3.8-27B의 추론 효율성을 높인 파생 모델입니다. 이 모델은 '추론 마커 토큰' 사용에 페널티를 부여하도록 튜닝되어, 사고 토큰을 크게 줄이면서도 성능 손실을 최소화했습니다. 이를 통해 최대 x1.95의 속도 향상을 달성하여 효율적인 배포가 가능합니다.
핵심 포인트
- 사고 토큰(thinking tokens) 사용량을 58.3% 절감함.
- 성능 손실은 <1%로 매우 낮게 유지됨.
- 최대 x1.95의 추론 속도 향상을 달성하여 효율적임.
- 낮은 메모리 용량과 짧은 과정이 필요한 환경에 최적화됨.
Swift-Qwen3.8-27B는 UkisAI가 개발한 Qwen3.8-27B의 추론 효율성을 높인 파생 모델입니다. 이 모델은 58.3% 적은 사고 토큰(thinking tokens)을 사용하면서도 거의 동일한 성능(<1% 손실)을 유지하여, 여러 작업에서 x1.95 속도 향상을 달성했습니다.
프롬프트는 LiveCodeBench v6의 샘플입니다.
저희는 Qwen의 추론 과정(reasoning rollouts)에서 과도한 사고를 유발하는 '추론 마커 토큰(reasoning-marker tokens)'을 식별하여 Swift를 구축했습니다. 이후 모델이 추론할 때 해당 토큰 사용에 페널티를 부여하도록 Qwen을 파인튜닝(fine-tuned)했습니다.
Swift는 더 짧은 추론 과정을 생성하며, 테스트 결과 과도한 사고 오류(overthinking errors)가 적다는 점도 관찰되었습니다.
최대 성능 향상을 위해 Swift에는 BottleCap AI의 ThinkingCap-Qwen3.6-27B에서 파생된 전이 구성 요소(transfer component)도 포함되어 있습니다.
아래 모든 결과는 Qwen3.8-27B BF16 베이스 모델과 동일한 베이스에 Swift 어댑터가 적용된 경우를 비교합니다.
| Benchmark | Score | Mean tokens | Median tokens |
|---|---|---|---|
| Base | Swift | Base | Swift |
| ... | |||
| 재현 방법(How to reproduce) |
서빙(Serving): BF16 · vLLM 0.27.1 · Qwen3 파서 · 컨텍스트 262,144 · 사고 토큰 xhigh.
샘플링(Sampling): temperature 1.0 · top_p 0.95 · top_k 20 · min_p 0 · presence_penalty 0 · repetition_penalty 1.
벤치마크: 각 모델별로 다섯 개의 시드(seed) (0–4)에 걸쳐 평균을 내고, Terminal-Bench의 경우 작업당 다섯 번의 트라이얼(trial)을 사용했습니다.
| Benchmark | Output cap |
|---|---|
| GPQA-Diamond | 100,000 |
| ... | |
Qwen3.8의 reasoning_effort 설정은 사용자에게 모델이 얼마나 생각할지 선택할 수 있게 합니다. Swift가 이러한 모든 설정에서 유용하려면 정확도를 베이스와 가깝게 유지하면서 사고 과정을 줄여야 합니다. 따라서 저희는 xhigh, medium, 그리고 low 설정을 테스트했습니다: | |
| 사고 토큰 절감 효과는 모든 레벨에서 지속됩니다. |
| Reasoning effort | Mean thinking reduction |
|---|---|
| Xhigh | ↓ 41.0% |
| ... | |
이러한 효율성은 베이스 모델 자체의 낮은 노력(lower effort) 설정에서도 유지됩니다. GPQA-Diamond (198개 질문, 5개 시드, 990쌍 호출)에서 Swift를 xhigh로 설정했을 때의 성능을 베이스 모델을 xhigh 및 medium으로 설정했을 때와 비교했습니다. |
| GPQA-Diamond | Score | Mean tokens | Median tokens |
|---|---|---|---|
| Base · xhigh | 88.38% | 15,014 | 6,642 |
| ... | |||
Swift는 xhigh의 정확도를 유지하면서도 토큰을 절반가량 사용하며, medium보다 두 배가량 적은 토큰을 사용하는 것이 가능합니다. |
Swift는 낮은 메모리 용량의 가중치와 짧은 추론 과정이 필요한 경우에 최적화된 배포 방식입니다. 아래 INT4 평가에서는 GPQA, IFBench, AIME 전반에 걸쳐 토큰 절감 효과를 유지합니다. 특히 AIME에서 Swift는 정확도를 일치시키거나 개선하고 출력 제한(output-cap) 실패율을 31–33% 감소시킵니다.
| Benchmark / quantization | Base accuracy | Swift accuracy | Mean token reduction | Median token reduction |
|---|---|---|---|
| GPQA-Diamond Mixed-precision quant W4A16 · thinking tokens | 88.69% | 88.38% | ↓ 32.1% | ↓ 50.2% |
| ... |
양자화 평가 설정(Quantized evaluation settings)
각 행은 Swift 어댑터 유무에 따른 동일한 양자화된 베이스 모델을 비교합니다. GPQA와 AIME은 다섯 개의 시드(seeds)를 사용하며, IFBench는 프롬프트당 네 개의 샘플과 엄격한 채점 방식을 사용합니다. 출력 제한(Output caps): GPQA 100,000; IFBench 81,920; AIME 32,768. GPQA와 IFBench는 저장된 과거 베이스 실행 결과를 사용합니다. AIME은 템플릿 기본 노력(template-default effort)을 사용하며 잘린 답변을 오답으로 간주합니다. 이 짧은 제한 덕분에 BF16 표와 별도의 비교가 가능합니다.
GGUF 버전은 호환되는 llama.cpp 기반 런타임에서 사용할 수 있습니다.
Swift는 https://ukisai.com/api/swift/v1의 OpenAI 호환 API를 통해 제공됩니다.
이는 연구 목적으로 무료이며 API 키가 필요하지 않습니다. 모델 ID는 swift입니다.
from openai import OpenAI
client = OpenAI(base_url="https://ukisai.com/api/swift/v1", api_key="none")
response = client.chat.completions.create(...)
curl https://ukisai.com/api/swift/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "swift", "messages": [{"role": "user", "content": "Hello, Swift."}]}'
import torch
from transformers import AutoModelForImageTextToText, AutoProcessor
model_id = "ukisai/Swift-Qwen3.8-27b"
...
대안으로, Qwen3.8 지원이 포함된 최신 SGLang 빌드를 사용할 수 있습니다:
python -m sglang.launch_server \
--model-path ukisai/Swift-Qwen3.8-27b \
--dtype bfloat16 \
...
텐서 병렬화(tensor parallelism)와 컨텍스트 길이(context length)는 사용자의 GPU 메모리에 맞게 조정하십시오. 설치 및 하드웨어별 설정에 대해서는 기본 모델의 vLLM 레시피와 SGLang 레시피를 참조하십시오.
공개된 가중치에는 기본 모델의 MTP 헤드가 포함되어 있습니다. 자체 추측 디코딩(self-speculative decoding)을 활성화하려면 위 서버 명령어에 해당 플래그를 추가하십시오:
# vLLM
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
# SGLang
...
Swift-Qwen3.8-27B는 Qwen3.8-27B의 파생 모델입니다
(Copyright 2026 Alibaba Cloud, Apache License 2.0). UkisAI가 기여한 미세 조정된 가중치는 Swift Open License v1.0에 따라 라이선스가 부여됩니다.
NOTICE를 참조하여 정확히 어떤 부분이 변경되었는지 확인하십시오.
개인, 연구, 교육, 평가 및 상업적 사용은 연간 총매출액이 최대 US$1,000,000 이하인 개인 및 조직에게는 무료입니다. 이 기준을 초과하는 경우, 상업적 사용에는 별도의 Swift Enterprise License가 필요합니다.
약관은 UkisAI에 문의하십시오.
Swift Open License의 어떤 내용도 Apache 2.0 하의 Qwen3.8-27B 자체에 대한 귀하의 권리를 제한하지 않습니다.
@misc{swift-qwen3.8-27b,
title = {Swift-Qwen3.8-27B},
author = {UkisAI},
...
NVIDIA Innovation Lab에 Swift 학습을 위한 8× NVIDIA H100 GPU 접근성을 제공해 준 것에 대해 감사를 표합니다.
- 지난달 다운로드 수: 22,561
AI 자동 생성 콘텐츠
본 콘텐츠는 HN Chip/GPU의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기