Swift1.5-Qwen3.8-Flash-Next가 베이스 모델 대비 얼마나 뛰어난지!
요약
Swift Flash 모델은 불필요한 추론을 대폭 줄여주면서도, Qwen3.8-Flash-Next와 같은 베이스 모델과 거의 동등한 성능을 보여줍니다. 특히 토큰 사용량과 처리 시간 측면에서 큰 효율성을 자랑하며, 복잡한 문제에서도 품질 저하가 적습니다. 벤치마크 결과는 Swift가 Base 모델 대비 약 4% 미만의 차이를 보이며, 이는 통계적으로 유의미하다고 보기 어렵지만 실질적인 시간 절약 효과가 매우 뛰어남을 입증합니다.
핵심 포인트
- Swift Flash는 추론 과정에서 불필요한 토큰 사용과 시간을 대폭 줄여줍니다.
- 베이스 모델 대비 성능 저하가 미미하며, 품질은 거의 동일하게 유지됩니다.
- 특히 복잡하고 긴 추론 과정에서 Swift의 효율성이 두드러집니다 (토큰/시간 절약).
- 벤치마크 결과는 Swift가 시간 및 토큰 사용량 측면에서 큰 이점을 가짐을 보여줍니다.
요약하자면 - Swift Flash는 불필요한 추론을 대폭 줄여주는 강력한 모델입니다. 한번 사용해 보세요!
제가 이전 비교 게시물들에서 보여드렸듯이, 저는 Swift Qwen3.8 모델의 열렬한 팬입니다. 27B 버전을 사용하기 시작한 이후로 정말 인상적인 성능과 품질을 경험했습니다 (v1.5는 훨씬 더 좋습니다). 과도하게 생각하는 경향이 줄어든 것은 큰 장점이며, 실제 사용이나 벤치마킹에서 품질은 본질적으로 동등해 보입니다. 시간 절약 효과가 엄청납니다.
UkisAI가 Swift Flash 모델을 출시할 계획이라고 했을 때 저는 기대감이 매우 컸습니다. 이것이 제가 로컬 환경에서 사용해본 최고의 일일 모델이지만, 아주 어려운 문제에 대해서는 3.8-27B보다 더 많이 생각하는 것처럼 보입니다. Unsloth의 Q5_K_XL 베이스(역시 Q8_0 engrams)와 비교하기 위해 Q5_K_L (Q8_0 engrams 포함)을 다운로드했습니다. 이것은 SSD engrams 및 262k 컨텍스트를 가진 상태에서 128GB에 안전하게 들어가는 최고 품질이며, 제가 만들 수 있는 가장 공정한 비교라고 생각합니다.
평소처럼 모든 모델에 대해 실행하는 Aider 에이전트 코딩 벤치마크를 돌렸습니다. 여기에는 첫 시도 및 재시도 통과율, 중앙값 토큰 사용량, 경과 시간(wall-clock), 솔브당 토큰 수(tokens/solve), 그리고 잘 구성된 diff 비율 등이 포함되어 있어 많은 유용한 데이터를 얻었습니다. 차트는 다음과 같습니다:
| 모델 | 첫 시도 통과율 | 재시도 통과율 | 케이스당 토큰 | 케이스당 초 | 솔브당 토큰 | 잘 구성된 diff |
|---|---|---|---|---|---|---|
| Qwen3.8-Flash-Next (xhigh) | 40.2% | 90.7% | 17646 | 1542 | 24.8K | 98.1% |
| Swift-1.5-Qwen3.8-Flash-Next (xhigh) | 41.1% | 86.9% | 6991 | 608 | 10.5K | 100.0% |
보시다시피, Swift는 베이스 모델과 거의 동일한 성능을 보여줍니다. 이 정도 규모의 데이터셋에서는 벤치마크 결과에 내재된 노이즈를 고려할 때 차이가 통계적으로 유의미하다고 말하기 어렵습니다. 현실적으로 약 5%의 차이는 의미가 있는데, 우리는 4% 미만을 보고 있습니다. 첫 시도 통과율을 보면 Swift는 쉬운 문제에서는 베이스 모델과 같은 비율로 해결하지만, 두 번째 시도가 필요한 가장 어려운 문제에서 약간 뒤처집니다. 베이스 모델은 재시도가 필요한 케이스의 84%를 회복하는 반면, Swift는 78%에 불과합니다.
토큰 사용량과 경과 시간(wall-clock) 측면에서는 비교할 필요가 없습니다.
Swift는 UkisAI가 주장하는 대로 작동합니다. 즉, 중간 토큰의 40%만 사용하고 중간 시간의 40% 만에 작업을 완료하며 품질은 거의 동일합니다. 이는 놀라운 일이며 그들의 RL/OPD 작업이 증명하는 바입니다.
특히 유용한 통찰점 하나는 다음과 같습니다. 베이스 모델(base)은 종종 길고 복잡한 추론 과정에 몰두하여 스스로 여러 번 루프를 형성하는 경향이 있습니다. Swift는 거의 그렇지 않습니다. 토큰 사용량이 가장 많은 20개 테스트에서, Swift는 전체 토큰의 29%만 사용했고 16/20 문제를 해결했으며, 이는 base 모델의 17/20과 비교됩니다. base가 가장 어렵다고 생각한 문제에서도 거의 모든 품질을 유지합니다. 어떤 경우에든 Swift가 사용하는 최대 토큰 수는 44k이며, base는 203k를 사용했습니다.
상위 3개 코딩 언어별 분석은 다음과 같습니다:
| model | cpp | javascript | python |
|---|---|---|---|
| Qwen3.8-Flash-Next (xhigh) | 23.1% / 84.6% | 37.5% / 91.7% | 57.6% / 93.9% |
| Swift-1.5-Qwen3.8-Flash-Next Q5_K_L (xhigh) | 30.8% / 73.1% | 41.7% / 93.8% | 48.5% / 87.9% |
paired vs base (n=107): 99개 동의, 2개 개선, 6개 손실(순수 −4), McNemar exact p ≈ 0.29 (유의미하지 않음). 다시 한번, 품질 면에서 통계적으로 구별할 수 없습니다. C++가 가장 압축률이 높아 base 사용 토큰의 단지 29%만 사용했습니다 (python/javascript는 약 46%). 또한 손실도 3/6로 발생했습니다. 만약 C++를 많이 코딩한다면 알아두면 좋을 점입니다.
어쨌든, 이 게시물은 충분히 길다고 생각합니다. 여러분 중 일부는 벌써 Swift 버전의 제가 있기를 바랄 것이라 확신합니다. 도움이 되었기를 바랍니다. 유용한 모델을 커뮤니티와 공유해 주신 u/Secure_Recording_472 님과 UkisAI 팀에게 감사드립니다!
제출자: /u/returnity | r/LocalLLaMA에 제출된 게시물 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기