
Qwen 3.8 Max Preview에 대한 추가 생각 - 입력 비용 측면에서 훨씬 더 효율적인 토큰 사용
요약
Qwen 3.8 Max Preview가 Minimax M3 및 GPT 5.6 시리즈와 비교했을 때 입력 토큰 사용 측면에서 훨씬 효율적임을 분석합니다. Qwen은 불필요한 서브 에이전트 생성이나 과도한 파일 읽기를 지양하고 체계적인 분석을 수행하여 비용 효율성을 높였습니다.
핵심 포인트
- Qwen 3.8 Max Preview는 타 모델 대비 매우 효율적인 토큰 사용량을 보여줌
- Minimax M3와 GPT 5.6은 과도한 분석 및 감사로 인해 토큰 소모가 큼
- Qwen은 정밀한 파일 읽기를 통해 입력 토큰 낭비를 최소화함
- Roo Code 환경에서 Qwen 모델의 비용 효율성이 입증됨
제 이전 게시물 제목이 Qwen 3.7 Max Preview로 잘못 기재되었습니다. 뭐, 어쨌든 그 게시물에서 저는 이를 Minimax M3, 5.6 Sol X high, 그리고 5.6 Luna High와 비교했습니다. 동일한 턴당 프롬프트 주입 (Prompt Injection)/시스템 지침 (System Instructions)을 사용했을 때, 해당 게시물에서 저는 Qwen 3.8 Max Preview가 세부 사항과 지침을 더 철저하게 다루거나 일반적으로 서브 에이전트 (Subagents)에게 더 긴 프롬프트를 제공하는 반면, Minimax M3와 GPT 5.6 시리즈는 전반적으로 게을러서 서브 에이전트에게 더 짧고 덜 상세한 프롬프트를 제공한다고 언급했습니다. 그리고 세상에, 사용된 총 토큰 양을 처음 확인했을 때, '이게 진짜인가?'라고 생각했습니다. 이 정도 시간에 이만큼의 토큰을 쓴다고? 뭔가 버그가 있는 건가? Minimax나 GPT 5.6 시리즈에 비해 너무 적다는 생각이 들었습니다. 하지만 알고 보니, 입력 토큰을 엄청나게 잡아먹는 Minimax M3와 비교했을 때, Qwen 3.8 Max Preview는 분석을 수행하는 데 있어 매우 체계적이었습니다. 반면 Minimax M3와 5.6 모델들은 분석과 감사 (Auditing)를 과하게 수행하여 두 배 또는 세 배 더 많은 서브 에이전트를 생성하고, 아마도 필요 이상으로 더 많은 파일을 읽는 경향이 있었습니다. 첨부된 사진에서 볼 수 있듯이, Qwen 3.8 Max는 파일을 더 정밀하게 읽거나 입력 토큰을 낭비하지 않는 것으로 보입니다. 이것은 제가 오후 9시부터 연속적인 작업들을 쉬지 않고 사용했을 때의 결과입니다. 동일한 속도로 진행했다면, Minimax M3는 최소 5,000만 개의 입력 토큰을 소비했을 것이고, GPT 5.6 시리즈는 최소 3,000만 개 정도를 소비했을 것입니다. 첨부된 사진은 제가 가장 편하게 사용하고 제 필요에 맞게 소스 코드를 많이 수정해서 사용하는 Roo Code입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기