가이드: Qwen3.8의 과도한 사고(Overthink)를 우회하는 방법
요약
본 가이드는 LLM의 과도한 사고(Overthinking)를 제어하고 효율적인 추론을 유도하는 방법을 제시합니다. 작업 난이도에 따라 적절한 '추론 예산(Reasoning Budgets)'을 설정하는 것이 중요하며, 간단한 스크립트부터 복잡한 코딩까지 토큰 할당량을 조절할 수 있습니다.
핵심 포인트
- 작업 난이도별 추론 예산(토큰) 설정을 권장합니다. (예: 512-4096 토큰)
- 복잡한 작업에는 충분한 컨텍스트 길이(8K~16K)가 필요할 수 있습니다.
- 모델에게 `reasoning_effort=medium`을 설정하되, 예산은 지정해야 합니다.
- 프롬프트에 `--Reasoning-budget-message`를 활용하여 모델의 패턴 인식을 돕습니다.
시중에 생각(thinking)을 줄여준다고 약속하는 파인튜닝 모델이 많지만, 종종 모델 자체를 더 나쁘게 만듭니다. 작업 난이도에 비례하여 추론 예산(reasoning budgets)을 설정하는 것을 두려워하지 마세요. 2048 토큰으로 Qwen3.8-27b는 제가 Gemini 3.8에게 준 문제를 해결했는데, Gemini는 완전히 실패했습니다. 대부분의 일상적인 작업은 2048 토큰 이상이 필요하지 않을 것이지만, 더 어려운 코딩에는 4096 토큰이 필요할 수 있습니다. 하지만 아래 가이드는 저에게 가장 잘 작동하는 방법이며, 간단한 스크립트나 루프 자동화 작업을 한다면 512만으로도 충분합니다.
추론 예산 (Reasoning Budgets)
- 512 – 1,024 토큰: 가벼운 논리(Light logic), 간단한 스크립트
- 2,048 – 4,096 토큰: 표준 코딩 작업, 논리 퍼즐, 다단계 시스템 아키텍처, 리팩토링
- 8,192 토큰: 어려운 수학(AIME 스타일), 알고리즘 엣지 케이스, 깊이 중첩된 코드 디버깅.
- 16,384 토큰: 최전선 경쟁 수준의 수학/코딩, 시스템 전체 개편/대규모 리팩토링, 복잡한 법률/논리 분석
또한 --Reasoning-budget-message를 - ok now.로 설정했습니다.
ok now는 모델이 패턴을 자연스럽게 파악하도록 하는 데 보편적으로 잘 작동합니다. 또한 reasoning_effort=medium으로 설정하는 것이 좋으며, low보다 낫습니다. medium은 모델에게 작업에 게으른 노력을 하지 않도록 지시합니다. 따라서 medium으로 설정하되 추론 예산(reasoning-budget)을 여전히 지정하세요. Qwen3.8은 낮은 수준에서도 생각하는 데 매우 관대하기 때문에, 때로는 low한 추론도 예산이 필요할 수 있습니다.
제출자: /u/Express_Quail_1493 to r/LocalLLaMA
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기