두 번 생각하기가 당신을 멍청하게 만들 수 있다: 9월의 가장 스마트한 모델 뒤에 숨겨진 테스트 시간 컴퓨팅 플레이북
요약
기존 AI 발전의 축이 '모델 크기'에 집중되었다면, 이제는 질문 후 모델이 더 오래 생각하는 '테스트 시간 컴퓨팅'이 핵심 트렌드가 되었습니다. 적절한 사고 전략만으로도 훨씬 작은 모델이 큰 모델과 동등하거나 능가하는 추론 성능을 보여줍니다. 주요 방법으로는 순차적 사고(Sequential thinking), 자기 일관성(Self-consistency) 등이 있습니다.
핵심 포인트
- 모델 크기 외 '사고 과정'이 AI 성능의 새로운 핵심 축입니다.
- 테스트 시간 컴퓨팅은 추가 훈련 없이 추론 단계에서 성능을 향상시킵니다.
- 순차적 사고는 Propose, Reflect, Backtrack 과정을 거치며 깊은 사유를 가능하게 합니다.
- 자기 일관성은 다수결 투표 방식으로 정확도를 크게 높일 수 있습니다.
10년 동안 AI를 더 스마트하게 만드는 것은 한 가지 의미였습니다: 모델을 더 크게 훈련하는 것. 더 많은 데이터, 더 많은 GPU, 더 많은 파라미터 — 이것이 전체 플레이북이었습니다. 그러다가 연구자들은 아무도 완전히 활용하지 못했던 세 번째 축을 발견했습니다: 질문이 도착한 후 모델이 더 오래 생각하게 만드는 것.
그 보상은 엄청납니다. 적절한 사고 전략이 주어진 4배 작은 모델이 최대 14배 크기의 모델과 어려운 추론 작업에서 동등하거나 능가하는 성능을 보였습니다 (Snell et al., 2024). 제대로 읽으셨습니다: 추가적인 훈련도, 추가적인 가중치(weights)도 필요 없습니다 — 단지 _사고_만으로 말입니다.
이것이 테스트 시간 컴퓨팅(test-time compute)입니다. 이것이 이번 달 출시된 모든 플래그십 모델들이
1. 순차적 사고 (Sequential thinking, 즉 긴 사슬의 사고 과정). 모델이 답변을 내기 전에 계속해서 글을 쓰는 방식입니다. 제안하고(Propose), 반성하며(Reflect), 되돌아가고(Backtrack), 다시 시도하는 것입니다. 간단하지만 다른 모든 것이 구축되는 기반입니다. 문제는 단일 추론 요청만으로 최종 답변을 내기 전에 16,000128,000개의 내부 사고 토큰을 생성할 수 있다는 점입니다. 이는 이전의 원샷(one-shot) 모델보다 10100배 더 많은 토큰 양입니다.
2. 자기 일관성 (Self-consistency, 다수결 투표). N번 질문하고 가장 흔한 답변을 채택하는 방식입니다. 초등학교 수학 문제(GSM8K)에서 이 방법은 PaLM 540B의 성능을 56.5%에서 74.4%로 끌어올렸습니다. 이는 오직 투표만으로 얻은 17.9% 포인트 상승분입니다 (Wang et al., 2023). 정답이 출력 공간에 모여 있는 경우(cluster) 작동합니다. 선형적이지 않은(sublinear) 이득을 얻기 위해 N×의 컴퓨팅 비용이 발생합니다.
3. Best-of-N + 검증 모델 (verifiers). N개의 솔루션을 샘플링한 다음, _검증 모델(verifier)_에게 점수를 매기고 가장 좋은 것을 선택하게 하는 방식입니다. 두 가지 유형이 있습니다: **결과 보상 모델(outcome reward models, ORMs)**은 최종 답변에 점수를 매기고; **과정 보상 모델(process reward models, PRMs)**은 모든 중간 단계에 점수를 매깁니다. PRM은 수학 문제에서 결과만 검증하는 방식보다 10~20% 더 나은 성능을 보였습니다. 그 이유는 잘못된 단계를 포착하는 것이 단순히 틀린 답안을 채점하는 것보다 훨씬 유용하기 때문입니다. 이 모델들을 훈련시키는 것은 비용이 많이 들기 때문에 (PRM800K는 약 80만 개의 인간 단계별 라벨 사용), 자동화된 PRM 훈련은 현재 활발한 연구 분야입니다.
4. 검색 (Search, 사고의 트리/MCTS). 여러 추론 경로를 탐색하고(Explore), 부분적인 솔루션을 평가하며(evaluate), 막히면 되돌아가는(backtrack) 방식입니다. 모델이 탐험가이자 심판 역할을 동시에 수행하는 것입니다. 가장 어려운 조합 문제에 가장 강력하지만, 실행하기는 가장 복잡합니다.
스케일링 법칙: 새로운 축, 여전히 감소하는 수익률
경험적 규칙은 다음과 같습니다: 품질 ∝ (추론 컴퓨팅량)^β, 대략 로그-선형(log-linear) 관계입니다. 사고 토큰을 두 배로 늘리는 것이 신뢰할 수 있지만 점차 줄어드는 정확도 향상을 가져옵니다. 일반적인 Best-of-N 방식은 N=4부터 N=256까지 실행되며, 대부분의 가치는 N=64에서 포착됩니다.
compute-optimal finding (Snell et al., 2024)은 예산(budget)을 재편성한 발견입니다. 작은 모델이 사소하지 않은 기준점(non-trivial baseline)을 가진 문제의 경우, 적절한 테스트 시간 전략(test-time strategy)을 가진 더 작은 모델이 순진한 전략을 가진 14배 큰 모델보다 우수합니다. 이 현상을 이끄는 두 가지 메커니즘이 있습니다: 밀집 프로세스 검증기(dense process verifiers)를 대상으로 검색하는 것, 그리고 프롬프트의 난이도에 따라 전략을 조정하는 것입니다. 쉬운 문제는 하나의 해답에 대한 반복적인 정제(iterative refinement)를 얻고, 어려운 문제는 광범위한 검색(broad search)을 얻습니다.
반전: 더 오래 생각하는 것이 당신을 멍청하게 만들 수 있다
여기서 2026년 9월이 흥미로워졌습니다. 대규모 추론 모델(large reasoning models)에 대한 새로운 연구는 '생각할수록 좋다'는 이야기와 정반대의 결과를 가져왔습니다:
- 어려운 벤치마크(AIME25, GPQA)에서 모델의 첫 번째 해답이 이미 93.7%의 확률로 최적입니다.
- 첫 답변이 틀렸을 때, 나중에 생각하는 것이 그것을 수정하는 경우는 **2–7%**에 불과하며 — 대부분의 추적(traces)은 여전히 틀린 상태를 유지합니다 (75–83%).
- 더 심각한 것은: 나중에 생각하는 과정이 올바른 첫 답변을 잘못된 것으로 만드는 비율이 **최대 21%**에 달한다는 것입니다. 이 손실은 이득을 압도합니다.
- 해결책 — 도움이 되지 않을 때 추적을 중단시키는 것 — 은 토큰 사용량을 최대 70%까지 줄였습니다。
손상 뒤에는 이론이 있습니다. Bay와 Yearick의 "샘플링 천장(sampling ceilings)" 연구는 테스트 시간 샘플링이 **클러스터 샘플링(cluster sampling)**임을 보여줍니다. 즉, 한 문제에 대한 시도는 상관관계가 있는 추출물이기 때문에 n개의 샘플은 오직 $n/(1+(n-1)
ho)$ 개의 유효 샘플만을 구매하며, 이는 $ ext{1}/
ho$로 제한됩니다. 그리고 다수결 투표(majority voting)는 **최빈값 천장(modal ceiling)**을 가집니다. 이 경우 모델의 가장 흔한 답변이 틀릴 때, 더 많은 샘플은 확신에 찬 오류를 더욱 뚜렷하게 만듭니다. 커버리지(verifier가 찾을 수 있는 올바른 답변 하나 얻기)는 계속해서 증가하지만, 다수결 투표는 정체되고 심지어 역으로 감소할 수 있습니다.
동반된 노트북에서는 정확한 이항 수학을 사용하여 이 모든 것을 재현합니다: self-consistency 56.5% $
ightarrow$ 74.4%, 포화되지 않는 커버리지, 잘못된 모드 문제에서의 반(反)스케일링, 그리고 첫 번째 답변을 선택하는 것이 마지막 답변을 선택하는 것보다 나은 결과를 보이는 장난감 추적(toy trace).
SOTA, 2026년 9월: 사고 리더보드
연구소들은 이러한 통찰력을 제품으로 구현했습니다:
- xAI Grok 4.7 (2026년 9월): 어휘에 네이티브 서브 에이전트 제어 토큰을 내장하여 병렬 작업자 페르소나로 분기하고, 자체 테스트 스위트를 작성한 다음 다시 병합합니다. **SWE-bench Verified에서 62.4%**라는 새로운 기록을 세웠으며, 테스트 시간 컴퓨팅 과정 중 결정론적 컴파일러 검증이 사용자가 보기 전에 잘못된 코드를 걸러냅니다.
- Anthropic Claude Opus 5.5 (9월 22일) / Fable 5.1 (9월 1일): 프롬프트의 퍼플렉시티(perplexity)에 따라 사고를 할당하는 적응형 사고 방식으로, VRAM을 무작정 소모하지 않습니다. Opus 5.5가 기본 권장 사항이며, Fable 5.1은 장기 지평 에이전트 작업용입니다.
- OpenAI GPT-5.6 Sol: N개의 병렬 샘플링 스트림을 제어하는 세 가지 분리된 사고 계층(Fast/Advanced/Extreme)을 가집니다.
- DeepSeek-V4-Pro: 메모리를 많이 사용하는 비평가 네트워크를 삭제한 GRPO 강화학습(reinforcement learning), 그리고 압축 희소 어텐션(compressed sparse attention)으로 추론 KV 캐시를 약 90% 축소했습니다.
- Qwen3.8-2.4T-A95B (2026년 8월, 오픈 웨이트): 2.4조 개의 파라미터, 하이브리드 선형+완전 어텐션(hybrid linear+full attention), 262K 네이티브 컨텍스트를 가집니다.
사고 모드(Thinking mode)는 기본적으로 활성화되어 있습니다. 이 모드는 온도 1.0에서 사고 과정을 샘플링합니다 (실수가 저렴한 탐색 과정). 하지만 답변은 0.7에서 합니다 (여기서는 실수가 치명적입니다).
- Zhipu GLM-5.3: 통합된 낮은/높은/최대 추론 노력(unified low/high/max reasoning effort)을 제공하며, 최대 128K 출력 토큰과 1M 컨텍스트를 지원하고 MCTS + PRM 검증 전반에 걸쳐 희소 어텐션 인덱스를 재사용합니다.
- Moonshot Kimi K3: 엔트로피 기반의 동적 사고 예산(entropy-driven dynamic thinking budgets)을 갖추고 있습니다. 이는 최적의 신뢰 경계에서 검색을 종료하는 토큰 감시 장치 역할을 합니다.
인프라 부하가 현실적인 문제입니다: 추론 과정이 서비스 클러스터를 메모리 대역폭 머신으로 만들었습니다 (단일 자릿수 MFU). 단 하나의 64K 토큰 트레이스만 KV 캐시에 18 GB의 VRAM을 소모할 수 있으며, 긴 트레이스는 무한한 백트래킹 루프를 초래할 위험이 있습니다. 이것이 바로 모델만큼이나 KV-캐시 압축 경쟁(DeepSeek의 약 90%)이 중요한 이유입니다.
실무자의 규칙: 사고에 돈을 쓰듯 접근하라
2026년 연구 컨센서스는 슬로건이 아니라 예산 문제입니다:
- 쿼리의 60–70%는 최소한의 추론만 필요합니다. 노력과 난이도를 일치시켜야 합니다. 이것이 적응형 사고(adaptive thinking)와 노력 계층(low/high/max)을 사용하는 이유입니다.
- 사고 과정은 활발하게 샘플링하고, 답변은 차분하게 하라. 탐색은 트레이스에 속해야 하며, 최종 답변에는 낮은 온도를 적용해야 합니다.
- 단순히 투표하지 말고 검증하라. 어려운 작업에서 PRM을 사용한 Best-of-N이 다수결 투표보다 우수하며, 커버리지(coverage)에는 상한선이 없습니다.
- 일찍 멈춰라. 첫 번째 해답이 보통 가장 좋습니다. 신뢰도에 기반한 중지 규칙은 정확도 손실 없이 사고 토큰을 70%까지 줄일 수 있습니다.
테스트 시간 컴퓨팅(Test-time compute)이 학습 규모를 대체하지는 않았습니다. 대신 세 번째 축을 추가했습니다. 여기서 승리할 실험실들은 단순히 더 오래 생각하는 곳이 아니라, 언제 멈춰야 할지 더 스마트하게 생각하는 곳들입니다.
핵심 요약(Takeaways)
- 생각하는 시간이 길어질수록 실제 스케일링 법칙이 나타난다: 추론 컴퓨팅에 따른 로그-선형 정확도 향상.
- 네 가지 레버리지(levers): 긴 CoT (사고 과정), 자기 일관성(self-consistency) (+17.9점, GSM8K 기준), best-of-N + PRM 검증기(+10–20%), 트리 검색(tree search).
- 작은 모델에 최적의 사고 과정을 적용하는 것이 14배 더 크고 단순한 사고 과정만 사용하는 것보다 나을 수 있다 (Snell et al., 2024).
- 반전점: 첫 번째 해답이 93.7%의 확률로 최적인데, 과도하게 생각하면 정답을 틀리게 만든다(최대 21%) — 일찍 멈추고 토큰을 70% 절약할 수 있다.
- 2026년 9월 SOTA: Grok 4.7 (SWE-bench에서 62.4%), Claude Opus 5.5, DeepSeek-V4-Pro (GRPO, −90% KV), Qwen3.8 오픈 웨이트, GLM-5.3 (128K 추론 토큰), Kimi K3 (엔트로피 예산).
- 노트북:
test_time_compute.ipynb— 네 가지 현상 모두에 대한 정확한 이항(binomial) 시연.
동반 노트북: 본 게시물의 실행 가능한 튜토리얼 — 여기에서 다운로드 (Colab/Jupyter에서 열기).
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기


