토큰당 와트: 컨텍스트 윈도우가 전력 결정인 이유
요약
논문은 컨텍스트 윈도우가 길어질수록 토큰당 와트(tokens per watt) 효율성이 급격히 떨어진다는 '1/W 법칙'을 제시합니다. 이는 H100에서 Llama-3.1-70B를 테스트한 결과, 컨텍스트 길이가 늘어날 때마다 효율이 절반으로 감소하는 현상입니다. 특히 에이전트의 도구 호출 루프는 이 법칙을 심하게 위반하여 전력 소모가 커집니다.
핵심 포인트
- 컨텍스트 윈도우 증가에 따라 토큰당 와트 효율성이 급격히 하락합니다 (1/W 법칙).
- H100에서 컨텍스트 길이가 늘어날수록 효율성 저하 폭이 매우 큽니다.
- 에이전트의 도구 호출 루프는 전체 히스토리를 재전송하여 전력 소모를 가중시킵니다.
- 과거 칩 설계자들이 직면했던 문제와 유사하며, 전력 관리 기법(DVFS 등)이 중요합니다.
2026년 3월에 발표된 논문은 저자들이 '1/W 법칙(1/W law)'이라고 부르는 것을 도출했습니다. 이 법칙에 따르면, 서비스 컨텍스트 윈도우가 두 배로 늘어날 때마다 토큰당 와트(tokens per watt)는 절반이 됩니다. H100에서 Llama-3.1-70B를 실행했을 때, 4K 컨텍스트에서는 17.6 tok/W였지만 64K 컨텍스트에서는 1.50 tok/W에 그칩니다. 같은 실리콘임에도 불구하고, 순전히 컨텍스트 길이만으로 효율성이 약 12배나 떨어지는 것입니다 (arXiv:2603.17280). 에이전트(Agents)는 이 법칙을 가장 심하게 위반하는 워크로드입니다. 왜냐하면 도구 호출 루프(tool-calling loop)가 매 단계마다 누적된 전체 히스토리(history)를 재전송하기 때문입니다. 칩 설계자들은 2004년에 구조적으로 유사한 벽에 부딪혔고, 더 나은 트랜지스터 대신 전력 도메인(power domains), DVFS(Dynamic Voltage and Frequency Scaling), 그리고 클럭 게이팅(clock gating)으로 해결책을 제시했습니다. 이 개념이 에이전트 아키텍처로 이어지는 것은 사실입니다. 하지만 GPU 예산을 여기에 걸기 전에 알아야 할 특정한 문제점이 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hacker Noon AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기