최적 중단 착각 (The Optimal Stopping Illusion)
요약
본 연구는 순차적 의사결정 이론을 바탕으로, 에이전트가 검색 과정에서 최적 중단 시점을 결정하는 문제를 다룹니다. 모델들은 정보의 품질은 정확히 판단하지만, 실제로는 유용한 증거가 없어도 계속해서 검색을 수행하려는 경향(운영상의 괴리)을 보였습니다. 이는 예산 할당이 '최소한의 목표'로 인식되어 비효율적인 연속 쿼리를 유발하기 때문입니다.
핵심 포인트
- 모델은 정보 품질 평가는 정확하나, 중단 결정에는 실패함.
- 프롬프트 엔지니어링이나 명시적 비용 도입으로는 이 격차를 메울 수 없음.
- 예산 할당(step budget)은 상한선을 '소비해야 하는 할당량'으로 인식하게 함.
- 이러한 행동은 자기회귀 언어 모델의 손실 함수와 관련됨.
순차적 의사결정 이론(sequential decision theory)에서 검색 문제는 최적 중단(optimal stopping)을 중심으로 다루어집니다. 에이전트는 관측치를 순차적으로 수집합니다. 추가적인 쿼리마다 한계 비용(marginal cost)이 발생합니다: 토큰 소비, API 수수료, 지연 시간(latency), 그리고 컨텍스트 저하입니다. 합리적인 중단은 에이전트가 기대되는 정보의 한계 가치(expected marginal value of information)가 획득의 한계 비용을 초과하는 동안에만 계속해서 쿼리를 수행하도록 지시합니다. 들어오는 데이터가 아무것도 제공하지 못할 때, 지속 옵션 가치(option value of continuation)는 음수가 되며, 검색은 종료되어야 합니다.
도구 사용 언어 에이전트의 엔터프라이즈 배포는 모델이 이러한 계산을 내재화할 수 있다는 가정에 크게 의존합니다. 엔터프라이즈 아키텍처는 모델에게 일련의 검색 도구를 제공하고, 운영 예산(operational budget)을 정의하며, 시스템 프롬프트에 비용 경고를 삽입합니다. 이 논지는 직관적입니다: 모델이 추론 능력 면에서 확장됨에 따라, 그들은 검색된 증거의 품질과 또 다른 도구 턴을 실행하는 지출 사이의 균형을 맞추어, 토큰 한도를 초과하기 전에 비생산적인 검색을 가지치기할 것입니다.
Nanyang Technological University, National University of Singapore, 그리고 Carnegie Mellon University 연구원들이 수행한 사전 등록된 경험적 연구(pre-registered empirical study)가 이 가정을 직접적으로 테스트합니다. 통제된 검색 실패 환경에서 7가지 오픈 및 최첨단 모델 아키텍처를 90,000 에피소드에 걸쳐 평가하면서, 저자들은 에이전트가 증거를 판단하는 방식과 실제로 중단을 결정하는 방식을 분리하여 분석했습니다.
경험적 결과는 현저한 운영상의 괴리(operational dissociation)를 보여줍니다. 에이전트는 둔감하지 않습니다. 검색 도구가 도움이 안 되거나 손상된 결과를 반환할 때, 테스트된 모델들은 들어오는 정보가 쓸모없다는 것을 97%에서 100%의 시간 동안 정확하게 식별합니다. 그들은 거의 완벽한 정확도로 데이터의 품질을 평가합니다.
하지만 그들의 중단 결정은 자신들의 판단을 완전히 무시합니다. 저자들은 시간 일치 대비 측정 지표(time-matched contrast metric)를 구성하여, 에이전트가 유용한 결과 없이 연속되는 결과들 이후에 멈출 가능성이 더 높았는지, 아니면 유용한 증거를 포함하는 순서열 이후에 멈출 가능성이 더 높았는지를 측정했습니다. 프롬프트 기반 에이전트의 경우, 이 대비 값은 거의 0에 머물렀습니다. 모델들은 우물이 마른 것을 인식했지만, 어쨌든 계속해서 물을 퍼 올렸습니다.
프롬프트 엔지니어링으로는 이러한 격차를 메우는 데 실패합니다. 프롬프트에 호출당 명시적인 재정 비용을 도입하는 것은 타이밍을 약간 변경할 뿐, 중단을 증거의 품질과 연결시키지는 못합니다. 모델들에게 내부 메모리에서 답변할 권한이 있다고 알려주는 것은 외부 검색이 성공했는지 여부와 관계없이 임의의 조기 중단(premature halts)을 유발합니다. 가장 흥미로운 점은 명시적인 단계 예산(step budget)을 언급하는 것이 상한선(upper limit)을 지출 목표로 바꾼다는 것입니다. 70억~80억 매개변수 범위의 오픈 모델에서, 예산을 선언하는 것은 단순히 중단 분포를 최종 마감일 위로 이동시켰습니다.
다음 해 예산이 삭감되는 것을 막기 위해 연간 할당금을 4분기에 소진하는 관료 부서처럼, 8단계 예산을 가진 에이전트는 8단계를 소비해야 하는 할당량(quota)으로 취급합니다.
이것이 왜 발생하는지 이해하려면 손실 함수(loss function)를 살펴봐야 합니다. 자기회귀 언어 모델(autoregressive language model)은 내생적인 대차대조표(endogenous balance sheet)가 없습니다. 컴퓨팅을 사용하는 것에서 제로의 비효용성(zero disutility)을 경험합니다. 토큰 생성 시, 최종 답변에 전념하는 것은 즉각적인 하방 위험(downside risk)을 안고 있습니다. 모델은 부정확하다고 점수화될 수 있는 확정적인 출력을 생성하기 때문입니다. 반면에 다른 도구 호출을 실행하는 것은 위험의 연기처럼 느껴집니다. 모델은 반복적인 상태에 머무르면서 책임을 미루고, 분포에 전념하는 것을 피하기 위해 클라이언트의 크레딧 잔액을 소진합니다.
증거에 따른 중단(stopping)은 아키텍처 하네스(architectural harness)가 이를 외생적으로(exogenously) 강제할 때만 따르는 것으로 논문은 보여준다. 런타임 코드(runtime code)가 연속된 무용지물 결과 다섯 번 이후 도구 접근 권한을 제거하고 최종 답변 액션만을 남기도록 개입했을 때, 테스트된 모든 모델 아키텍처에서 작업 성공률이 증가하며, 단계 예산(step budget)이 두 배로 늘어나도 중단 지점은 불변으로 유지된다.
시장의 가정은 자율 에이전트(autonomous agents)를 프롬프트 명령어만으로 자본 규율(capital discipline)을 설득할 수 있는 미니 기업(mini-enterprises)으로 취급한다.
나는 점 추정치(point estimate)가 아니라 분포(distribution)를 원한다.
오늘날 엔터프라이즈 에이전트 소프트웨어의 중간 사례는 무손실 회피 성향(loss aversion)을 가진 알고리즘에게 부여된 헤지되지 않은 아메리칸 콜 옵션(unhedged American call option)과 같다. 에이전트에게 API 키와 "절약하라"고 지시하는 프롬프트를 제공한다고 해서 비용 규율이 유도되는 것은 아니다. 그것은 모니터링되지 않는 지출 상한선만을 만든다. 실행 하네스(execution harness)가 코드 수준에서 중단 경계(stopping boundary)를 강제하지 못한다면, 모델은 예상치 못한 분산(unexpected variance)에 직면할 때마다 전체 할당량을 소진할 것이다.
자동화된 워크플로우에서의 자본 규율은 더 많은 학습 토큰으로 나타나는 창발적 추론 능력(emergent reasoning skill)이 아니다. 그것은 계약에 의해 부과되는 외생적 제약 조건이다. 수익성 있는 에이전트 파이프라인을 구축하는 기업들은 시스템 프롬프트에 긴 비용 경고를 작성하는 회사들이 아닐 것이다. 그들은 검색을 값비싼 파생상품으로 취급하고 행사 경계(exercise boundary)를 실행 엔진에 하드코딩하는 회사들일 것이다.
Originally published at https://deanlee.info/essays/the-optimal-stopping-illusion/.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기