실패하는 에이전트를 첫 시도에서 감지하여 추론을 최대 60% 절감
요약
본 논문은 LLM 에이전트가 실패할 것 같은 시도를 초기에 감지하여 불필요한 추론 과정을 중단함으로써 계산 자원 낭비를 줄이는 방법을 제시합니다. 특히, 외부 행동 관찰 대신 모델의 내부 히든 상태를 활용하는 '내부 프로브' 방식이 초기 단계에서 더 높은 예측 성능을 보였습니다.
핵심 포인트
- 에이전트 실패 시도를 조기 중단하여 추론 비용 및 시간을 절감할 수 있습니다.
- 외부 행동 기반 스코어러보다 모델의 내부 히든 상태를 활용하는 것이 더 효과적입니다.
- 논문은 '재현율(recall)'을 보장하는 연쇄 게이트 구조로 오탐지 없이 실패만 걸러냅니다.
- 이 시스템은 성공적인 에피소드를 놓치지 않으면서 불필요한 계산을 제어할 수 있습니다.
에이전트에게 복잡한 작업을 주면, 때때로 초반 몇 수 만에 잘못된 방향으로 진입한다. 그럼에도 불구하고 에이전트는 성실하게 약 20수 정도 계속 진행하며 방대한 도구 호출과 토큰을 소모한 후에야 겨우 '할 수 없었습니다'라고 응답해 온다. 이처럼 '막혔는데도 계속 돌아가는' 시간이, 직접 에이전트를 구동하는 사람일수록 지극히 효과적이다. 강화학습(RL)의 롤아웃 수집, 평가 배치, 장시간 작업에서는 실패하는 에피소드가 특히 오래 진행되는 경향이 있기 때문이다.
7월에 발표된 논문 Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade (Kai Ruan 외)는 이러한 낭비를 '실패할 것 같은 시도를 일찍 중단'함으로써 줄인다. 흥미로운 점은, 중단 판단 근거를 에이전트의 외부에서 보이는 행동이 아니라 모델의 **내부 상태(히든 레이어의 활성화)**에서 가져온다는 것이다.
'행동을 관찰하는' 방식과 '내부를 들여다보는' 방식
실패를 예측하는 연구에는 크게 두 가지 흐름이 있다.
하나는 관측 가능한 궤적(action, observation, 에러 메시지 등)을 읽는 방법이다. 같은 시기의 AgentForesight가 대표적인데, 궤적의 접두사만 보고 '지금 이 한 수가 결정적인 오류인가'를 온라인으로 판별하는 7B 규모의 감사 모델을 훈련하여 기존의 독점(proprietary) 기준선을 Exact-F1에서 능가했다. 이는 인간이 로그를 추적하는 것과 같은 무대에서 더 영리하게 보는 방식이다.
Doomed 논문은 여기에 한 수를 던진다. 관측되는 행동만 보는 스코어러는 초반에는 거의 찍기에 가깝고(라운드 1의 판별 성능은 동전 던지기와 유사함), 제대로 효과를 발휘하기 시작하는 것은 라운드 3~4 정도라고 지적한다. 그런데 그때쯤이면 전체 에피소드의 3분의 1 이상이 이미 끝난 상태라는 것이다. 행동이 실패를 이야기할 때쯤에는 절감했어야 할 계산은 이미 다 사용된 후이다.
반면 모델의 히든 상태는 첫 시점부터 결말을 상당히 예측한다. 저자들은 각 라운드에서 에이전트가 행동 생성을 완료한 최종 토큰의 잔차 스트림 상의 히든 상태를 추출하고, 여기에 경량 선형 분류기(로지스틱 회귀)만 적용하면 된다. 이 내부 프로브는 라운드 1에서, 행동 기반 스코어러보다 AUC가 0.12~0.21 높다. 게다가 히든 상태 프로브에 행동 특징량을 추가해도 성능이 더 늘어나지 않았다. 필요한 정보는 이미 내부 표현에 담겨 있다는 주장이다.
이미지는 다음과 같다.
# 개념 코드(생각의 설명일 뿐, 논문의 공식 구현/API가 아님)
# 각 라운드: 행동 생성 직후 최종 토큰의 히든 상태를 가져옴
hidden = model(input_ids, output_hidden_states=True).hidden_states[layer][:, -1, :]
...
어려운 점은 '중단해도 되는 시점'을 가려내는 것
실패 확률이 나와도 단순히 '수상하면 멈춘다'로는 성공했을 시기까지 연쇄적으로 중단하게 된다. early abort의 핵심은, 성공한 에피소드를 얼마나 놓치지 않으면서(recall), 불필요한 경우만 절감할 수 있느냐에 달려 있다.
논문의 해결책은 이를 '재현율(recall)을 보장하는 중단 게이트의 연쇄'로 설계한 것이다. 라운드 1~6에 각각 게이트를 배치하고, 각 게이트의 임계값을 이항 분포의 하측 신뢰 한계(Clopper–Pearson)로 조정한다. 분포에 가정을 두지 않는 distribution-free 방식이며, 게이트별 보장이 곱셈이 아니기 때문에, 각 라운드의 '재현율 예산'을 검증 데이터에서 일괄 최적화하여 에피소드 전체의 목표 재현율을 충족하도록 한다. 결정된 캐스케이드(cascade)는 고정하고 독립 데이터로 사후 보장까지 검증한다.
실무적으로 효과적인 것은 이것이 조절 가능한 다이얼이 된다는 점이다. '성공하는 경우의 90%는 반드시 남긴다(recall 90%)'라고 정하면, 그 제약 조건 하에서 절감할 수 있는 계산을 최대화해 준다. 얼마나 많은 좋은 시도를 희생시킬지라는 비즈니스 판단을 그대로 숫자로 지정할 수 있다.
숫자로 보는 절감 폭
Qwen-2.5-7B / Llama-3.2-3B / Qwen3-1.7B의 3개 모델과 TextCraft, WebShop의 2개 환경, 총 24가지 경우에서 평가했다. 24가지 모든 경우에서 실제로 달성된 재현율은 목표치로부터 표준편차 1 이내에 수렴했다.
| recall 목표(남길 성공 횟수) | TextCraft의 토큰 절감 | WebShop의 토큰 절감 |
|---|---|---|
| 90% | 60.2% | 54.9% |
| 95% | 45.0% | 41.5% |
성공률을 9할로 유지하면서도 생성 토큰을 6할가량 절감할 수 있다. 같은 조건에서 비교한 '단일 게이트' 방식에 비해서는, 90% recall 기준으로 1.5배~8.8배의 계산 비용을 절약했다고 한다. TextCraft는 레시피를 따라 목표 아이템을 합성하는 이진(二値) 성공/실패 과제이고, WebShop은 텍스트 기반 쇼핑 과제이다. 두 경우 모두 한 단계씩 누적되는 과정이 길어지기 쉬워 조기 중단(early stopping)의 효과가 나타나기 좋은 주제들이다.
어디에 적용 가능하고, 어디서 어려움을 겪을까
전제적으로, 이것은 은닉 상태를 읽을 수 있는 화이트박스 기반의 방법론이다. 활성화(activation)에 접근할 수 없는 외부 API 모델에는 효과가 없다. 이 기술이 유효한 곳은 자사에서 호스팅하는 open-weight 에이전트, RL의 롤아웃(rollout) 수집, 평가 하네스(evaluation harness) 등 '실패 사례를 대량으로 생성하게 되는' 상황이며, 이곳들이 바로 비용 발생의 온상이다.
저자들 스스로도 받아들이기 어려운 유보 사항들을 제시하고 있다. 검증은 사실상 소수의 환경 및 모델 규모에서 이루어졌으며, 과제 분포가 달라지면 보정(calibration)의 전제 조건(교환 가능성)이 무너질 수 있다. 활성화는 이번에 오프라인의 teacher-forced 재실행으로 사용했으며, 실제 서비스에서는 서빙 측에서 읽어내는 구현이 별도로 필요하다. 또한, 보정 데이터가 적으면 도달할 수 있는 recall에 상한선이 있으며(그들의 규모에서는 약 0.974가 한계), 애초에 전체 recall의 제어는 경험적으로 검증된 여유분일 뿐 정리된 이론은 아니라고 명시하고 있다.
그럼에도 불구하고, 방향성 자체는 매우 좋다. 에이전트의 내부 표현에는 본인이 말하기 전부터 '이건 막혔다'라는 신호가 담겨있다. 이를 선택적으로 중단하는 'reject option'으로 구현하여 비용이라는 실질적인 이득으로 바꾼 것이다. 화려한 모델 업데이트 이야기라기보다는, 에이전트의 청구서를 조용히 가볍게 만드는 종류의 작업이며, 이런 소소한 최적화가 현장에서는 더 효과를 발휘한다.
1차 자료 출처:
토론(Discussion)

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기