신뢰성 있고 효율적인 터미널 에이전트 학습을 위한 장기 궤적 선택
요약
본 연구는 터미널 에이전트가 긴 교사(teacher) 궤적을 모방하여 학습될 때, 감독 범위(supervision horizon)를 어떻게 설정하는지가 신뢰성과 비용에 미치는 영향을 분석했습니다. 특히 '선택적 장기 범위 정제' 기법을 제안하여, 전체 데이터를 사용하는 것보다 적절한 궤적 선택이 에이전트의 성능과 효율성을 크게 향상시킴을 입증했습니다.
핵심 포인트
- 감독 범위(supervision horizon) 설정이 신뢰성과 비용에 핵심적인 영향을 미친다.
- 짧은/중간/긴 범위는 각각 조기 종료, 오류 복구, 과도한 지속성 등의 행동 패턴을 유발한다.
- '선택적 장기 범위 정제' 기법으로 성능 향상 및 학습 시간 단축이 가능하다.
- 전체 데이터를 사용하는 것보다 올바른 궤적 선택이 에이전트의 성공률을 높인다.
터미널 에이전트는 일반적으로 긴 교사(teacher) 궤적을 모방하여 학습되지만, 각 궤적의 어느 부분을 감독할지 여부는 아직 탐구되지 않은 영역입니다. 우리는 extit{감독 범위}(supervision horizon), 즉 학습을 위해 유지되는 궤적 토큰의 개수를 연구하고, 이것이 신뢰성과 비용에 대한 핵심 설계 축임을 보여줍니다. 신뢰성은 더 긴 범위에서 향상되지만 포화됩니다: Terminal-Bench에서 12K 토큰 범위는 16K보다 더 많은 작업을 해결하며($29 ext{±}0.7$ 대 $26 ext{±}0.8$), 학습 시간은 30% 적게 요구합니다. 또한 이 범위는 에이전트의 행동을 형성합니다: 짧은 범위는 조기 종료를 유발하고, 중간 범위는 생산적인 오류 복구를 가져오며, 긴 범위는 과도한 지속성(over-persistence)을 유도합니다. 우리는 바이어스-복잡도 경계(bias--complexity bound)를 통해 이러한 포화 현상을 분석합니다. 이 분석에 따르면, 더 긴 감독은 시간적 감독 바이어스를 줄이지만, 더 이질적인 후기 단계 기록으로부터의 유한 표본 추정 오차를 증가시킵니다. 이 분석에 따라, 우리는 extit{선택적 장기 범위 정제}(selective long-horizon refinement)를 제안합니다. 이는 먼저 짧은 접두사(prefix)로 학습한 다음, 따뜻한 시작 모델(warm-start model) 하에서 가장 가능성이 높은 연속 부분(continuation)에 대해서만 정제하는 방식입니다. 이 방법은 전체 장기 범위 학습보다 일관되게 우수한 성능을 보입니다. 16K의 경우, 성공적인 시도 횟수를 $110 ext{±}2.7$에서 $126 ext{±}2.1$로 높이고, 8번의 시도 중 최소 6번 작업을 해결하는 비율을 $9 ext{±}0.7$에서 $14 ext{±}0.6$으로 높입니다. 장기 범위 데이터의 절반만 사용해도 여전히 $122 ext{±}2.4$에 도달하며, 학습 시간을 23% 단축합니다. 이러한 이점은 Terminal-Bench v2.0에서 $64 ext{±}2.6$에서 $73 ext{±}2.1$로, OpenThoughts-TBLite에서 $137 ext{±}2.7$에서 $155 ext{±}2.2$로 전이됩니다. 장기 범위 감독의 경우, 모든 데이터를 학습하는 것보다 올바른 궤적을 선택하는 것이 더 중요합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기