STT-Arena: 시공간적 역동성(Spatio-Temporal Dynamics)을 갖춘 도구 사용을 위한 더욱 현실적인 환경
요약
STT-Arena는 LLM 에이전트가 시공간적 역동성(spatio-temporal dynamics)이 존재하는 환경에서 변화를 감지하고 재계획(replanning)할 수 있는 능력을 평가하기 위해 설계된 새로운 벤치마크입니다. 기존 SOTA 모델들이 시공간적 충돌 상황에서 낮은 정확도를 보인다는 점을 발견하고, 이를 해결하기 위해 반복적 궤적 정제 기술과 온라인 강화학습을 결합한 STT-Agent-4B를 제안합니다.
핵심 포인트
- 시공간적 충돌 유형 9가지와 해결 가능 수준 4가지를 포함한 227개의 고품질 상호작용 작업 제공
- Claude-4.6-Opus를 포함한 최신 폐쇄형 모델들도 시공간적 동적 추론에서 40% 미만의 낮은 정확도를 기록
- 기존 모델의 주요 오류 모드로 '오래된 상태 실행', '동적 트리거 오진', '적응 후 검증 누락'을 식별
- 반복적 궤적 정제 및 온라인 강화학습을 통해 성능을 개선한 STT-Agent-4B 개발
실제 세계의 에이전트 애플리케이션(agentic applications)에 배치된 대규모 언어 모델(LLMs)은 작업 중간의 방해 요소로 인해 이전의 결정이 무효화될 때, 재계획(replanning)하고 적응할 수 있는 능력을 갖추어야 합니다. 기존의 동적 벤치마크(dynamic benchmarks)는 주로 LLM이 시간적 변화를 적시에 감지할 수 있는지 여부를 측정하며, 시공간적 역동성(spatio-temporal dynamics) 하에서의 적응적 재계획(adaptive replanning)이라는 상호 보완적인 과제는 대부분 탐구되지 않은 상태로 남아 있습니다. 우리는 9가지 시공간적 충돌 유형(spatio-temporal conflict types)과 4가지 해결 가능 수준(solvability levels)을 아우르는 227개의 고품질 상호작용 작업으로 구성된 벤치마크인 STT-Arena(Spatio-Temporal Tool-Use Arena)를 소개합니다. 각 작업은 진행 중인 계획을 갑작스럽게 무효화할 수 있는 시공간적 트리거(spatio-temporal triggers)가 주입된 현실적이고 실행 가능한 환경에 기반하며, 모델이 상태 변화를 감지하고 수정된 실행 전략을 구축하도록 강제합니다. 최첨단 LLM들에 대한 광범위한 평가 결과, Claude-4.6-Opus를 포함한 SOTA(State-of-the-Art) 폐쇄형 모델들조차 전체 정확도가 40% 미만임을 보여주었으며, 이는 시공간적 동적 추론(spatio-temporal dynamic reasoning)의 근본적인 어려움을 강조합니다. 실패 궤적(failure trajectories)에 대한 체계적인 분석을 통해 기존 모델에서 반복되는 세 가지 오류 모드인 '오래된 상태 실행(Stale-State Execution)', '동적 트리거의 오진(Misdiagnosis of Dynamic Triggers)', 그리고 '적응 후 검증 누락(Missing Post-Adaptation Verification)'을 밝혀냈습니다. 이러한 발견을 바탕으로, 우리는 훈련 데이터에서 이러한 실패 패턴을 제거하는 반복적 궤적 정제(iterative trajectory refinement) 기술을 제안하며, 이를 온라인 강화학습(online RL)과 결합하여 STT-Arena에서 최첨단 LLM들을 능가하는 STT-Agent-4B를 제작하였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기