다국어, 다중 에이전트 계획 실패에 대한 실행 가능한 진단
요약
다국어 다중 에이전트 시스템에서 발생하는 계획 실패 원인을 분석하고, 이를 해결하기 위한 새로운 분류 체계인 TART를 제안합니다. TART는 플래너와 하위 에이전트 간의 정보 전달을 최적화하여 저자원 언어에서의 성능 저하 문제를 효과적으로 완화합니다.
핵심 포인트
- 다국어 환경에서 요청이 실행 가능한 계획으로 변환될 때 발생하는 정보 손실 식별
- 저자원 언어일수록 계획-접지(planning-grounding) 실패 비중이 높음을 확인
- 분류 체계를 활용한 TART 방법론 도입으로 에이전트 성능 향상
- 다국어 GAIA 벤치마크에서 SOTA 대비 정확도 5.6%p 개선
다국어 다중 에이전트 시스템(Multilingual multi-agent systems)은 영어를 넘어설 때 상당한 성능 저하를 보이지만, 기존 연구에서는 사용자 요청이 실행 가능한 계획(executable plans)으로 변환될 때 작업에 중요한 정보가 어떻게 손실되는지를 식별하는 경우가 드뭅니다. 본 연구에서는 다중 에이전트 시스템 내의 플래너(planner)를 요청-액션 인터페이스(request-to-action interface)로 연구하며, 실패한 실제 작업 실행으로부터 계획-접지(planning-grounding) 실패에 대한 실행 가능한 분류 체계(actionable taxonomy)를 도출합니다. LLM 기반 분석에 따르면, 이러한 실패는 언어 자원 가용성이 감소함에 따라 성공하지 못한 실행에서 차지하는 비중이 증가하며, 저자원 언어(low-resource languages)에서 가장 강력한 영향을 미칩니다. 이 분류 체계가 완화(mitigation)를 지원하는지 테스트하기 위해, 우리는 분류 체계의 핵심 측면을 플래너와 하위 에이전트(downstream sub-agents)에게 명시적으로 전달하는 TART(Taxonomy-Guided Actionable Representation)를 도입합니다. 여러 언어, 세 가지 LLM 백본(backbones), 두 개의 데이터셋, 그리고 두 가지 에이전트 구성(agentic configurations)에 걸쳐 TART는 일관되게 성능을 향상시킵니다. 다국어 GAIA에서 TART는 저자원부터 고자원 설정에 이르는 11개 언어 전체의 평균을 기준으로, 최신 기술(state-of-the-art) 시스템의 정확도를 5.6 퍼센트 포인트 향상시켰습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기