sierra-research/tau2-bench: 텍스트 전용에서 멀티모달 및 지식 인식 에이전트 평가까지
요약
tau2-bench는 텍스트를 넘어 멀티모달 및 지식 인식 에이전트를 평가하기 위한 벤치마크입니다. 음성 전이중 통신과 RAG 기반 지식 검색 능력을 포함하여 항공, 소매, 금융 등 다양한 도메인의 에이전트 성능을 측정합니다.
핵심 포인트
- 멀티모달 및 지식 인식 에이전트 평가 지원
- 음성 전이중(Full-duplex) 및 RAG 파이프라인 평가 포함
- 항공, 소매, 금융 등 75개 이상의 정교한 태스크 제공
- OpenAI, Gemini, xAI 등 실시간 음성 모델 성능 비교 가능
텍스트 전용에서 멀티모달, 지식 인식 (knowledge-aware) 에이전트 평가까지.
음성 전이중 (Voice full-duplex) · 지식 검색 (Knowledge retrieval) · 75개 이상의 태스크 수정
τ-Voice 논문 · τ-Knowledge 논문 · 태스크 수정 논문 · 릴리스 노트 (Release notes)
어떻게 발음하냐고요? 우리는 그냥 "tau three"라고 말하지만, 당신 마음대로 하세요! $\tau^3$-bench?
📢 2026년 7월 — v1.0.1 채점 업데이트: 이번 릴리스는 몇 가지 banking_knowledge 태스크 오류를 수정합니다. 그 결과 해당 도메인의 점수가 변경됩니다 — tau2-bench < 1.0.1 버전으로 생성된 결과는 >= 1.0.1 버전과 비교할 수 없으며, 영향을 받은 리더보드 제출물은 재채점되었습니다. 이전 결과 파일은 tau2 evaluate-trajs --fresh-tasks 명령어로 재채점할 수 있습니다; 수정 전 동작을 재현하려면 pre-v1.0.1 태그를 고정하세요. 자세한 내용은 변경 로그(changelog)와 릴리스 노트에 있습니다. 다른 도메인은 영향을 받지 않습니다.
지식 도메인 (Knowledge Domain) — 구성 가능한 RAG 파이프라인, 문서 검색, 임베딩(embeddings), 에이전트 기반 셸(agentic shell) 검색을 포함하는 지식 검색 기반 고객 서비스 도메인입니다. 자세히 알아보기 → banking_knowledge
음성 전이중 (Voice Full-Duplex, 오디오 네이티브) — 실시간 제공업체(OpenAI, Gemini, xAI)를 통한 엔드 투 엔드 (end-to-end) 음성 평가. 자세히 알아보기 →
태스크 품질 (Task Quality, 75개 이상의 수정) — 항공, 소매 및 금융 도메인 전반에서 잘못된 예상 동작을 제거하고, 모호한 지침을 명확히 하며, 불가능한 제약 조건을 수정하고, 누락된 폴백(fallback) 동작을 추가했습니다. SABER (Cuadron et al., 2025)의 분석을 기반으로 합니다. 자세히 알아보기 →
업데이트된 리더보드 (Updated Leaderboard) — 이제 음성 및 지식 결과가 포함됩니다. taubench.com에서 모델 성능을 비교하세요. 결과 제출하기 →
전체 버전 기록은 CHANGELOG.md를 참조하세요.
하위 호환성 참고 사항: 에이전트를 학습(training)하는 것이 아니라 평가(evaluating)하는 경우, 원래의 τ-bench 구조와 일치하는 전체 태스크 세트에서 평가하려면 base 태스크 분할을 사용하세요. 이것이 기본값입니다.
업그레이드 방법: 이제 $\tau^2$-bench 설치 시 pip install -e . 대신 uv를 사용하며, Python >=3.12, <3.14가 필요합니다 (기존에는 >=3.10 이었습니다). 일부 내부 API가 리팩토링되었습니다 — 자세한 내용은 CHANGELOG.md를 참조하세요.
각 도메인은 다음을 지정합니다:
- 에이전트가 따라야 하는 정책 (policy)
- 에이전트가 사용할 수 있는 도구 (tools) 세트
- 에이전트의 성능을 평가하기 위한 태스크 (tasks) 세트
- (선택 사항) 사용자 시뮬레이터를 위한 사용자 도구 (user tools) 세트
사용 가능한 도메인 (Available domains): mock
· airline (항공)
· retail (소매)
· telecom (통신)
· banking_knowledge (금융 지식)
| 모드 (Mode) | 설명 (Description) |
|---|---|
| Text (half-duplex) | 도구 사용을 포함한 턴제 채팅 |
| Voice (full-duplex) | 실시간 제공자 (OpenAI, Gemini, xAI)를 통한 엔드 투 엔드 (end-to-end) 오디오 |
git clone https://github.com/sierra-research/tau2-bench
cd tau2-bench
uv sync # 핵심 기능만 설치 (텍스트 모드: airline, retail, telecom, mock)
선택적 추가 기능 (필요한 것만 설치하세요):
uv sync --extra voice # + 음성/오디오 네이티브 기능
uv sync --extra knowledge # + banking_knowledge 도메인 (검색 파이프라인)
uv sync --extra gym # + gymnasium RL 인터페이스
...
이 작업에는 uv가 필요합니다. 음성 기능은 시스템 의존성도 필요합니다 (macOS의 경우 brew install portaudio ffmpeg). 자세한 내용은 전체 설치 가이드를 참조하세요.
cp .env.example .env
# API 키로 .env를 편집하세요 (LiteLLM을 사용하므로 지원되는 모든 제공자가 작동합니다)
tau2 run --domain airline --agent-llm gpt-4.1 --user-llm gpt-4.1 \
--num-trials 1 --num-tasks 5
결과는 data/simulations/에 저장됩니다. tau2 view를 사용하여 결과를 찾아볼 수 있습니다.
팁: 사용 가능한 도메인, 명령 및 예시에 대한 개요를 보려면 tau2 intro를 실행하세요.
| 문서 (Document) | 설명 (Description) |
|---|---|
| Getting Started | 설치, API 키, 첫 실행, 출력 구조, 구성 |
| CLI Reference | 모든 tau2 명령 및 옵션 |
| 문서 (Document) | 설명 (Description) |
|---|---|
| Agent Developer Guide | 자신만의 에이전트 구축 및 평가 |
| ... | |
| 문서 (Document) | 설명 (Description) |
| --- | --- |
| Knowledge Retrieval | banking_knowledge 도메인을 위한 검색 파이프라인 구성, 임베딩 (embeddings), RAG 및 샌드박스 설정 |
| 문서 (Document) | 설명 (Description) |
|---|---|
| Voice (Full-Duplex) | 음성 평가를 위한 제공업체 (Providers), 음성 복잡도 (speech complexity), CLI 옵션 및 출력 구조 |
| Audio Native Architecture | 실시간 제공업체 어댑터 (realtime provider adapters)를 추가하거나 수정하기 위한 내부 아키텍처 (Internal architecture) |
| 문서 (Document) | 설명 (Description) |
|---|---|
| Gym Interface | Gymnasium 호환 환경 (Gymnasium-compatible environment), 플레이 모드 (play mode), 훈련/테스트 분할 (train/test splits) |
| 문서 (Document) | 설명 (Description) |
|---|---|
| Leaderboard Submission | taubench.com에 결과를 제출하는 방법 |
| Experiments | 실험적 기능 (Experimental features) 및 연구 코드 (research code) |
| 문서 (Document) | 설명 (Description) |
|---|---|
| Contributing | $\tau$-bench에 기여하는 방법 |
| Changelog | 버전 이력 (Version history) 및 릴리스 노트 (release notes) |
기여를 환영합니다! 버그 수정, 기능 추가, 도메인 생성 또는 연구 코드 기여 등 무엇이든, 가이드라인은 우리의 기여 가이드 (Contributing Guide)를 참조하세요.
다음의 특정 구성 요소를 사용하는 경우:
@article{shi2026tau,
title={$\tau$-Knowledge: Evaluating Conversational Agents over Unstructured Knowledge},
author={Shi, Quan and Zytek, Alexandra and Razavi, Pedram and Narasimhan, Karthik and Barres, Victor},
...
@misc{ray2026tauvoicebenchmarkingfullduplexvoice,
title={$\tau$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains},
author={Soham Ray and Keshav Dhandhania and Victor Barres and Karthik Narasimhan},
...
@misc{barres2025tau2,
title={$\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment},
author={Victor Barres and Honghua Dong and Soham Ray and Xujie Si and Karthik Narasimhan},
...
@inproceedings{cuadron2026saber,
title={{SABER}: Small Actions, Big Errors {\textemdash} Safeguarding Mutating Steps in {LLM} Agents},
author={Alejandro Cuadron and Pengfei Yu and Yang Liu and Arpit Gupta},
...
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub Trending Python (daily)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기