T-Search: 어려운 다단계 검색을 위한 개방형 에이전트 리트리버 및 플레이그라운드
요약
T-Search는 복잡한 다단계 검색을 위해 설계된 오픈 웨이트 에이전트 리트리버입니다. 이 도구는 주어진 질문과 코퍼스 기반의 제한적 다회전 검색을 수행하고, 근거 설명이 포함된 순위화된 증거 청크를 제공합니다. T-Search는 Qwen3.6-35B-A3B를 기반으로 훈련되었으며, 여러 벤치마크에서 높은 Recall@10 성능을 입증했습니다.
핵심 포인트
- T-Search는 다단계 검색에 특화된 오픈 웨이트 에이전트 리트리버입니다.
- 답변 생성과 검색 기능을 분리하여 백엔드와 생성기 교체가 용이합니다.
- Qwen3.6-35B-A3B 기반으로 훈련되었으며, 높은 Recall@10 성능을 보였습니다.
- 모델, 하네스, 그리고 러시아어 벤치마크(TRuST)를 공개했습니다.
우리는 어려운 다단계 검색(hard multi-step search)을 위한 오픈 웨이트(open-weight) 에이전트 리트리버인 T-Search를 소개합니다. 주어진 질문과 고정된 코퍼스(corpus)에 대한 검색 도구(search tool)를 가지고, 이는 제한된 다회전 검색(bounded multi-round search)을 실행하고 짧은 근거 설명(short justifications)이 포함된 순위가 매겨진 증거 청크(evidence chunks) 목록을 반환합니다. 따라서 답변 생성(answer generation)은 다운스트림 모델(downstream model)에 맡길 수 있어, 백엔드와 생성기(generator)를 재훈련 없이 교체할 수 있습니다. T-Search는 Qwen3.6-35B-A3B를 기반으로 구축되었으며, 라운드 슬라이스 지도 미세 조정(round-sliced supervised fine-tuning)과 이후 리콜 보상(recall reward)에 대한 GSPO로 적대적으로 필터링된 합성 검색 작업(adversarially filtered synthetic search tasks)으로 훈련되었습니다. 금 표준 증거 주석이 있는 일곱 개의 영어 및 러시아 벤치마크를 평균했을 때, 이는 단일 롤아웃(one rollout)에서 56.0의 Recall@10을 달성하며 기본 모델보다 14.4 포인트 높은 수치를 기록했고, 세 개의 융합된 롤아웃(three fused rollouts)에서는 61.3을 달성하여 더 큰 오픈 모델들을 능가합니다. 우리는 모델, 하네스(harness), 라이브 데모(live demo), 그리고 TRuST라는 최초의 네이티브 러시아어 어려운 검색 벤치마크를 포함한 세 가지 벤치마크를 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기