Stellar Colosseum: 수학 및 이론 컴퓨터 과학 분야의 장기 연구를 위한 다중 에이전트 하네스
요약
Stellar Colosseum은 수학 및 이론 컴퓨터 과학 분야의 장기 연구 문제를 위한 모델 비종속적 하네스를 소개합니다. 이 시스템은 대체 전략 탐색, 준비도 게이트를 통한 경로 성숙도 판단, 그리고 검증기 피드백을 활용하여 복잡한 증명 계획을 관리합니다. Colosseum은 Google Antigravity의 Teamwork 프레임워크에 통합되었으며, Gemini 모델들과 함께 다양한 연구 벤치마크에서 높은 성능을 입증했습니다.
핵심 포인트
- 장기 연구 문제 해결을 위한 비종속적 하네스 제공
- 대체 전략 탐색 및 준비도 게이트를 통해 신뢰성 향상
- Google Antigravity의 Teamwork 프레임워크에 통합됨
- Gemini 모델과 결합하여 최고 수준 벤치마크에서 높은 정확도 달성
언어 모델은 그럴듯한 짧은 증명을 생성할 수 있지만, 진척이 불확실하고 상호 의존적인 결정들의 연속에 달려 있는 장기 연구 문제에서는 여전히 신뢰성이 떨어질 수 있습니다. 우리는 수학 및 이론 컴퓨터 과학 분야의 연구 추론을 할당하기 위한 모델 비종속적 하네스인 Stellar Colosseum을 소개합니다. Colosseum은 증명 구성 전에 대체 전략들을 탐색하고, 경로가 분해될 만큼 충분히 성숙했는지 결정하는 준비도 게이트(readiness gate)를 사용하며, 증명 계획을 상호 의존적인 섹션 레벨의 하위 문제로 표현하고, 검증기(verifier)의 발견 사항을 영향을 받은 논증 부분으로 되돌립니다. 이 과정 전반에 걸쳐, 이는 후보들을 병렬로 생성하고, 표적화된 반증(targeted falsification)으로 공격하며, 겹치는 무작위 샘플 트리 집계(overlapping random-sample tree aggregation)를 통해 후보들과 그 비평들을 단일 연구 아티팩트로 결합합니다. Colosseum 워크플로우는 또한 Google Antigravity의 Teamwork 프레임워크에 장기 증명 패턴(Long Proof pattern)으로 통합되었습니다. 우리는 개방형 연구와 정리 증명 및 경쟁 프로그래밍 벤치마크 평가를 통해 Colosseum의 역량을 시연합니다. Gemini 3.1 Pro와 Colosseum을 사용하여, 우리는 FOCS나 JMLR과 같은 최고 수준의 학회에서 발표된 논문들로부터 발생하는 미해결 문제들을 다루는 여러 새로운 결과를 얻었습니다. FOCS, STOC, SODA에 게재된 논문들에서 가져온 연구 수준의 정리 증명 과제 벤치마크인 TCS-Bench에서 Colosseum은 Gemini 3.1 Pro와 Gemini 3.7 Flash를 사용하여 71.0%의 정확도를 달성했습니다. Gemini 3.1 Pro를 사용한 별도의 Codeforces 평가에서는, 실행 피드백을 갖춘 증명 중심 파이프라인이 222문제 중 218문제를 해결했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기