ScienceBuddy: 상호작용적 과학 에이전트를 위한 재귀적-재귀적 자체 개선
요약
ScienceBuddy는 연구자의 작업 흐름에 맞춰 지속적으로 개선되는 대화형 과학 에이전트 워크스페이스입니다. 이 시스템은 요청과 피드백을 학습 데이터로 변환하며, 핵심 기술로 재귀적-재귀적 자체 개선 패러다임을 사용합니다. 이는 하네스 진화와 모델 강화학습을 결합하여 연구 과정 전반에 걸쳐 지능을 발전시킵니다.
핵심 포인트
- ScienceBuddy는 대화형 과학 에이전트 워크스페이스입니다.
- 재귀적-재귀적 자체 개선 패러다임을 핵심으로 합니다.
- 하네스 진화와 모델 강화학습을 결합하여 지능을 발전시킵니다.
- 연구자 상호작용 기반의 지속적인 학습 및 개선이 특징입니다.
우리는 연구자들의 일상적인 작업 흐름에 지속적으로 개선되는 과학 에이전트들을 도입하는 대화형 과학 연구 워크스페이스인 ScienceBuddy를 소개하고 공개합니다. ScienceBuddy는 연구자들이 과학적 작업을 수행하는 것을 지원하며, 그들의 요청, 피드백, 그리고 실행 증거를 지속적인 학습을 위한 작업(tasks)과 평가 루브릭으로 변환합니다. 핵심에는 재귀적-재귀적 자체 개선(recursive-in-recursive self-improvement)이라는 패러다임이 있습니다. 이는 하네스 진화(harness evolution)와 모델 강화학습 (model reinforcement learning)을 결합합니다: 내부의 재귀는 모델을 고정한 상태에서 하네스를 개선하고, 외부의 재귀는 개선된 하네스 아래에서 모델을 훈련시킵니다. 하네스 진화는 훈련 경험을 형성하며, 모델 학습은 하네스 적응을 위한 새로운 기회를 창출합니다. 우리는 연구자 상호작용, 하네스 정제(refinement), 그리고 모델 학습의 사례 연구를 제시하며, 이 벤치마크 케이스들은 네 가지 과학적 작업군에 걸쳐 있습니다. ScienceBuddy를 연구 제품으로 공개함으로써, 우리는 이 패러다임을 과학 커뮤니티에 제공하고 발견 지능(discovery intelligence)을 향한 한 걸음을 내딛습니다. 즉, 연구자들과의 지속적인 협력을 통해 발전하며 그들이 지원하는 연구와 함께 진화하는 과학 AI입니다. 웹사이트: http://science-buddy.io
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기