OpenForgeRL: 모든 환경에서 Harness-native 에이전트 학습하기
요약
OpenForgeRL은 복잡한 추론 하네스를 사용하는 AI 에이전트를 엔드투엔드로 학습시키기 위한 오픈 소스 프레임워크입니다. 경량 프록시와 Kubernetes 오케스트레이터를 활용해 학습과 추론을 분리하며, 다양한 환경에서 대규모 에이전트 학습을 가능하게 합니다.
핵심 포인트
- 하네스 기반 에이전트의 엔드투엔드 학습을 위한 오픈 소스 프레임워크 제시
- 경량 프록시와 Kubernetes를 통한 학습/추론 분리 및 확장성 확보
- 도구 사용, GUI 브라우징, 컴퓨터 사용 등 다양한 환경에서 성능 검증
- RL이 에이전트의 신뢰성을 향상시키지만 오류 복구 능력은 여전히 과제로 남음
현대의 AI 에이전트들은 다회차 추론 (multi-turn reasoning), 도구 사용 (tool use), 그리고 외부 시스템 접근을 구동하기 위해 Claude Code, Codex, OpenClaw와 같은 정교한 추론 하네스 (inference harnesses)에 의존합니다. 이러한 복잡한 하네스들은 강력하지만, SFT/RL 스택이 상태 유지형 (stateful) 및 다중 프로세스 (multi-process) 하네스 추론을 네이티브하게 표현할 수 없는 오픈 인프라를 통해 에이전트를 엔드투엔드 (end-to-end)로 학습시키는 것을 어렵게 만듭니다. 이를 해결하기 위해, 우리는 다양한 환경에서 하네스 기반 에이전트를 엔드투엔드로 학습시키기 위한 오픈 소스 프레임워크인 OpenForgeRL을 제시합니다. OpenForgeRL은 하네스의 모델 호출을 서비스하는 동시에 이를 표준 RL 코드베이스 (예: veRL)를 위한 학습 데이터로 기록하는 경량 프록시 (lightweight proxy), 그리고 각 롤아웃 (rollout)을 자체 원격 컨테이너에서 실행하는 Kubernetes 오케스트레이터 (orchestrator)를 통해 이를 달성하며, 결과적으로 어떤 환경에서든 어떤 하네스에 대해서도 대규모 학습을 가능하게 합니다. 학습과 추론을 분리함으로써, OpenForgeRL은 연구자들이 에이전트가 실제로 배포되는 실제 하네스 및 환경에서 직접 에이전트를 쉽게 학습시키고, 연구하며, 개선할 수 있도록 합니다. 우리는 도구/claw 기반 에이전트부터 멀티모달 GUI 브라우저 및 컴퓨터 사용 (computer-use) 에이전트에 이르기까지, 다양하고 복잡한 하네스와 환경에 걸쳐 우리의 프레임워크를 검증합니다. 단 수백 개에서 수천 개의 태스크만을 사용하여, OpenForgeClaw는 ClawEval에서 31.7 pass^3 및 55.9 pass@3를, QwenClawBench에서 33.7을 달성했습니다. OpenForgeGUI는 OSWorld-Verified에서 37.7, Online-Mind2Web에서 63.0, 그리고 WebVoyager에서 72.3을 달성했습니다. 두 모델 모두 거의 모든 벤치마크에서 유사한 크기의 오픈 베이스라인 (open baselines)보다 뛰어난 성능을 보였으며, GUI 설정에서는 몇 배 더 큰 모델들과 대등하거나 이를 능가했습니다. 벤치마크를 넘어, 우리는 하네스 선택 (예: ZeroClaw, OpenClaw, Codex)과 RL이 에이전트의 행동을 어떻게 형성하는지 분석합니다. 우리는 일부 하네스가 다른 하네스보다 학습하기가 실질적으로 더 어렵다는 점과, RL이 자기 검증 (self-verification), 도구 커버리지 (tool coverage), 다단계 계획 완료와 같은 에이전트의 신뢰성 (agentic reliability)을 향상시키지만, 오류 복구 (error recovery)와 같은 핵심 능력은 여전히 취약하다는 것을 발견했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기