Multi-harness RL에 대한 궁극의 가이드 공개
요약
본 기사는 다양한 에이전트 환경(harness)에서 일관되게 모델을 훈련할 수 있는 오픈 방식을 제시합니다. 기존에는 harness마다 별도의 훈련이 필요했지만, 이 방식은 프록시를 통해 여러 API 형식을 처리하고 도구 효율성 보상을 추가하여 성능 향상과 자원 절감을 동시에 달성했습니다.
핵심 포인트
- 프록시 기반의 통합 학습 방식으로 다양한 에이전트 환경에 적용 가능합니다.
- 도구 호출(tool calls)을 줄이는 '도구 효율성 보상'을 도입하여 모델 성능을 개선했습니다.
- OpenAI, Anthropic, Gemini 등 주요 API 형식을 아우르는 오픈 소스 프레임워크를 제공합니다.
1/ Multi-harness RL에 대한 궁극의 가이드를 발표하게 되어 기쁩니다.
동일한 모델이라도 각 에이전트 harness마다 다르게 동작합니다. 그래서 우리는 Claude Code, Codex, OpenCode와 같이 사람들이 실제로 사용하는 harness 내부에서 단 한 줄의 harness 또는 훈련 코드를 변경하지 않고 어떤 작업 세트에 대해서든 RL을 사용하여 모든 모델을 훈련할 수 있는 오픈 방식을 구축했습니다.
네 가지 harness에 걸쳐 훈련된 LFM2.5-2.6B는 도구 호출(tool calls)이 31% 줄어들면서 42%에서 54%로 향상되었습니다.
2/ 이 harness가 여러분이 어떤 것을 훈련하기 전에 점수를 변경합니다.
동일한 LFM2.5-2.6B를 사용했을 때,
@liquidai의 가중치로는 Mini-SWE-Agent에서 62%, Claude Code에서 33%였습니다.
OpenCode에서만 훈련했을 때는 OpenCode에서 주로 향상되었고 (34% → 58%). 네 가지 harness에 걸쳐 한 번에 훈련했을 때는 다음의 성능을 보였습니다.
3/ 비결은 다음과 같습니다: harness를 건드리지 마세요. 대신 프록시(proxy)를 가리키세요.
이 capture proxy는 코딩 에이전트가 사용하는 네 가지 API 형식(OpenAI Chat Completions, OpenAI Responses, Anthropic Messages 및 Gemini)을 처리하고, 정확한 토큰 ID와 logprobs vLLM 샘플링 결과를 기록하며,
4/ 도구 효율성 보상(tool-efficiency reward)을 추가하면 모든 harness에서 모델이 더 빨라집니다.
정답에만 보상을 주면 모델은 도구 호출을 멈출 이유가 없습니다. 우리는 적은 호출로 작업을 해결하는 경우 작은 보너스를 추가했습니다. 이미 해결한 작업의 경우, 모델은 이제 31% 적은 호출을 사용합니다.
5/ 그냥 더 큰 모델을 모방하게 할 수는 없을까요?
우리는 Qwen3.8-27B로부터 얻은 동일한 네 가지 harness에 걸친 3,189개의 성공적인 롤아웃(rollouts)으로 파인튜닝했습니다. 모방은 정체되었습니다: 최고의 SFT 실행 결과는 47.5%로, 두 RL 실행 결과보다 낮았습니다.
Multi-harness SFT 역시 도구 호출을 24% 줄였지만, 성능은
6/ 모든 것이 완전히 오픈 소스이며 재현 가능합니다: OpenEnv의 capture proxy, TRL의 트레이너(trainer), 작업들, SFT 데이터, 훈련 코드 및 총 일곱 개의 훈련된 모델입니다.
더 크고 큰 모델을 사용한 더 큰 훈련 실행이 곧 공개될 예정이니 기대해 주세요.
전체 가이드 읽기:
AI 자동 생성 콘텐츠
본 콘텐츠는 X @adithya_s_k (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기