Show HN: ART – 에이전트 학습을 위한 새로운 오픈 소스 RL 프레임워크
요약
ART는 LLM 에이전트가 경험을 통해 학습할 수 있도록 지원하는 오픈 소스 강화학습(RL) 프레임워크입니다. W&B Training의 Serverless RL 기술을 활용하여 인프라 관리 부담 없이 데이터와 보상 함수 정의에만 집중할 수 있는 환경을 제공합니다.
핵심 포인트
- Serverless RL을 통해 인프라 관리 없이 학습 및 추론 인프라 자동 관리 가능
- 공유 클러스터 멀티플렉싱을 통해 기존 대비 비용 40% 절감 및 학습 속도 28% 향상
- GRPO를 포함한 강화학습 알고리즘을 다양한 Python 애플리케이션에 쉽게 통합 가능
- Qwen 모델 시리즈를 활용한 이메일 검색, 게임, 도구 사용 등 다양한 에이전트 학습 사례 제공
**W&B Training (Serverless RL)**은 강화학습 (Reinforcement Learning, RL)을 통해 모델을 유연하게 학습시킬 수 있는 최초의 공개 서비스입니다. 이 서비스는 학습 및 추론 인프라를 자동으로 관리하여, 사용자가 데이터, 환경(Environment), 그리고 보상 함수(Reward function)를 정의하는 데에만 집중할 수 있게 해줍니다. 이를 통해 더 빠른 피드백 사이클, 낮은 비용, 그리고 훨씬 적은 DevOps 부담을 제공합니다.
✨ 주요 이점:
40% 낮은 비용- 공유 프로덕션급 추론 클러스터에서의 멀티플렉싱 (Multiplexing)
28% 빠른 학습- 다수의 GPU에 걸쳐 2000개 이상의 동시 요청으로 확장 가능
인프라 고민 제로- 건강한 상태를 유지하는 완전 관리형 인프라
즉각적인 배포- 모든 체크포인트(Checkpoint)를 W&B Inference를 통해 즉시 사용 가능
# 이전: 수 시간의 GPU 설정 및 인프라 관리
# RuntimeError: CUDA error: out of memory 😢
# 이후: 즉각적인 피드백을 제공하는 Serverless RL
...
ART는 LLM(Large Language Models)이 **경험으로부터 학습 (learn from experience)**할 수 있도록 하여 에이전트의 신뢰성을 향상시키는 오픈 소스 RL 프레임워크입니다. ART는 어떤 Python 애플리케이션에도 GRPO를 통합할 수 있는 인체공학적인 하네스 (Harness)를 제공합니다. 빠르게 직접 체험해 보려면 아래의 노트북 중 하나를 실행해 보세요. 더 자세히 알고 싶다면 문서를 확인하시기 바랍니다.
| 에이전트 작업 (Agent Task) | 예시 노트북 (Example Notebook) | 설명 (Description) | 비교 성능 (Comparative Performance) |
|---|---|---|---|
| ART•E [Serverless] 2048 [Serverless] | 🏋️ 에이전트 학습 (Train agent) | Qwen3 14B가 RULER를 사용하여 이메일 검색을 학습함 | 벤치마크 (benchmarks) |
| ART•E LangGraph | 🏋️ 에이전트 학습 (Train agent) | Qwen 2.5 7B가 LangGraph를 사용하여 이메일 검색을 학습함 | [링크 곧 공개 예정] |
| MCP•RL | 🏋️ 에이전트 학습 (Train agent) | Qwen 2.5 3B가 NWS MCP 서버를 마스터함 | [링크 곧 공개 예정] |
| Temporal Clue | 🏋️ 에이전트 학습 (Train agent) | Qwen 2.5 7B가 Temporal Clue를 해결하는 법을 학습함 | [링크 곧 공개 예정] |
| Tic Tac Toe | 🏋️ 에이전트 학습 (Train agent) | Qwen 2.5 3B가 틱택토 (Tic Tac Toe) 게임을 하는 법을 학습함 | 벤치마크 (benchmarks) |
| Codenames | 🏋️ 에이전트 학습 (Train agent) | Qwen 2.5 3B가 코드네임 (Codenames) 게임을 하는 법을 학습함 | 벤치마크 (benchmarks) |
| AutoRL [RULER] | 🏋️ 에이전트 학습 (Train agent) | Qwen 2.5 7B가 어떤 작업이든 마스터하도록 학습함 | [링크 곧 공개 예정] |
| Distillation (SFT) | 🏋️ 모델 학습 (Train model) | Qwen 3 235B의 text-to-SQL 능력을 Qwen 3 30B로 증류 (Distill) 함 | [링크 곧 공개 예정] |
| Summarizer (SFT + RL) | 🏋️ 모델 학습 (Train model) | SFT 워밍업 후 RL을 사용하여 문서 요약기 (document summarizer)를 학습함 | [링크 곧 공개 예정] |
| SFT from a dataset | 🏋️ 모델 학습 (Train model) | 데이터셋의 text-to-SQL을 사용하여 Qwen 3 30B를 미세 조정 (Fine-tune) 함 | [링크 곧 공개 예정] |
SOTA 에이전트 구축에 관한 최신 연구와 업데이트를 확인해 보세요.
-
🗞️
ART가 이제 LangGraph와 원활하게 통합됩니다 -
강화학습 (RL)을 통해 LangGraph 에이전트를 학습시켜 더 스마트한 다단계 추론 (Multi-step reasoning) 및 개선된 도구 사용 (Tool usage) 능력을 갖추게 하세요. - 🗞️
MCP•RL: 모델에게 모든 MCP 서버를 마스터하도록 가르치세요 -
강화학습 (RL)을 통해 모델이 MCP 서버 도구를 효과적으로 사용하도록 자동으로 학습시킵니다. - 🗞️
AutoRL: 모든 작업을 위한 제로 데이터 학습 (Zero-Data Training) -
자동 입력 생성 및 RULER 평가를 사용하여 라벨링된 데이터 없이 맞춤형 AI 모델을 학습시킵니다. - 🗞️
RULER: RL 보상 (Rewards)을 위한 이지 모드
강화학습 (RL)에서 자동 보상 생성을 위해 이제 사용할 수 있습니다. - 🗞️
ART•E: o3를 능가하는 이메일 조사 에이전트를 구축한 방법
OpenAI의 o3를 능가하는 Qwen 2.5 14B 이메일 에이전트를 보여줍니다. - 🗞️
ART Trainer: 에이전트를 위한 새로운 RL 트레이너
GRPO를 사용하여 LLM 기반 에이전트를 쉽게 학습할 수 있습니다. -
ART는 기존 애플리케이션에 RL 학습을 도입할 수 있는 편리한 래퍼 (Wrappers)를 제공합니다. 우리는 학습 서버를 코드가 인터페이스할 필요가 없는 모듈형 서비스로 추상화했습니다. 어디에서나 학습하세요. 노트북에서 ART 클라이언트를 실행하면 ART 서버가 일시적인 GPU 지원 환경을 시작하거나, 로컬 GPU에서 실행할 수 있습니다.
-
W&B, Langfuse, OpenPipe와 같은 호스팅 플랫폼과의 통합을 통해 유연한 관측성 (Observability)을 제공하고 디버깅을 간소화합니다. - ART는 **지능적인 기본값 (Intelligent defaults)**과 함께 커스터마이징이 가능합니다. 특정 요구 사항에 맞춰 학습 파라미터 및 추론 엔진 설정을 구성하거나, 학습 효율성과 안정성을 위해 최적화된 기본값을 활용할 수 있습니다.
ART 에이전트는 Python이 실행되는 모든 클라이언트 머신에서 학습할 수 있습니다. 기존 프로젝트에 추가하려면 다음 명령어를 실행하세요:
pip install openpipe-art
실제 작업에 ART를 어떻게 사용하는지 궁금하신가요? Qwen 2.5 14B를 학습시켜 이메일 검색에서 o3를 이긴 방법을 자세히 설명한 ART•E 에이전트 블로그 포스트를 확인해 보세요!
ART의 기능은 **클라이언트 (client)**와 **서버 (server)**로 나뉩니다. OpenAI 호환 클라이언트는 ART와 사용자의 코드베이스 사이의 인터페이스 역할을 담당합니다. 클라이언트를 사용하면 메시지를 전달하고, LLM이 개선됨에 따라 생성 결과 (completions)를 받아올 수 있습니다. 서버는 GPU가 있는 모든 머신에서 독립적으로 실행됩니다. 서버는 일부 사용자 정의 설정 (custom configuration)을 허용하면서, RL 루프의 추론 (inference) 및 학습 (training) 부분의 복잡성을 추상화합니다. 학습 루프의 개요는 다음과 같습니다:
-
추론 (Inference)
- 사용자의 코드는 ART 클라이언트를 사용하여 에이전트 워크플로우 (agentic workflow)를 수행합니다 (보통 데이터를 더 빠르게 수집하기 위해 여러 번의 롤아웃 (rollouts)을 병렬로 실행합니다).
- 생성 요청은 ART 서버로 라우팅되며, 서버는 vLLM에서 모델의 최신 LoRA를 실행합니다.
- 에이전트가 실행됨에 따라, 각
system,user,assistant메시지는 궤적 (Trajectory)에 저장됩니다. - 롤아웃이 완료되면, 사용자의 코드는 해당 궤적에 LLM의 성능을 나타내는
reward(보상)를 할당합니다.
-
학습 (Training)
- 각 롤아웃이 완료되면, 궤적들이 그룹화되어 서버로 전송됩니다. 학습이 실행되는 동안 추론은 차단됩니다.
- 서버는 최신 체크포인트(또는 첫 번째 반복 시 빈 LoRA)에서 초기화하여 GRPO를 사용하여 모델을 학습시킵니다.
- 서버는 새로 학습된 LoRA를 로컬 디렉토리에 저장하고 이를 vLLM에 로드합니다.
- 추론 차단이 해제되고 루프가 1단계부터 재개됩니다.
이 학습 루프는 지정된 횟수의 추론 및 학습 반복이 완료될 때까지 실행됩니다.
ART는 대부분의 vLLM/HuggingFace-transformers 호환 인과적 언어 모델 (causal language models), 또는 최소한 Unsloth에서 지원하는 모델들과 함께 작동해야 합니다. Gemma 3는 현재로서는 지원되지 않는 것으로 보입니다. 만약 다른 모델이 작동하지 않는다면, Discord를 통해 알려주시거나 GitHub에 이슈를 생성해 주세요!
ART는 활발히 개발 중이며, 기여를 언제나 환영합니다! 자세한 내용은 CONTRIBUTING.md 파일을 참조해 주세요.
@misc{hilton2025art,
author = {Brad Hilton and Kyle Corbitt and David Corbitt and Saumya Gandhi and Angky William and Bohdan Kovalevskyi and Andie Jones},
title = {ART: Agent Reinforcement Trainer},
...
이 저장소의 소스 코드는 Apache-2.0 라이선스(License) 하에 제공됩니다.
ART는 거인들의 어깨 위에 서 있습니다. ART의 개발로 이어진 많은 아이디어와 초기 실험들은 오픈 소스 강화학습 (RL) 커뮤니티 전반에 빚을 지고 있지만, 저희는 특히 다음 프로젝트의 저자들에게 깊은 감사를 표합니다:
마지막으로, 실제 환경에서 ART를 테스트할 수 있도록 도와준 파트너 분들께 감사드립니다! 여러분이 ART를 통해 무엇을 만들어낼지 정말 기대됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기