
Search-R1: 추론과 검색 엔진 호출을 교차 수행하도록 LLM을 학습시키는 오픈 소스 강화학습 (RL) 프레임워크
요약
Search-R1은 LLM이 추론과 검색 엔진 호출을 교차 수행하도록 학습시키는 오픈 소스 강화학습 프레임워크입니다. DeepSeek-R1의 RL 방식을 도구 증강 검색으로 확장하여 Qwen2.5, Llama3 등과 연동됩니다.
핵심 포인트
- 추론과 검색 엔진 호출을 결합한 RL 프레임워크
- veRL 기반으로 PPO, GRPO, reinforce 방식 지원
- Qwen2.5, Llama3 및 다양한 검색 엔진과 호환
- 논문, 모델, 데이터셋 및 실험 로그를 모두 공개
Search-R1은 LLM (Large Language Models)이 추론 (reasoning)과 검색 엔진 호출을 교차 수행하도록 학습시키는 오픈 소스 강화학습 (reinforcement learning) 프레임워크로, DeepSeek-R1 스타일의 RL (강화학습)을 도구 증강 검색 (tool-augmented retrieval)으로 확장합니다.
- veRL을 기반으로 구축되었으며, PPO, GRPO 및 reinforce 방식을 지원합니다.
- Qwen2.5, Llama3 및 다양한 검색 엔진 (sparse, dense, online)과 함께 작동합니다.
- 두 편의 논문, Hugging Face 모델/데이터 컬렉션, 그리고 W&B 상의 전체 실험 로그를 포함합니다.
- veRL, SkyRL, 그리고 Thinking Machines Lab의 Tinker cookbook에 통합되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @githubprojects (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기