
RLVR에서 RLSVR로
요약
RLVR를 RLSVR로 발전시켜 판사(judge) 없이도 LLM의 자기 개선을 가능하게 하는 새로운 방법론을 제안합니다. '스파이는 누구인가?' 게임을 통해 개방형 작업에서도 검증 가능한 보상을 생성하여 요약, 창의적 글쓰기, 수학적 추론 능력을 향상시킵니다.
핵심 포인트
- 판사(judge) 모델 없이 검증 가능한 보상 생성 가능
- 개방형 작업을 게임 기반의 검증 가능한 작업으로 변환
- 요약, 창의적 글쓰기, 수학적 추론 분야의 자기 개선 지원
RLVR에서 RLSVR로
개방형 작업(open-ended tasks)을 "스파이는 누구인가?(Who Is the Spy?)" 게임으로 변환하여 검증 가능한 보상(verifiable rewards)을 생성함으로써, 판사(judge) 없이도 요약, 창의적 글쓰기, 수학적 추론(math reasoning) 분야에서 LLM의 자기 개선(self-improvement)을 가능하게 합니다. https://t.co/LYHap6I7lE
[IMG:1]
AI 자동 생성 콘텐츠
본 콘텐츠는 X @huggingpapers (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기