지식에서 검증으로: 지식 집약적 도메인에서의 LLM을 위한 RLVR 탐색
요약
본 연구는 수학이나 코딩을 넘어 지식 집약적 도메인에서 LLM의 추론 능력을 향상시키기 위한 RLVR(검증 가능한 보상을 활용한 강화학습) 프레임워크인 K2V를 제안합니다. K2V는 자동화된 데이터 합성 기술을 통해 고품질 데이터를 확보하고, 최종 정답뿐만 아니라 추론 과정 자체를 검증함으로써 기존 RLVR의 한계를 극복합니다.
핵심 포인트
- 지식 집약적 도메인을 위한 RLVR 확장 방법론 제안
- 자동화된 데이터 합성을 통한 고품질 검증 가능 데이터 부족 문제 해결
- 최종 정답 중심에서 추론 과정 검증(Reasoning Verification)으로의 패러다임 전환
- K2V 프레임워크가 모델의 일반 성능 저하 없이 지식 기반 추론 능력을 향상시킴을 입증
검증 가능한 보상을 활용한 강화학습 (Reinforcement learning with verifiable rewards, RLVR)은 수학 및 코딩과 같은 도메인에서 대규모 언어 모델 (Large Language Models, LLMs)의 추론 능력을 향상시키는 유망한 잠재력을 보여주었습니다. 그러나 고품질의 검증 가능한 데이터의 부족으로 인해 지식 집약적 (knowledge-intensive) 도메인에서의 적용은 효과적으로 탐색되지 않았습니다. 더욱이, 현재의 RLVR은 최종 정답의 정확성에만 집중하고 있어, 결함이 있는 추론과 희소한 보상 신호 (sparse reward signals)라는 한계를 초래합니다. 본 연구에서는 자동화된 검증 가능 데이터 합성을 통해 RLVR을 지식 집약적 도메인으로 확장하는 동시에, LLM의 추론 과정을 검증할 수 있게 하는 프레임워크인 Knowledge-to-Verification (K2V)를 제안합니다. 광범위한 실험을 통해 K2V가 모델의 일반적인 능력을 크게 저하시키지 않으면서도 지식 집약적 도메인에서 LLM의 추론을 향상시킨다는 것을 입증하였습니다. 또한 본 연구는 자동화된 데이터 합성(automated data synthesis)과 추론 검증(reasoning verification)을 통합하는 것이 이러한 더 넓은 도메인에서 모델의 능력을 향상시키는 유망한 방향임을 시사합니다. 코드는 https://github.com/SeedScientist/K2V 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기