Jev가 강화학습(RL)의 Q 함수 또는 정책이 될 수 있을까?
요약
본 논문은 기존 연구에서 파운데이션 모델이 생성기나 프롬프트로만 사용된 것과 달리, 의사결정 모델 Jev를 강화학습(RL)의 새로운 구성 요소로 활용하는 방법을 제시합니다. Jev는 단일 순방향 패스로 보정되고 타입 지정된 답변을 반환하여 효율적입니다. 연구진은 Jev를 참조 정책, 탐색 심사관, 리플레이 평가자 등으로 사용하여 샘플 효율성, 탐색 및 학습 성능을 개선했음을 입증했습니다.
핵심 포인트
- Jev는 단일 순방향 패스로 보정된 답변을 반환하는 의사결정 모델이다.
- Jev를 RL의 참조 정책, 탐색 심사관 등으로 활용하여 성능을 개선했다.
- MiniGrid 및 Atari 게임에서 Jev 사용이 표준 RL 학습기보다 우수함을 입증했다.
- RL 훈련 과정 내에서 고정된 의사결정 모델을 사용하는 최초 사례이다.
파운데이션 모델은 샘플 효율성과 전이성 면에서 오랫동안 지적되어 온 강화학습(RL)의 약점을 완화하는 사전 정보(priors)를 제공하지만, 토큰별 생성을 하기 때문에 질의가 순차적이고 비용이 많이 듭니다. 최근에 출시된 의사결정 모델인 Jev는 아무것도 생성하지 않고 보정되고 타입 지정된 답변을 단일 순방향 패스(forward pass)로 반환합니다. 기존 연구들은 RL에서 파운데이션 모델을 학습되어야 할 모델이나 프롬프트되어야 할 생성기(generators)로서만 연구해 왔으며, Jev는 지금까지 단일 도메인의 블랙박스로만 사용되었기에 어느 범주에도 속하지 않습니다. 따라서 이러한 모델이 RL 환경에서 스스로 얼마나 잘 결정하는지, 그리고 훈련의 구성 요소로서 RL을 어떻게 개선할 수 있는지는 아직 다루어지지 않았습니다. 이를 위해 본 논문에서는 먼저 RL 시스템의 객체들이 소비하는 답변에 요구하는 사항들을 검토하고, Jev가 가치 함수(value function)의 핵심적인 사용법을 제외한 모든 것을 충족시킬 수 있음을 확립합니다. 나머지 객체들은 각각 여러 역할을 허용하는 위치를 형성합니다. 그런 다음 우리는 참조 정책(reference policy), 탐색 심사관(exploration judge), 그리고 리플레이 평가자(replay rater)로서 Jev를 활용하는 알고리즘을 구성하여 샘플 효율성, 탐색, 학습 성능을 개선합니다. 9개의 MiniGrid 작업과 3개의 Atari 게임 전반에 걸쳐, 모델 자체가 미훈련 상태인 경우에도 Jev와 함께 훈련한 것이 표준 RL 학습기보다 우수하며, 심지어 학습기가 단독으로 아무런 진전도 이루지 못하는 경우에도 그러합니다. 우리가 아는 한, 우리는 RL 학습 과정 내에서 Jev를 사용한 최초의 사례를 제시하고, 고정된 의사결정 모델을 RL 훈련의 사용 가능한 구성 요소로 확립하며, Jev와 다른 고급 의사결정 모델들이 어떻게 RL을 개선할 수 있을지에 대한 추가적인 탐구를 제안합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기