RL을 이용해 4B VLM으로 GeoGuesser 게임 플레이하기
요약
본 글은 강화학습(RL)을 활용하여 4B VLM이 GeoGuesser 게임을 플레이하도록 훈련시킨 과정을 공유합니다. 환경, 데이터셋, 훈련 레시피 등 모든 요소가 오픈 소스로 공개되었으며, GPT-5.4 mini나 Haiku 같은 모델들을 능가하는 성능을 보여주었습니다.
핵심 포인트
- RL을 이용해 VLM의 게임 플레이 능력을 입증함.
- 환경 구축부터 훈련까지 전 과정을 워크스루로 공개.
- 오픈 소스로 환경, 데이터셋, 코드를 제공하여 재현 가능성을 높임.
우리는 RL(강화학습)을 사용하여 4B VLM(Vision-Language Model)을 GeoGuesser 게임에 플레이하도록 훈련시켰습니다.
환경, 데이터셋, 훈련 레시피, 평가 지표(evals), 그리고 코드는 모두 오픈 소스입니다.
단일 A100에서 실행됩니다.
gpt-5.4 mini, haiku, qwen 3.5 122B를 능가했으며, evals에서는 sonnet에 근접했습니다.
단순히 환경과 결과만 공개하고 싶지 않았습니다. 우리는 다양한 문제에 대한 RL 환경을 구축하는 기술적 통찰력을 공유하고 싶었습니다.
그래서 아이디어 → 환경 → 보상(rewards) → 평가 지표(evals) → 훈련까지의 전체 과정을 담은 워크스루를 작성했습니다. 이 과정에는 성공했던 부분과 그렇지 못했던 부분 모두가 포함되어 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @adithya_s_k (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기