기계 번역을 위한 참조 없는 강화학습 미세 조정: Seq2Seq 관점의 연구
요약
본 연구는 기존 Decoder-only LLM 중심의 강화학습 미세 조정 연구를 넘어, 인코더-디코더(Seq2Seq) 구조인 NLLB-200 모델에 GRPO를 적용한 사례를 다룹니다. 병렬 데이터 없이 LaBSE와 COMET-Kiwi를 활용한 하이브리드 참조 없는 보상 방식을 통해 13개 언어에서 일관된 성능 향상을 확인했습니다. 특히 데이터가 부족한 언어일수록 보상 판별력이 높아져 더 큰 성능 이득을 얻는다는 패턴을 입증했습니다.
핵심 포인트
- 인코더-디코더(Seq2Seq) 구조에 GRPO(Group Relative Policy Optimization)를 적용하여 기계 번역 성능을 개선함
- 병렬 데이터가 필요 없는 하이브리드 참조 없는 보상(Hybrid reference-free reward) 메커니즘 활용
- 데이터가 부족하거나 형태론적으로 복잡한 언어에서도 SFT(지도 미세 조정)와 경쟁할 만한 성능을 달성
- 베이스라인 성능이 낮고 보상 판별력이 높은 환경에서 가장 큰 성능 향상이 나타나는 패턴 확인
상용 기계 번역 (Machine Translation, MT)은 인코더-디코더 (Encoder-Decoder) Seq2Seq 모델에 압도적으로 의존하고 있지만, MT 미세 조정 (Fine-tuning)을 위한 강화학습 (Reinforcement Learning, RL) 접근 방식은 주로 7B 이상의 파라미터를 가진 디코더 전용 (Decoder-only) LLM을 대상으로 해왔으며, 인코더-디코더 구조에 대한 체계적인 연구는 제한적이었습니다. 본 연구에서는 미세 조정 시 병렬 데이터 (Parallel data)가 필요 없는 하이브리드 참조 없는 보상 (Hybrid reference-free reward; LaBSE 및 COMET-Kiwi)을 사용하여 NLLB-200 (600M 및 1.3B) 모델에 그룹 상대 정책 최적화 (Group Relative Policy Optimization, GRPO)를 적용하고, 유형론적으로 다양한 13개 언어에 대해 평가를 수행했습니다. GRPO는 13개 언어 모두에서 일관된 성능 향상을 보였으며, 번체 중국어 (Traditional Chinese)의 경우 최대 +5.03 chrF++의 향상을 기록했습니다. 또한, 타겟 언어 데이터가 전혀 없는 상태에서도 형태론적으로 복잡한 언어들에 대해 3 에포크 (Epoch) 동안 수행된 지도 미세 조정 (Supervised Fine-tuning, SFT)과 경쟁할 만한 성능을 보여주었습니다. 우리는 베이스라인 성능이 가장 낮고 보상 판별력 (Reward discriminability)이 가장 높은 곳에서 이득이 가장 크다는 일관된 경험적 패턴을 확인하였으며, 이는 이 접근 방식이 병렬 데이터가 가장 부족한 곳에서 가장 효과적임을 의미합니다. 우리는 영어 및 스페인어 소스 언어 전반에 걸쳐 이러한 패턴을 재현했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기