강화학습을 이용한 Text-to-SPARQL 생성: DBLP 데이터셋에 대한 GRPO 기반 접근 방식
요약
본 연구는 정답 쿼리 주석이 없는 상황에서 소규모 언어 모델이 Text-to-SPARQL 생성을 수행할 수 있도록 GRPO 기반의 강화학습 방식을 제안합니다. DBLP-QuAD 데이터셋을 활용하여 Qwen3-1.7B 모델에 실행 피드백과 구조적 제약을 보상으로 사용하는 학습을 적용한 결과, 제로샷 베이스라인 대비 유의미한 성능 향상과 일반화 능력을 확인했습니다.
핵심 포인트
- 정답 쿼리 없이 결과 기반 보상(outcome-based rewards)만으로 Text-to-SPARQL 생성이 가능함을 입증
- GRPO(Group-Relative Policy Optimization)를 활용하여 소규모 모델의 제로샷 성능을 효과적으로 개선
- 실행 피드백(execution feedback)이 모델 성능 향상의 핵심적인 기여 요소임을 확인
- 지도 학습 기반의 DoRA 미세조정이 동일 규모 모델에서 더 높은 정확도를 보였으나, GRPO는 경쟁력 있는 일반화 성능을 제공함
지식 그래프 질의응답 (Knowledge graph question answering)은 자연어 질문을 지식 그래프 상에서 실행 가능한 쿼리로 변환하는 것을 목표로 하지만, 기존 방식들은 종로 정답 쿼리 주석 (gold query annotations) 형태의 완전 감독 (full supervision) 또는 거대 모델에 의존하는 경우가 많습니다. 본 연구는 결과 기반 보상 (outcome-based rewards)을 사용하는 강화학습 (Reinforcement Learning, RL)이 학술 도메인에서 제로샷 (zero-shot) Text-to-SPARQL 생성을 수행하도록 소규모 지시어 미세조정 (instruction-tuned) 언어 모델을 학습시킬 수 있는지 조사합니다. DBLP-QuAD 데이터셋에 대해 Qwen3-1.7B 모델에 그룹 상대 정책 최적화 (Group-Relative Policy Optimization, GRPO)를 적용하였으며, 자연어 질문과 엔티티 (entities) 및 관계 (relations)에 대한 기호적 힌트 (symbolic hints)를 결합한 프롬프트를 사용하였습니다. 학습은 실행 피드백 (execution feedback), 구조적 제약 (structural constraints), 그리고 정답 수준의 보상 (answer-level rewards)에 의존하며, 정답 쿼리 기반의 셰이핑 (shaping)을 포함하는 추가적인 변형 모델도 사용되었습니다. 결과 모델들은 정답 수준 정확도 (answer-level accuracy), 실행 정확도 (execution accuracy), 카테고리별 점수 (category-wise scores), 그리고 미학습 템플릿에 대한 일반화 (generalization) 성능 측면에서 수정되지 않은 제로샷 베이스라인 (zero-shot baseline) 및 지도 학습 기반의 DoRA 미세조정 (DoRA-finetuned) 베이스라인과 비교되었습니다. GRPO는 제로샷 베이스라인에 비해 실질적인 개선을 보였으며 경쟁력 있는 일반화 성능을 나타낸 반면, 지도 학습 기반의 DoRA 미세조정은 동일한 모델 규모에서 더 높은 전체 정확도를 달성했습니다. 어블레이션 분석 (Ablation analyses) 결과, 실행 기반 보상이 대부분의 이득을 차지하며 추가적인 셰이핑은 제한적인 추가 이점만을 제공하는 것으로 나타났습니다. 이는 토큰 수준의 감독 (token-level supervision)을 위한 정답 쿼리가 없는 경우, 결과 기반 강화학습이 실행 가능한 학습 전략임을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기