잠재 공간에서의 평가: 의미 보존 압축을 통한 효율적인 생성적 보상 모델링
요약
본 논문은 의미 보존 압축을 통해 효율적인 생성적 보상 모델링 프레임워크인 LatentGRM을 제안합니다. LatentGRM은 텍스트 평가를 직접 생성하지 않고도 자율적인 쌍별 판단을 지원하는 연속 궤적을 학습하여, 추론 비용을 크게 절감합니다. 이는 경쟁력 있는 판단 품질을 유지하면서 효율성을 높이는 방법을 제시합니다.
핵심 포인트
- LatentGRM: 의미 청킹 및 압축 기반의 잠재 평가 프레임워크.
- 텍스트 생성 없이도 쌍별 판단이 가능하여 추론 비용을 대폭 절감함.
- 평가 궤적을 최대 9.2배 압축하고, 심사위원 추론 시간을 6.1~7.0배 단축함.
보상 모델링(Reward modeling)은 종종 여러 평가 기준에 걸쳐 공동으로 표현하고 추론하는 것을 요구하지만, 이 과정을 토큰별로 구어화하는 것은 상당한 추론 비용을 발생시킬 수 있습니다. 최근의 잠재 추론(latent reasoning) 관련 연구는 연속적인 상태가 이러한 계산을 더 간결하게 지원할 수 있음을 시사합니다. 우리는 의미 청킹(semantic chunking), 압축, 그리고 재구성을 기반으로 구축된 잠재 평가 프레임워크인 LatentGRM을 소개합니다. 루브릭 안내 평가(rubric-guided evaluations)의 구조를 사용하여 압축을 안내함으로써, LatentGRM은 텍스트 평가 생성을 하지 않으면서 자율적인 쌍별 판단을 지원하는 간결한 연속 궤적(continuous trajectories)을 학습합니다. 별도의 해석기(interpreter)가 이러한 궤적으로부터 평가 텍스트를 재구성하여, 압축 하에서 유지되는 정보에 대한 오프라인 뷰를 제공합니다. 일치된 훈련 데이터와 백본(backbones) 하에서, LatentGRM은 4B 및 8B 규모 모두에서 명시적인 지도 미세 조정(Supervised Fine-Tuning, SFT) 심사위원과 비교하여 경쟁력 있는 종합 선호도 정확도를 달성합니다. 네 가지 벤치마크 도메인에 걸쳐, LatentGRM-8B는 평가 궤적을 8.99.2배 압축하고 vote@5에서 전체 심사위원 추론 시간을 6.17.0배 줄입니다. 제어된 루브릭 개입(Controlled rubric interventions)은 기준 의존적인 선호도 정보가 잠재 시퀀스를 통해 전달됨을 보여줍니다. 종합적으로, 이러한 결과는 연속적인 잠재 평가가 경쟁력 있는 판단 품질을 유지하면서 추론 비용을 상당히 줄일 수 있음을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기