HARGO: HPC 작업에서의 LLM RL 사후 학습을 위한 이질성 인지 보상 가이드 최적화
요약
HPC 작업의 높은 이질성을 해결하기 위해 제안된 HARGO 방법론은 강화 학습 사후 학습 시 응답별 중요도 가중치를 도입합니다. 이를 통해 데이터 레이스 탐지부터 사실적 질의응답까지 다양한 작업에서 최적의 정렬 성능을 달성했습니다.
핵심 포인트
- HPC 작업의 이질성으로 인한 기존 RL 방법론의 한계 지적
- 신뢰도 변조 어드밴티지를 통한 응답별 중요도 가중치 도입
- 작업 유형 레이블 없이 그룹 보상 대비와 로그 확률 활용
- 데이터 레이스 F1 91.30% 및 WinRate 54.62% 달성
지도 미세 조정 (Supervised fine-tuning, SFT)은 대규모 언어 모델 (Large Language Models, LLMs)에 데이터 레이스 탐지 (data race detection) 및 벤치마크 질의응답과 같은 고성능 컴퓨팅 (High-Performance Computing, HPC) 작업을 위한 도메인 지식을 부여할 수 있습니다. 그러나 지식만으로는 작업에 적합한 행동을 보장할 수 없습니다. C/C++ 데이터 레이스 샘플의 88.65%를 정확하게 분류하는 동일한 SFT 모델이 사실적 질의에 대해서는 장황하고 부정확한 답변을 생성하며, MLPerf 응답의 65.9%가 40자를 초과하는 현상이 나타납니다. 강화 학습 (Reinforcement Learning, RL) 사후 학습 (post-training)은 토큰 수준의 모방보다는 작업별 보상 (task-specific rewards)을 최적화함으로써 이러한 격차를 해결합니다. 그러나 HPC 작업은 극심한 이질성 (heterogeneity)을 보입니다. 이진 분류 (binary classification), 사실적 질의응답 (factual QA), 의미론적 생성 (semantic generation)은 답변 길이에서 58배의 차이를 보이며, 세 가지의 뚜렷한 보상 분포를 나타내고, 매우 다양한 SFT 정확도를 보입니다. 이는 GRPO와 같은 균일 가중치 RL 방법론을 차선책으로 만듭니다. 우리는 신뢰도 변조 어드밴티지 (confidence-modulated advantage)를 통해 응답별 중요도 가중치 (per-response importance weighting)를 도입하는 HARGO (Heterogeneity-Aware Reward-Guided Optimization)를 제안합니다. 이는 작업 유형 레이블을 요구하지 않고, 그룹 수준의 보상 대비 (reward contrast)로부터 판별 신호 (discrimination signal)를 계산하고 참조 모델의 로그 확률 (log-probabilities)로부터 신뢰도 신호 (confidence signal)를 계산한 다음, 응답별 가중치를 계산하기 전에 어드밴티지를 변조합니다. 4개의 HPC 작업과 9개의 방법론에 대해, HARGO는 세 가지 주요 지표 모두에서 최고의 성능을 달성했습니다: WinRate 54.62%, Data Race F1 91.30%, 그리고 PLP Similarity 0.8558. 절제 연구 (Ablation)를 통해 두 신호 모두의 상호 보완적인 기여를 확인했습니다. HARGO는 이질적인 HPC 작업에 대해 비교된 방법론들 중 최고의 전반적인 정렬 (alignment) 품질을 확립합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기