본문으로 건너뛰기

© 2026 Molayo

Insights

AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.

GRPO와 On-Policy Distillation을 넘어: 언어 모델 사후 학습을 위한 경험적 Sparse-to-Dense 보상 원칙 - Insights | Molayo | Molayo