본문으로 건너뛰기

© 2026 Molayo

Insights

AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.

UBP2: 효율적인 선호 기반 강화학습 (Preference-based Reinforcement Learning)을 위한 불확실성 균형 선호 - Insights | Molayo | Molayo