
FreedomIntelligence/HuatuoGPT-3-9B · Hugging Face
요약
FreedomIntelligence가 Qwen3.5-9B 기반의 의료 LLM인 HuatuoGPT-3-9B를 공개했습니다. 이 모델은 One-stage Policy Optimization (OnePO)이라는 단일 강화 학습 방식을 적용하여 별도의 도메인 특화 지도 미세 조정 없이 의학 분야에 적응시켰습니다.
핵심 포인트
- HuatuoGPT-3-9B는 Qwen3.5-9B를 기반으로 구축된 의료 LLM입니다.
- OnePO(One-stage Policy Optimization)를 사용하여 단일 강화 학습 단계로 의학 분야에 적응시켰습니다.
- 별도의 도메인 특화 지도 미세 조정이 필요 없어 효율적입니다.
- 훈련 코드, RL 데이터셋, 8B 루브릭 그레이더가 공개되었습니다.
FreedomIntelligence에서 제공하는 HuatuoGPT-3-9B는 Qwen3.5-9B를 기반으로 One-stage Policy Optimization (OnePO)을 적용하여 구축된 의료 LLM입니다. OnePO는 별도의 도메인 특화 지도 미세 조정(supervised fine-tuning) 없이 단일 강화 학습(reinforcement-learning) 단계에서 언어 모델을 의학 분야에 적응시킵니다. 교사 응답(Teacher responses)은 일시적인 지침을 제공하며, 모델이 개선됨에 따라 폐기됩니다. 저희는 훈련 코드, 의료 RL 데이터셋, 그리고 8B 루브릭 그레이더를 공개합니다. /u/jacek2023 제출 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기