Kroma 0.3.1 - full turbo opd model
요약
Krea2 모델이 Chroma 데이터셋으로 파인튜닝된 Kroma 0.3.1 버전의 풀 터보 OPD(On-Policy Distillation) 모델이 출시되었습니다. 이 모델은 기존 오프라인 방식의 한계를 극복하고, 학생이 생성한 실제 궤적에 맞춰 교사가 수정하는 방식으로 학습하여 안정적인 Turbo 속도를 구현했습니다.
핵심 포인트
- Krea2와 Chroma 데이터셋을 결합하여 Kroma 0.3.1 모델을 개발함.
- 기존 오프라인 방식 대신, 학생의 실제 궤적 기반 On-Policy Distillation 방식을 채택함.
- 모델이 원래 분포 내에 머무르도록 하여 일반적인 증류 비용(mode collapse 등) 없이 Turbo 속도를 구현함.
Chroma와 Krea2가 만났을 때: Krea2 모델이 Chroma 데이터셋으로 파인튜닝되었습니다. OPD란 무엇인가요? v0.3.1은 on-policy로 증류(distilled)되었습니다. 기존의 클래식 오프라인 방식 — 고정된 샘플링 스케줄에 따라 교사를 모방하는 방식으로, 이는 학생을 원래 데이터 매니폴드에서 서서히 벗어나게 합니다 — 대신, 학생이 자체적인 궤적(trajectories)을 생성하고 교사가 그 정확한 지점에서 이를 수정합니다. 학습은 모델이 실제로 방문하는 상태(states)에 대해서만 이루어지므로, 증류된 모델은 원래 모델의 분포 내에 머무릅니다: 일반적인 증류 비용(mode collapse, 디테일 손실, 갑자기 작동을 멈추는 프롬프트 등) 없이 Turbo 속도를 구현했습니다. 새로운 풀 모델이 출시되었으며 두 가지 버전으로 이미 다운로드할 수 있습니다: original: https://huggingface.co/lodestones/Kroma int8_convrot: https://huggingface.co/Clybius/Kroma-Quantizations을 /u/mikemend가 제출했습니다 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/StableDiffusion의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기