UniEvo-VL: 멀티모달 이미지 생성을 위한 온-폴리시 자가 증류
요약
UniEvo-VL은 크리틱 조건부 EMA 교사를 활용하여 멀티모달 이미지 생성 모델의 자체 비평 능력을 내재화한 통합 모델입니다. 이 모델은 단순히 이미지를 생성하는 것을 넘어, 생성된 결과와 프롬프트 간의 불일치를 스스로 평가하고 개선하는 과정을 학습합니다.
핵심 포인트
- UniEvo-VL은 크리틱 조건부 EMA 교사를 사용해 자체 비평 능력을 갖춘 멀티모달 모델을 훈련합니다.
- 모델은 이미지 생성 후, 결과와 프롬프트 간의 불일치를 식별하고 개선하는 과정을 학습합니다.
- 교사는 비평으로 풍부해진 특권적 프롬프트를 받고, 학생은 원래 프롬프트만 보고 교사의 행동을 재현하도록 학습합니다.
UniEvo-VL은 크리틱(critique) 조건부 EMA(Exponential Moving Average) 교사를 사용하여 학생의 현재 정책에서 샘플링된 디노이징 궤적과 일치함으로써 자체적인 이미지 비평을 내재화하는 통합 멀티모달 모델을 훈련합니다.
추론 시간 반성에서 학습된 행동으로
이미지를 생성하고 이해할 수 있는 멀티모달 모델은 유용한 피드백 루프를 가집니다. 즉, 이미지를 생성하고 프롬프트와 비교하며 불일치를 식별한 다음, 더 나은 지침으로 다시 시도하는 것입니다. Self-Refine은 추가적인 훈련 없이 언어 작업에 이와 관련된 생성-피드백-개선 패턴을 추론 시간에 적용합니다.
새롭게 발표된 UniEvo-VL 논문은 다른 질문을 던집니다. 즉, 교정적 피드백이 훈련 감독(supervision)이 되어 원래 프롬프트에 비평이 포함되어 있지 않더라도 미래의 이미지가 개선될 수 있는가 하는 것입니다?
그 답변은 온-폴리시 자가 증류입니다. UniEvo-VL은 수정된 이미지를 고정된 목표로 취급하는 대신, 크리틱을 사용하여 교사를 위한 특권 프롬프트(privileged prompt)를 구성합니다. 그러면 학생은 원래의 프롬프트만 보면서도 교사의 디노이징 행동을 재현하도록 학습합니다.
구현은 Qwen-Image-2512를 기반으로 하며 Qwen-VL 피드백 파이프라인을 사용합니다.
훈련 파이프라인
이 방법은 교정적 경험을 습득하고 이를 증류하는 과정을 번갈아 수행합니다:
훈련 파이프라인
이 방법은 교정적 경험을 습득하고 이를 증류하는 과정을 번갈아 수행합니다:
- 생성 및 평가(Generate and assess). 프롬프트가 주어지면, 모델은 샘플링된 노이즈로부터 이미지를 생성합니다. 이해 모드에서는 이 이미지를 프롬프트와 비교하여 불일치 비평(discrepancy critique)을 생성하고, 이진적인 수용 또는 거부 결정을 반환합니다.
- 특권적 조건화 생성(Create privileged conditioning). 유효한 비평과 함께 거부된 이미지에 대해, 이해 구성 요소는 원래 프롬프트와 비평을 결합하여 수정되고 자체 포함적인 프롬프트를 만듭니다.
- 수정본 선택적 검증(Optionally verify the revision). 생성기는 동일한 노이즈를 수정된 프롬프트로 재사용합니다. 결과 이미지는 원래 요청과 비교 평가되며, 수정된 결과가 수용될 경우에만 이 경험이 유지됩니다.
- 학생으로부터 샘플링(Sample from the student). 학생은 오직 원래 프롬프트에 조건화되어 전체 노이즈 제거 궤적을 실행합니다.
- 일치 상태에서 증류(Distill at matched states). 해당 궤적에서 샘플링된 상태에서, 학생의 노이즈 제거 분포는 수정된 프롬프트에 조건화된 교사 분포와 비교됩니다.
이 설계는 두 역할에 제공되는 정보를 분리합니다. 학생은 일반적인 사용자 프롬프트를 받습니다. 반면, 교사는 비평으로 풍부해진 프롬프트를 받아, 이 교정 정보가 추론 시점에 의존하기보다는 학생이 내재화해야 하는 특권적 정보(privileged information)가 되도록 만듭니다.
하나의 모델, 두 가지 훈련 역할
'자기 증류(Self-distillation)'라는 것이 정확히 동일한 파라미터 스냅샷이 제약 없는 손실(unconstrained loss)의 양쪽 측면을 공급한다는 의미는 아닙니다. UniEvo-VL은 학생 파라미터와 지수 이동 평균(exponential-moving-average, EMA) 교사를 유지하며, 부록에서는 0.999의 EMA 감쇠율을 보고합니다.
선택된 각 잠재 상태에서 두 네트워크 모두 동일한 상태로부터 평가됩니다:
- 학생(student)은 원래의 프롬프트(prompt)를 사용하여 다음 노이징 전이(denoising transition)를 예측합니다.
- EMA 교사(teacher)는 그 일치된 상태(matched state)에서 수정된 프롬프트(revised prompt)를 사용하여 예측합니다.
- 학습은 이 두 전이 분포(transition distributions) 간의 차이(divergence)를 최소화하는 것을 목표로 합니다.
- 교사 타겟(teacher target)에는 stop-gradient가 적용되므로, 최적화 과정에서 양쪽 모두 서로를 향해 움직이지 않도록 합니다.
- 샘플링된 잠재 상태(latent state)에도 stop-gradient가 적용되어 손실(loss)이 궤적 생성(trajectory generation)을 통해 역전파되는 것을 방지합니다.
이러한 궤적 자체는 현재 학생 정책(student policy)에서 나옵니다. 이것이 바로 “온-폴리시(on-policy)” 부분입니다: 교사에게 학생이 실제로 방문하는 상태, 즉 학생의 현재 행동으로 인해 유도된 불완전하거나 어려운 상태에서의 행동을 물어보는 것입니다.
이는 샘플링 단계를 줄이는 데 초점을 맞춘 증류 접근 방식과는 다릅니다. 예를 들어, Consistency Models는 사전 학습된 확산 모델(diffusion model)을 한 단계 또는 몇 단계 생성(few-step generation)을 지원하도록 증류할 수 있습니다. UniEvo-VL은 대신 특권적인 교정 조건화(privileged corrective conditioning)를 사용하여 학생이 자신의 다단계 궤적(multistep trajectories)을 따라 학습하는 내용을 변화시킵니다.
수정된 최종 이미지로 학습시키면 안 되는 이유?
더 간단한 제안은 수정된 프롬프트로부터 수용 가능한 이미지(accepted image)를 생성하고, 그 최종 이미지를 지도 학습 타겟(supervised target)으로 사용하는 것입니다. 논문에서는 이 접근 방식에 대한 예비 실험을 보고하지만, 수용된 정제된 이미지(accepted refined images)로 지도 미세 조정(supervised fine-tuning)을 하는 것이 학생의 급격한 성능 저하를 야기한다고 말합니다.
궤적 수준 증류(Trajectory-level distillation)는 다른 학습 신호(learning signal)를 제공합니다. 최종 이미지는 하나의 종점(endpoint)만을 기록할 뿐, 수정되지 않은 학생이 마주치는 중간 잠재 상태(intermediate latent states)에서 노이저가 어떻게 행동해야 하는지 지정하지 않습니다. UniEvo-VL은 그 일치된 상태(matched states)에서 비평가 조건화(critique-conditioned) 교사에게 직접 질의합니다.
이러한 차이는 중요합니다. 왜냐하면 수정된 프롬프트로부터 독립적으로 생성된 교사 궤적(teacher trajectory)은 다른 상태를 거칠 수 있기 때문입니다. 단순히 시작점만 일치시키거나—또는 수정된 이미지로 학습하는 것만으로는—학생 자신의 중간 오류 분포로부터의 복구 방법을 반드시 가르쳐주지는 못합니다. 온-폴리시 매칭(On-policy matching)은 방문된 상태들을 명시적으로 다루는 반면, EMA 및 stop-gradient 교사는 비교적 안정적인 목표를 제공합니다.
보고된 결과가 보여주는 것
이 논문은 GenEval 점수가 0.747에서 0.808로 향상되었다고 보고합니다. GenEval은 UniEvo-VL 논문에서 여섯 가지 범주에 걸친 객체 중심 프레임워크로 설명됩니다.
초록에서는 GenEval2 Soft-TIFA 점수가 32.97에서 35.53으로 향상되었다고 또한 보고합니다. 이 수치들은 독립적으로 재현된 측정치가 아니라 논문에서 보고한 결과입니다. 중요한 한 가지 주의사항이 있습니다: 상세 표에는 기본 GenEval2 Native 점수 32.58, 표준 UniEvo-VL 점수 32.37, 그리고 더 강력한 외부 비평가 GPT5.6-Luna를 사용한 변형의 경우 35.53이 나열되어 있습니다. 따라서 초록과 표는 그 향상분에 대해 완전히 일관된 기준선이나 기여도를 제시하고 있지는 않습니다.
표에는 또한 수정 후 검증(post-revision verification)이 중요하다는 점도 나와 있습니다. 검증 변형은 GenEval에서 0.818, GenEval2에서 35.07, OCR에서 0.790에 도달하며, 이는 기본 점수인 0.747, 32.58, 0.771과 비교됩니다.
한계점 및 미해결 질문
이 결과들은 과제 전반에 걸친 균일한 개선을 뒷받침하지 못합니다. 검증이나 외부 비평가 없이 표를 보면, 논문에서 직접적인 생성이 모든 보고된 지표에서 개선된다는 광범위한 서술에도 불구하고 OCR은 0.771에서 0.761로 감소하고 GenEval2 Native는 32.58에서 32.37로 감소하는 것을 볼 수 있습니다. 명시적인 표 값들이 이러한 사례들을 해석하는 더 명확한 근거를 제공합니다.
성능은 프롬프트 난이도에 따라 고르지 않게 변화합니다. 성능 향상은 기본 모델이 처음에 취약했던 프롬프트에 집중되는 반면, 쉬운 프롬프트는 정규화된 0–100 스케일에서 1~4점 하락하는 경향을 보입니다. 따라서 어려운 조합에 대한 더 나은 회복력은 이미 강력한 성능을 보이는 영역에서의 작은 퇴보와 공존할 수 있습니다.
마지막으로, 이 방법은 비평의 품질, 프롬프트 합성, 수용 결정 및 벤치마크 신뢰도에 의존합니다. 논문에서는 검출기 오류가 올바른 이미지에 페널티를 줄 수 있다고 언급하며, GPT5.6-Luna을 사용한 실험은 더 강력한 비평가가 더 큰 향상을 가져올 수 있음을 시사합니다. 이 결과는 또한 외부 지침 없이 개선을 주장하는 것을 제한합니다. 보고된 가장 높은 GenEval2 점수는 외부 비평가를 사용했습니다.
UniEvo-VL은 시각적 비평을 노이즈 제거 감독(denoising supervision)으로 변환하기 위한 구체적인 훈련 레시피로 이해하는 것이 가장 좋습니다. 이의 핵심 기여는 단순히 더 나은 두 번째 이미지를 생성하는 것에 그치지 않고, 원래 프롬프트 학생 모델에게 학생이 현재 방문하는 정확한 잠재 공간(latent states)에서 특권화된 교사(privileged teacher)로부터 학습시키는 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기