비터블(Beckett)의 외모를 활용한 새로운 RefMod 유사성 '돌파구'가 H3 비디오 품질을 저하시키는 문제
요약
본 기사는 RefMod 유사성 기능이 H3 비디오 생성 모델의 전반적인 품질을 저하시키는 문제를 심층적으로 분석합니다. 개발자들이 주장하는 번짐 현상 해결책이 실제로는 레퍼런스 이미지를 개별 프레임처럼 처리하고 거칠게 샘플링하는 투박한 접근 방식임을 밝히고, 이로 인해 비디오가 과도하게 샤프닝되고 플라스틱 피부처럼 보이는 품질 저하가 발생함을 지적합니다.
핵심 포인트
- RefMod 기능이 H3 모델의 기본 품질을 심각하게 저하시킴.
- 개발사 주장의 번짐 해결책은 근본적으로 부적절한 샘플링 방식임.
- 사용 제한(이미지/비디오/오디오)을 초과하여 RefMod를 사용하면 치명적인 결과 발생.
- H3 모델의 디노이징 궤적 및 샘플링 과정을 깊이 분석할 필요가 있음.
위의 TL;DR 영상은 두 개의 레퍼런스(베케트의 정확한 외모를 강화하는 것 하나와 하이힐 사진, 2x2 그리드 이미지)를 사용하여 '클래식 Ref Mode'에서 RefMod를 포기하고 생성된 것입니다:
네이티브 해상도 1344x768 (0.98 메가픽셀)
15초 분량
표준 H3 시그마 (shift_video/shift_audio of 12:3)
seeds_2 (H3에 대한 내부 호출 2N-1)와 베타 스케줄러(.6, .6) 사용
Spectrum을 사용하여 약간의 정밀도 손실을 감수하고 내부 호출 수를 줄임.
총 생성 시간은 35분입니다.
이것은 눈에 잘 띄지 않는 문제입니다. 대부분의 사람들이 H3를 정상적으로 사용할 수 없기 때문이며, 터보 LoRA는 속도를 위해 기본 모델을 혹사시키므로, 대부분의 사용자는 이미 시그마가 크게 이동(네이티브 대비 6으로 이동)했기 때문에 눈에 띄는 품질 저하가 거의 없습니다.
어제 저는 갑자기 제 비디오들이 과도하게 샤프닝되고, 채도가 높고, 플라스틱 피부처럼 보이는 이유를 알아내려고 매우 심도 있는 실험을 했습니다. 몇 일 전만 해도 그 비디오들은 기반이 된 쇼처럼 생생한 모습이었거든요.
저는 샘플링과 스케줄링이 어떻게 작동하는지, Minimax H3의 디노이징 궤적이 어떤지 더 깊이 파고들었고, 마지막으로 사용했을 때 제가 잊어버린 무언가를 발견할 수 있기를 바랐습니다. 그러다가 문득 RefMod가 제가 가장 최근에 설치한 것이라는 사실을 떠올렸습니다. 저는 모두가 그랬던 것처럼 초기 유사성 개선 기능에 매료되었지만, 그 대가가 너무 높았습니다.
저는 멋진 새 장난감인 RefMod를 얻었고, 이의 개발자들은 캐릭터 레퍼런스 간의 번짐 현상(bleeding)을 해결했다고 주장했습니다. 심지어 작은 해상도(.245 mpx)에서도 뭉개지지 않고 얼굴이 식별될 수 있었기 때문에 이것이 첫 번째 경고 신호였어야 합니다. 이 기능은 기본 H3 모델의 품질을 정말 망가뜨립니다. 제가 더 깊이 조사해 보니, 근본적으로는 레퍼런스 이미지를 비디오 레퍼런스로 개별 프레임처럼 욱여넣고, 비디오를 순차적으로 거칠게 샘플링하는 매우 투박한 접근 방식입니다.
하지만 문서에 따르면 이 방식은 허용되지 않습니다:
이미지: ≤ 9개 이미지
비디오: ≤ 3 클립; 각 클립은 2–15초여야 하며, 총 길이는 ≤ 15초입니다.
오디오: ≤ 3 클립; 각 클립은 2–15초여야 하며, 총 길이는 ≤ 15초입니다.
혼합 입력: 모든 입력 유형에 걸친 파일의 최대 개수는 12개입니다.
프롬프트에서 네 개의 RefMod를 사용하려고 하는 순간, 이미 한 번에 허용되는 최대 개수보다 하나를 더 사용하려는 것입니다. 이는 이미지 품질에 치명적인 결과를 초래하는데, 왜냐하면 그렇게
AI 자동 생성 콘텐츠
본 콘텐츠는 r/StableDiffusion의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기