
Minimax H3 - Latents as reference
요약
Minimax H3 ref2va 모델이 참조 이미지를 해석할 때 문자 그대로인 경향을 보일 수 있습니다. 이를 개선하기 위해 이미지 대신 잠재 공간(latent)과 노이즈를 사용하여 참조하면, 구성은 유지하면서도 더 많은 다양성과 창의성을 얻을 수 있습니다.
핵심 포인트
- 잠재 공간 사용 시 참조 이미지보다 높은 자유도를 확보할 수 있음.
- 노이즈 추가는 모델이 원래 개념 근처에서 더 넓게 탐색하도록 돕는다.
- 커스텀 노드를 활용하여 잠재 공간 입력을 연결하는 것이 핵심 기술임.
Flux2 Klein처럼, 저는 Minimax H3 ref2va 모델이 참조 이미지를 해석할 때 매우 문자 그대로(literal)라는 것을 발견했습니다. 가끔은 좋지만, 단순히 "비슷하지만 완전히 같지는 않은" 무언가를 원할 때는 좌절스러울 수 있습니다. 이를 완화하기 위해 이미지 대신 잠재 공간(latent)을 사용하고 노이즈를 추가하는 것이 참조 이미지에서 더 많은 다양성을 얻는 좋은 방법입니다. 복잡한 프롬프팅에 의존할 필요가 없기 때문입니다 (물론 그것도 작동합니다). 예시로, 이 글의 목적과는 완전히 다른 용도로 만든 간단한 블록 렌더링을 보여드리겠습니다. Blender 렌더를 보세요. 이것을 참조 이미지로 사용했을 때 어떤 일이 일어나는지 프롬프트와 함께 보겠습니다: integrated_multimodal_description: Scene: Use <Picture 1> ONLY as a compoisition reference for the scene: cinematic footage of an ancient greek temple. [Shot 1] the camera slowly pans right along the columns. people in colorful togas are seen walking up and down the stairs non_diegetic_music: N/A Image as ref 원본과 크게 다르지 않습니다. 잠재 공간으로 공급했을 때 어떤 일이 일어나는지 봅시다. Latent 1.0 as reference 잠재 강도(Latent strength): 1.0 음, 큰 차이가 없습니다. 노드(original)가 이미지를 잠재 공간으로 변환한다는 점을 고려하면 놀랍지는 않습니다. 만약 노이즈를 추가한다면 어떨까요? Latent strength 0.38 이 정도 강도에서는 여전히 매우 블록 같지만, 적어도 약간의 창의성이 보입니다. 우리는 잠재 공간 더 깊은 곳으로 가야 합니다. Strength 0.35 여기서 상당히 좋은 지점을 찾았다고 생각합니다. 구성(composition)을 유지하면서도 질감(texture)을 믿을 만한 무언가로 변경했습니다. 잠재 강도는 0.35이지만, 프롬프트, 샘플러(sampler), loras 등에 따라 다를 것입니다. 우리가 원하는 바에 따라 적거나 많은 준수도를 얻기 위해 이 값 주변의 분수들을 탐색할 수 있습니다. 하락 폭은 보통 상당히 급격합니다. 더 낮춰서 어떤 일이 일어나는지 봅시다. https://preview.redd.it/8bksd34blqph1.png?width=960&format=png&auto=webp&s=4c9ef670e67188297589c53980a0ef24417f5f2f At 0.25.
여전히 참조 건물(reference building)의 구조를 닮아 있지만, 구성 면에서 더 많은 자유도를 가지기 시작했고, 프롬프트에 대한 자체적인 해석에 더 가까워졌습니다. (스포일러: 참조를 제거해도 비슷한 결과가 나옵니다.) 이제 핵심 내용을 알려드리겠습니다. 어떻게 만들었을까요? 안타깝게도 답은 '커스텀 노드(custom node)'입니다. 왜냐하면 잠재 공간 입력(latent input)이 네이티브하게 지원되지 않기 때문입니다. 저는 일반적인 ComfyUI 노드를 가져와서 여기에 잠재 공간 입력을 추가했습니다. 이게 왜 작동할까요? 일반 이미지에 대한 노이즈는 그저 보이는 노이즈일 뿐입니다. 하지만 잠재 공간의 노이즈는 자유도입니다. 이는 모델이 원래 개념 근처의 개념들을 더 자유롭게 탐색하도록 허용합니다. 수정된 참조 노드(Modified reference node)가 바로 제가 잠재 공간을 연결한 방식입니다. 그리고 빈 잠재 공간(empty latent)은 모두 노이즈이기 때문에, 이것을 원본과 블렌딩하면 샘플러(sampler)에게 더 많은 자유도를 줄 수 있습니다 (이는 Flux2 Klein의 '잠재 공간 참조(latent as reference)'와도 아주 잘 작동합니다). https://preview.redd.it/rjc4jslklqph1.png?width=1095&format=png&auto=webp&s=f735d5358db6d8a9062510f7f922a1101d8385eb 제가 주로 워크플로우를 보여주고 싶었을 뿐, 커스텀 노드를 판매하려는 의도는 아니었지만, 혹시 누군가 이 결과를 재현하고 싶어 할 것을 알기에 해당 노드들을 GitHub 저장소에 공개했습니다. https://github.com/neph1/comfyui-minimaxh3-condition-latent 이미지-대-비디오(image to video)의 경우 (노드가) 일반 이미지를 컨디셔닝으로 전달하기 때문에 작동하지 않습니다. 하지만 'Add guide' 노드를 사용하실 수 있습니다. /u/neph1010 님이 제출했습니다. [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/StableDiffusion의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기