Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LTX Director를 활용하여 단순한 이미지 흔들림을 넘어, 여러 장의 이미지를 키 포즈로 사용하는 연출된 로컬 I2V(Image-to-Video) 워크플로우를 소개합니다. 동일한 캐릭터의 다양한 각도 이미지를 타임라인에 배치함으로써 카메라 움직임, 포즈 변화, 오디오 싱크가 포함된 역동적인 비디오 생성이 가능합니다.
Anima Base 1.0, Flux.2 Klein 9b, Wan 2.2 모델을 결합하여 이미지 생성 및 편집을 수행하는 워크플로우를 소개합니다. 제공된 링크를 통해 실제 작업 결과물을 확인할 수 있습니다.
본 문서는 Flux Klein, Qwen, Wan 모델을 사용하여 이미지를 프롬프트하는 최적의 방법을 안내합니다. 이 모델들은 계층적 구조를 이해하도록 학습되었으므로, 프롬프트를 섹션별로 나누고 각 개념을 개별 줄에 작성하는 것이 효과적입니다. 이렇게 하면 복잡한 이미지 구성 요소(개념, 피사체, 의상, 포즈 등)를 체계적으로 정의하고, 생성된 이미지를 위한 프롬프트 수정 및 편집이 용이해집니다.
작성자는 LTX 2.3 및 Wan 2.1 같은 오픈 소스 모델을 활용하여 자체 클러스터(GPU 4개 보유 및 필요시 대여)에서 AI 비디오 생성 사이트인 loremotion.com을 구축했습니다. 이 플랫폼은 크레딧이나 구독 제한 없이 Text-to-Video 및 Image-to-Video 기능을 무료로 제공하는 것을 목표로 합니다. 현재 720p/10초 클립의 렌더링 시간은 GPU 성능에 따라 50초에서 110초가 소요되며, 운영비 충당을 위해 광고를 배치했습니다. 다음 개발 계획으로는 Video-to-Video 변환 기능을 추가할 예정입니다.
본 기술 기사는 입력된 임의의 이미지를 기반으로 캐릭터 LORA를 활용하여 유사한 스타일의 새로운 이미지를 생성할 수 있는 워크플로우를 소개합니다. 이 워크플로우는 ZIT 환경에 최적화되어 빠르며, 다른 모델로도 쉽게 확장 적용이 가능합니다. RTX 4070 Super와 같은 일반적인 하드웨어에서도 매우 빠른 속도로 고품질 이미지 생성이 가능함을 보여줍니다.
이미지 생성 모델인 HiDream-01-Image가 ComfyUI에 공식적으로 지원되기 시작했습니다. 이 업데이트는 사용자들이 새로운 체크포인트와 기능을 활용하여 이미지 생성 워크플로우를 더욱 확장할 수 있게 합니다.
HiDream-Studio v.01이 출시되어 오픈 소스로 공개되었습니다. 이 PySide 앱은 ComfyUI와 비교해도 매우 빠른 추론 속도를 보여주며, 특히 RTX 4090 환경에서 이미지당 약 20초라는 준수한 성능을 자랑합니다. 사용자는 GitHub를 통해 쉽게 코드를 클론하고 설치 스크립트를 실행하여 사용할 수 있습니다.
Flux.2Klein은 캐릭터를 1:1 비율로 전송하는 능력을 가진 오픈 소스 이미지 편집 모델입니다. 현재 개발자는 이 기능을 바탕으로 더욱 유연한 편집 시스템을 구축하고 있으며, 특히 'ImageScaleToTotalPixels'라는 기술을 활용하여 확대 시 미묘한 변화까지 포착할 수 있는 높은 잠재력을 보여주고 있습니다.
이 기술 기사는 ComfyUI 환경에서 Flux 2와 Klein Tiling을 활용하여 이미지 업스케일링 워크플로우를 제시합니다. 특히 0.5MP에서 10MP로의 극단적인 예시를 통해 높은 해상도 복원 가능성을 보여주며, Color Anchor 노드와 Steudio tiling 노드를 조합하는 방법을 안내합니다.
본 기술 기사는 'Reference Latent Node'라는 도구의 출시 및 업데이트 소식을 전하고 있습니다. 이 노드는 다양한 이미지에서 특정 요소만 추출하여 원하는 이미지를 생성하는 데 매우 유용하며, VAE 입력과 최대 해상도 제어 기능을 제공합니다. 현재는 GitHub 링크를 통해 사용 가능하며, 지속적인 버그 수정이 이루어지고 있습니다.
LTX Desktop 1.0.5 버전 업데이트는 새로운 기능 추가보다는 커뮤니티 피드백을 바탕으로 광범위한 버그 수정과 기존 기능 개선에 초점을 맞췄습니다. 특히 비디오 편집기 영역에서 Gap fill 작동 복구, Lasso 선택 기능 개선, 속성 표시 오류 수정 등 사용성이 크게 향상되었습니다. 또한, 로컬 생성 제한 해제 및 사용자 경험(UX) 전반의 안정화 작업이 이루어져 전반적인 사용 편의성과 신뢰도가 높아졌습니다.
FLUX.2 Klein Identity Feature Transfer V3는 기존 아이덴티티 트랜스퍼 노드의 사용성을 대폭 개선한 버전으로, 복잡한 내부 구조를 알 필요 없이 누구나 쉽게 사용할 수 있도록 설계되었습니다. 주요 업데이트 사항은 '커밋 시스템(commit system)' 도입으로, 전체 평균화 대신 각 생성 토큰마다 최적의 참조 매칭을 찾아 안정적으로 잠근 후 가벼운 앵커를 유지하여 아이덴티티 보존의 정확도를 높였습니다. 사용자는 프리셋 기반의 간편한 제어 방식과 더불어, 고급 사용자들을 위한 세밀한 블록 및 커밋 관련 파라미터(예: `double_schedule`, `commit_anchor`)를 제공받을 수 있습니다.
이 기술 기사는 인기 있는 드로잉 및 스크리블 스타일을 Flux.2 Klein 9B 및 4B 모델에 적용한 LoRA(Low-Rank Adaptation)를 소개합니다. 이 LoRA는 세 가지 버전으로 제공되며, 각 버전은 특정 드로잉 스타일이나 성능 특화 영역에 초점을 맞추고 있습니다.
본 기술 기사는 'Longcat-Image-Edit'이라는 이미지 편집 모델의 샘플과 평가를 담고 있습니다. 이 모델은 단순 인페인팅부터 참조 이미지를 활용한 고급 편집까지 시연하며, 특히 얼굴 참조 처리 능력에서 높은 잠재력을 보여줍니다. 다만 ControlNet 부재와 다중 참조 이미지 처리의 어려움 등 몇 가지 한계점을 가지고 있어 사용 범위가 제한적일 수 있습니다.
최근 AI 이미지 생성 기술(특히 ZIT 모델)의 발전 속도가 매우 빨라져, 이미지가 현실과 구별하기 어려울 정도로 정교해지고 있습니다. 필자는 이러한 기술적 진보가 악용될 가능성에 대해 경고하며, 특히 노년층 등 취약 계층을 표적으로 삼는 방식으로 사용될 수 있음을 지적합니다.
Sulphur-2와 LTX 2.3 10Eros라는 두 가지 새로운 모델이 출시되었습니다. 이 모델들은 특히 과학적 워크플로우(scientific workflows) 분야에서 기존의 WAN 모델들을 능가하는 성능을 보여줍니다. Sulphur-2는 이미지 투 비디오(I2V) 및 텍스트 투 비디오(T2V) 기능을 모두 지원하며, LTX 2.3 10Eros는 I2V 작업에 특화되어 있어 매우 뛰어난 결과물을 제공합니다.
LongCat Image Edit Turbo는 매우 경량화되었음에도 불구하고 강력한 성능을 제공하는 이미지 편집 모델입니다. 이 모델은 빠른 실행 속도를 자랑하며, 사용자는 일반적인 CLIPTextEncode 대신 TextEncodeQwenImageEdit를 사용하여 워크플로우의 효율성을 높일 수 있습니다. 필요한 경우 UNet만 다운로드하여 QKM5 기준 약 4.7GB 크기로 쉽게 시작할 수 있도록 최적화되었습니다.
LTX 2.3 LoRA 로더는 오디오-비주얼 모델인 LTX-2.3의 강력한 기능을 확장하는 도구입니다. 이 로더는 비디오 생성과 오디오 생성을 담당하는 두 개의 독립적인 가지(비디오 가지, 오디오 가지)를 분리하여 각 LoRA가 시각적 요소와 청각적 요소에 미치는 영향을 개별적으로 스케일링할 수 있게 합니다. 이를 통해 사용자는 특정 로라를 비디오 전용 또는 오디오 전용으로 제어하며, 보다 정교하고 세밀한 콘텐츠 생성이 가능해집니다.
이 기술 기사는 ComfyUI 환경에서 빠르고 고품질의 얼굴 교체(Face Swapping) 워크플로우를 제공합니다. 이 커스텀 노드는 소스와 타겟 이미지로부터 깨끗한 얼굴 크롭과 마스크를 추출하며, InsightFace와 FLUX 모델을 활용하여 일관성 있고 현실적인 결과를 얻도록 설계되었습니다. 후처리 및 비율 헬퍼 기능이 포함되어 있어 사용자가 즉시 최고 수준의 결과물을 만들 수 있습니다.
이 기술 기사는 Anima 모델을 위한 3단계 올인원 LoRA 빌더를 소개합니다. 이 도구는 사용자가 비디오와 캐릭터 참조 이미지를 제공하면, 먼저 YOLO 및 CCIP를 사용하여 배경 인물을 필터링하고 캐릭터별 클립(shots)을 추출합니다. 다음으로, 자동 태그화 기능(WD14 danbooru 태그 및 자연어 캡션)을 통해 이미지 데이터셋을 구축하며, 마지막 단계에서 Anima 전용 트레이너를 이용해 LoRA를 쉽게 훈련할 수 있습니다. 이 빌더는 기존의 복잡하고 분리된 워크플로우를 통합하여 사용 편의성을 극대화했으며, 특히 VRAM 요구 사항을 크게 낮춰 8GB VRAM 환경에서도 전체 프로세스를 실행할 수 있게 만든 것이 주요 특징입니다.