Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 기사는 다양한 양자화(Quantization) 유형(INT8, MXFP8, FP8 등)의 품질과 속도를 비교 분석한 연구입니다. 특히 INT8 ConvRot 방식이 Rel-RMSE, SNR dB, Cosine Similarity 세 가지 지표 모두에서 가장 우수한 성능을 보여주었습니다. 테스트 결과에 따르면 GGUF Q8 > INT8 ConvRot > MXFP8 > FP8 >= INT8 Row 순으로 양자화 품질의 대략적인 순위를 제시했습니다.
Scenema Audio는 감정적 연기(emotional performance)와 목소리 정체성(voice identity)을 분리하여, 사용자가 원하는 어떤 감정도 특정 목소리로 구현할 수 있는 확산 모델 기반의 음성 생성 시스템입니다. 이 모델은 텍스트-음성 변환(TTS) 파이프라인 대신 확산 모델을 사용하여 매우 자연스럽고 로봇 같지 않은 고품질의 감정 표현을 제공합니다. 또한, Scenema Audio로 생성된 오디오는 A2V(Audio-to-Video) 파이프라인에 입력되어 음성에 맞는 비디오를 만드는 '오디오 우선' 워크플로우 구축에 활용될 수 있습니다. 개발 편의성을 위해 Docker REST API 형태로 제공되며, 향후 ComfyUI 노드 지원도 계획하고 있습니다.
Ostris의 AI-Toolkit이 HiDream O1 모델의 트레이닝 과정을 지원합니다. 사용자는 캐싱 텍스트 임베딩(caching text embeddings)을 비활성화해야 하며, 관련 체크포인트와 ComfyUI 워크플로우가 제공됩니다.
이 글은 Z 이미지 시리즈 생성 과정에서 네거티브 프롬프트를 사용할 수 있도록 NegPip 기능을 구현한 내용을 안내합니다. 사용자는 ComfyUI의 `custom_nodes` 폴더에 특정 GitHub 레포지토리를 클론하여 이 기능을 추가할 수 있으며, 관련 워크플로우 예시도 제공됩니다.
본 게시물은 HiDream-O1 Dev 모델과 Z-Image Base 모델을 다양한 스타일의 이미지 생성 프롬프트로 비교 분석한 결과입니다. 전반적으로 HiDream-O1이 인상적인 성능을 보여주었으나, 특정 스타일에서는 Z-Image가 여전히 우위를 점하는 등 모델별 강점이 명확하게 나타났습니다. 또한 일부 이미지에서 관찰된 아티팩트는 모델 자체의 문제일 수 있으며 향후 버전에서 개선될 것으로 예상됩니다.
본 기술 기사는 입력된 임의의 이미지를 기반으로 캐릭터 LORA를 활용하여 유사한 스타일의 새로운 이미지를 생성할 수 있는 워크플로우를 소개합니다. 이 워크플로우는 ZIT 환경에 최적화되어 빠르며, 다른 모델로도 쉽게 확장 적용이 가능합니다. RTX 4070 Super와 같은 일반적인 하드웨어에서도 매우 빠른 속도로 고품질 이미지 생성이 가능함을 보여줍니다.
이미지 생성 모델인 HiDream-01-Image가 ComfyUI에 공식적으로 지원되기 시작했습니다. 이 업데이트는 사용자들이 새로운 체크포인트와 기능을 활용하여 이미지 생성 워크플로우를 더욱 확장할 수 있게 합니다.
HiDream-Studio v.01이 출시되어 오픈 소스로 공개되었습니다. 이 PySide 앱은 ComfyUI와 비교해도 매우 빠른 추론 속도를 보여주며, 특히 RTX 4090 환경에서 이미지당 약 20초라는 준수한 성능을 자랑합니다. 사용자는 GitHub를 통해 쉽게 코드를 클론하고 설치 스크립트를 실행하여 사용할 수 있습니다.
OSTRIS가 AI Toolkit에서 HiDream-O1 LoRA를 사용하여 첫 테스트를 진행하고 있으며, 이 모델에 대해 큰 기대를 표명했습니다. 작성자는 이 모델이 VAE나 Text Encoder 없이도 매우 효율적인 픽셀 공간을 가지며 빠르게 학습된다는 점을 강조하며, 이를 산업을 변화시킬 혁신으로 평가하고 있습니다.
LipDub은 LTX를 기반으로 구축된 새로운 오픈 소스 립싱크 기능의 베타 버전입니다. 이 도구는 기존 비디오에 새 음성을 재생성하고 입 움직임을 단일 패스로 대체하며, 화자의 외모와 목소리 정체성은 유지합니다. 사용자는 이를 통해 다른 언어로 더빙하거나 원본 대화를 재구성하는 등 다양한 창작 작업을 수행할 수 있습니다.
이 기술 기사는 애니메이션 이미지 자동 태그 지정용 Vision Transformer (ViT) 모델의 개발 과정을 설명합니다. 데이터셋 개선을 위해 기존 데이터를 수정하고 누락된 태그를 보강했으며, 저빈도 태그 식별을 위한 기준선 모델도 훈련했습니다. 현재 V1 모델은 320x320 해상도로 운영되고 있으며, 더 높은 해상도의 V1.1 버전이 개발 중이며 향후에는 개선된 어휘 구조와 대규모 데이터셋으로 재훈련할 계획입니다.
IMG Dataset Refiner v4.0 Pro는 단순한 선택 도구를 넘어, AI 모델 학습을 위한 포괄적인 데스크톱 데이터 엔지니어링 스위트로 업그레이드되었습니다. 이 버전은 로컬 VLM/LLM 통합 기능을 통해 이미지 자동 캡셔닝, 컨셉 아이솔레이션 등 고급 태깅 작업을 지원하며, 사용자가 원하는 언어로 쉽게 데이터를 준비할 수 있도록 실시간 번역 및 대량 배치 편집 기능도 제공합니다. 또한, 시각적 중복 탐지, 논리적 모순 검사 등의 전처리 기능을 통해 고품질의 학습 데이터셋 구축을 돕습니다.
이 기술 기사는 flux.2 klein 9b 모델을 위한 'Flux Identity Adjustor Node'를 소개하며, 포토리얼리즘과 일관된 아이덴티티 유지라는 두 가지 목표를 달성하기 위해 개발되었습니다. 이 노드는 입력 참조 이미지와 프롬프트 간의 균형을 맞추어, 창의적인 결과물 속에서도 특정 피사체의 정체성을 안정적으로 유지하도록 돕습니다. 저자는 제한적인 VRAM 환경에서 테스트를 진행했으며, 관련 코드를 GitHub에 공개했습니다.
본 기술 기사는 ComfyUI 환경에서 Wan 2.2의 이미지-투-비디오(I2V) 기능과 LTX 2.3 ID-LoRA를 결합한 고급 워크플로우를 소개합니다. 이 워크플로우는 먼저 Wan 2.2로 초기 비디오 클립을 생성하고, 이후 LTX 2.3을 활용하여 해당 비디오에 오디오(예: 파손 소리)를 추가하며, ID-LoRA를 통해 특정 인물의 실제 목소리를 자연스럽게 입히면서 콘텐츠를 확장하는 과정을 설명합니다.
본 기술 기사는 LTXV 2.3을 활용하여 비디오 인페인팅(inpainting)의 실제 산업 적용 가능성을 탐구한 R&D 결과를 요약합니다. 필자는 TV 광고, 영화 등 미디어 콘텐츠 제작에 필수적인 인페인팅 작업을 위해 여러 워크플로우를 테스트했으나, 현재까지 어떤 방법도 시공간적 일관성(spatiotemporal consistency)과 정밀도가 요구되는 전문적인 작업 환경에서 안정적으로 작동하지 않는다는 결론을 내립니다. 특히 참조 프레임 근처에서의 깜빡거림(flickering) 및 원본 비디오와의 불일치(mismatch) 문제가 지속적으로 발생하며, 현재의 도구들은 현업 워크플로우에 통합하기에는 한계가 명확합니다.
HiDream-O1-Image는 외부 VAE나 분리된 텍스트 인코더 없이 원시 픽셀에 직접 접근하는 통합 트랜스포머(UiT)를 기반으로 구축된 네이티브 이미지 생성 파운데이션 모델입니다. 이 모델은 단일 아키텍처 내에서 텍스트-이미지 생성, 이미지 편집, 개인화 등 다양한 작업을 지원하며, 최대 2048x2048 해상도까지 직접 합성할 수 있습니다. 특히 8B라는 비교적 작은 규모임에도 불구하고 높은 효율성과 범용성을 자랑합니다.
Flux.2Klein은 캐릭터를 1:1 비율로 전송하는 능력을 가진 오픈 소스 이미지 편집 모델입니다. 현재 개발자는 이 기능을 바탕으로 더욱 유연한 편집 시스템을 구축하고 있으며, 특히 'ImageScaleToTotalPixels'라는 기술을 활용하여 확대 시 미묘한 변화까지 포착할 수 있는 높은 잠재력을 보여주고 있습니다.
이 기술 기사는 19세기 아카데미 미술가 장-레옹 제롬(Jean-Léon Gérôme)의 독특한 시각적 스타일을 포착하기 위해 LoRA를 훈련시킨 과정을 설명합니다. 저자는 그의 작품이 단순히 주제나 동양화에 국한된 것이 아니라, 인물 배치, 의상, 건축 공간, 빛 등을 정밀하게 조직하여 안정적이면서도 긴장감 넘치는 '완전한 시각 시스템'을 구축하는 방식에 초점을 맞췄습니다. 이 목표를 달성하기 위해 3번의 반복적인 훈련 라운드를 거쳤으며, 특히 세 번째 라운드에서 색소 및 객체 기반 앵커를 강화하여 모델이 재료와 공간 구조 간의 명시적 관계를 학습하도록 개선했습니다.
본 기술 기사는 Flux.2-Klein-4B 모델을 기반으로 구축된 파이프라인을 소개하며, 단일 RTX5090 GPU에서 낮은 지연 시간(약 0.2초)으로 실시간 웹캠 비디오 스트림 처리를 가능하게 합니다. 이 시스템은 커스텀 KV-cache를 활용하여 움직이는 영역의 토큰만 재계산하고, RIFE 모델을 이용한 프레임 보간(Interpolation) 기능을 통해 최대 4배까지 FPS를 높일 수 있습니다. 결과적으로 정적 장면에서는 최대 50 FPS, 역동적인 장면에서도 높은 처리 속도를 유지합니다.
본 기사는 LTX-2.3 모델의 PolarQuant Q5 양자화 버전을 소개하며, 이 버전은 크기를 88% 줄이고 손실률을 거의 없이 유지하는 것이 특징입니다. 관련 링크를 통해 사용자들이 해당 모델과 기술에 접근할 수 있도록 안내하고 있습니다. 다만, 추론 시 완전한 압축 해제가 필요하다면 실용성이 떨어질 수 있다는 의견도 제시되었습니다.