Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

SCAIL-2.0 모델을 사용하여 비디오와 이미지를 기반으로 포즈를 테스트한 내용을 공유합니다. 이전 워크플로우를 활용하여 틱톡 춤 영상과 호머 이미지를 입력으로 사용했으며, 결과가 유망해 보여 실제 사람에게 적용할 계획입니다.

RTX 5060Ti 같은 일반 소비자급 하드웨어에서 구동하도록 설계된 가볍고 빠른 텍스트-이미지 모델인 sdxs-2b가 소개되었습니다. 이 모델은 대형 모델의 복잡성을 줄이면서도 예술 및 일러스트레이션 분야에서 높은 시각적 품질을 유지하는 것을 목표로 합니다.
본 글은 다양한 이미지 업스케일링 및 복원 모델들을 비교 분석하고 최적의 사용 시나리오를 제시합니다. 단순한 고속 업스케일링에는 real-esrgan, 애니메이션용으로는 waifu gan을 추천하며, 최고 품질의 업스케일링에는 seedVR2 Pros가 적합하다고 설명합니다.

Bernini 비디오 모델의 wan 2.2 업그레이드 버전을 테스트한 결과, LTX 2.3보다 성능이 우수함을 확인했습니다. 이 모델은 기준 이미지를 따라가며 I2V(Image-to-Video)를 수행할 수 있으며, 캐릭터와 소품 움직임 및 비디오 일관성 측면에서 뛰어난 성능을 보여줍니다.
Lightx2v가 Wan2.2-T2V-14B 모델을 위한 NVFP4 Sparse 체크포인트를 출시했습니다. 테스트 결과 480p 및 720p 해상도에서 매우 높은 속도 향상을 보였으나, 모션 품질 면에서는 다소 저하가 관찰되었습니다.
DEMON은 ACEStep 1.5를 기반으로 한 실시간 오디오 생성 엔진으로, StreamDiffusion 아키텍처를 활용해 음악적 노이즈를 오케스트레이션합니다. VAE 증류와 TensorRT 최적화를 통해 악기처럼 실시간 리믹싱이 가능한 수준의 빠른 반응성을 제공합니다.
Meituan에서 출시한 LongCat-Video-Avatar 1.5는 오디오 기반 인간 비디오 생성을 위한 오픈 소스 프레임워크입니다. Whisper-Large 인코더와 DMD2 기반 증류 기술을 통해 자연스러운 입술 움직임과 빠른 추론 속도를 제공합니다.
NVIDIA의 Pixel Diffusion Decoder(PiD)를 사용하여 ZIT 및 Flux-1 모델의 이미지 생성 품질을 테스트한 결과입니다. 512px 생성물과 1024px 다운스케일링 이미지를 비교하여 PiD의 성능을 검증했습니다.
Nvidia가 Wan 모델을 기반으로 한 AnyFlow를 출시했습니다. 이는 플로우 맵을 활용한 최초의 any-step 비디오 확산 프레임워크로, 사용자의 컴퓨팅 예산에 맞춰 타임스텝을 동적으로 조정할 수 있습니다.
Adonis Flux 2 Klein 9B를 위한 새로운 Post 모델이 공개되었습니다. 이 모델은 업스케일 과정에서 발생하는 아티팩트를 제거하고 피부, 머리카락 등 세부 디테일을 정교하게 다듬어 더욱 자연스러운 고해상도 이미지를 생성합니다.
Stability AI가 음악 및 음향 효과(SFX) 생성을 위한 새로운 텍스트-오디오 모델 제품군인 Stable Audio 3를 출시했습니다. 이번 출시에는 Hugging Face를 통해 공개된 세 가지 오픈 웨이트 모델과 추론 및 LoRA 미세 조정을 위한 GitHub 저장소가 포함됩니다.
Kijai가 비디오와 오디오의 완벽한 동기화를 지원하는 LTX2.3 OmniNFT RL-LoRA를 공개했습니다. 이 모델은 사실적인 립싱크와 동작에 맞춘 사운드를 생성하며, 기존 대비 동기화 오류를 52% 감소시킨 것이 특징입니다.
이 글은 'The Moss Sentinel'이라는 제목의 단편 영화 실험에 대한 소개입니다. 이 작품은 교외 뒷마당에 나타난 신비한 터널을 탐험하는 젊은 탐험가를 다루며, 평범한 공간이 미지의 세계로 통하는 관문임을 보여줍니다. 본 작품의 비디오와 음악 생성 과정은 LTX2.3과 ACE-Step-1.5를 사용했으며, 모든 작업은 ComfyUI를 이용해 로컬 PC에서 진행되었고, DaVinci Resolve에서 편집되었습니다.
본 기사는 LTX 2.3 모델을 활용하여 영화 및 비디오 제작에 적용할 수 있는 오픈 소스 LoRA 모음들을 소개합니다. 주요 기능으로는 VFX용 클린 플레이트 생성(Remove Foreground), 다양한 화면 비율 변환(Video Outpainting), 대사 수정(Dubbing) 등이 있습니다. 또한, 오래된 푸티지 복원(DeArchive), 캐릭터 연속성 유지(Character LoRA), 360도 환경 제작(VR Video Outpaint) 등 전문적인 영상 후반 작업에 유용한 다양한 도구들을 제공합니다.
Anima TrainFlow는 복잡한 LoRA 학습 도구들의 진입 장벽과 '탭 피로' 문제를 해결하기 위해 설계된 원페이지 트레이너입니다. 이 도구는 모든 필수 제어 기능을 단일 인터페이스에 통합하여 사용자가 창의적인 결과물에 집중할 수 있도록 돕습니다. 특히 Anima 2B 모델을 위한 최적화된 설정과 Step 기반 학습 시스템을 제공하며, 낮은 VRAM 환경에서도 효율적으로 작동하도록 설계되었습니다.
LTX Director는 LTX 비디오를 쉽게 구성할 수 있도록 설계된 타임라인 에디터입니다. 이 도구는 이미지, 텍스트, 오디오 세그먼트를 추가하고 편집하여 영상의 시간적 흐름을 정밀하게 제어할 수 있게 합니다. Prompt Relay 통합, 커스텀 오디오 지원, 그리고 Image to Video 및 Text to Video 기능을 포함하여 LTX 2.3의 잠재력을 극대화합니다.
이번 주 생성형 AI 분야의 주요 하이라이트는 비디오, 이미지 등 멀티모달 콘텐츠 제작 기술의 발전입니다. CausalCine은 대화형 자기회귀 프레임워크를 통해 긴 비디오 내러티브 생성을 개선했으며, SwiftI2V는 효율적인 2K Image-to-video 기능을 제공합니다. 또한, OmniGen2와 HiDream-O1-Image 같은 통합 모델들이 등장하여 텍스트-이미지 생성 및 편집의 범위를 확장하고 있습니다.
AsymFlow는 고차원 데이터의 저계수 구조를 활용하여 데이터 예측은 전체 차원에서, 노이즈 예측은 저계수 부분 공간에서 수행하는 비대칭 속도 파라미터화 방식을 제안합니다. 이 모델은 기존 네트워크 구조 변경 없이도 높은 성능을 내며, ImageNet 256x256에서 1.57 FID라는 뛰어난 성적을 기록했습니다. 또한 사전 학습된 잠재 흐름 모델을 픽셀 공간 모델로 효과적으로 미세 조정할 수 있는 새로운 경로를 제시합니다.
Ostris의 AI-Toolkit이 HiDream O1 모델의 트레이닝 과정을 지원합니다. 사용자는 캐싱 텍스트 임베딩(caching text embeddings)을 비활성화해야 하며, 관련 체크포인트와 ComfyUI 워크플로우가 제공됩니다.
이 글은 Z 이미지 시리즈 생성 과정에서 네거티브 프롬프트를 사용할 수 있도록 NegPip 기능을 구현한 내용을 안내합니다. 사용자는 ComfyUI의 `custom_nodes` 폴더에 특정 GitHub 레포지토리를 클론하여 이 기능을 추가할 수 있으며, 관련 워크플로우 예시도 제공됩니다.