Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
NeuralCompanion은 개인용 하드웨어에서 작동하는 오픈 소스, 로컬 우선 AI 컴패니언 프로젝트입니다. 이 프로젝트는 실시간 음성 채팅, 로컬 LLM, TTS/STT, 이미지 생성 등 다양한 기능을 하나의 데스크톱 앱에 통합하여 사용자에게 높은 유연성과 해킹 가능성을 제공합니다. 폐쇄적인 기업형 어시스턴트가 아닌, 사용자가 직접 실행하고 수정하며 맞춤화할 수 있는 플랫폼 구축을 목표로 합니다.
Flux.2-Klein 모델은 Qwen의 채팅 템플릿 및 토크나이저를 활용하여 프롬프트를 처리하며, 사용자의 입력을 지시 사항(instruction/message) 형태로 해석합니다. 따라서 단순한 키워드 나열보다는 'A woman sitting on a beach...'와 같이 문장 구조를 갖춘 자연어 서술 방식에 가장 잘 반응합니다. 특히 ComfyUI의 클래식 CLIP 스타일 강조 구문((face:1.4))은 가중치로 적용되지 않으므로 사용하지 않는 것이 좋으며, 대신 주체성을 가진 완전한 문장 형태로 프롬프트를 구성하여 모델이 장면과 동작을 명확하게 이해하도록 유도해야 합니다.
Comfyui-Mesh는 LTX 2.3 Dev 및 distilled 지원 기능을 추가하고, 기존에 발생하던 VRAM 관련 문제를 해결하여 모델 분할 및 전송의 안정성을 높였습니다. 이 업데이트를 통해 Nvenc 코덱을 활용하여 Ethernet 또는 멀티 GPU 환경 간에 모델을 더욱 효율적으로 분할하고 사용할 수 있게 되었습니다.
본 기사는 Flux.2-Klein 기반의 실시간 스트리밍 파이프라인에 대한 주요 업데이트 사항을 소개합니다. 사용자 피드백을 바탕으로 int8 모드 지원, Lora 지원 추가, 그리고 Windows 및 Linux 환경을 위한 자동 설치 스크립트가 제공됩니다. 특히 웹캠과 Spout 입력을 받아 결과를 가상 웹캠이나 Spout으로 스트리밍할 수 있는 GUI 앱이 구현되어 범용성이 크게 향상되었습니다.
이 글은 'The Moss Sentinel'이라는 제목의 단편 영화 실험에 대한 소개입니다. 이 작품은 교외 뒷마당에 나타난 신비한 터널을 탐험하는 젊은 탐험가를 다루며, 평범한 공간이 미지의 세계로 통하는 관문임을 보여줍니다. 본 작품의 비디오와 음악 생성 과정은 LTX2.3과 ACE-Step-1.5를 사용했으며, 모든 작업은 ComfyUI를 이용해 로컬 PC에서 진행되었고, DaVinci Resolve에서 편집되었습니다.
Anima가 diffusers 라이브러리에 통합되는 과정에 있다는 내용을 공유하며, 향후 OneTrainer와 같은 주요 트레이너 지원을 기대하고 있습니다. 동시에, diffusion-pipe의 버케팅 방식과 kohya-SS 기반 독립형 트레이너들의 신뢰성 문제에 대해 우려를 표명하고 있습니다.
본 기술 기사는 Ethernet LAN을 통해 두 개의 GPU에 FLUX 2 모델을 분산하는 커스텀 NVENC 인코더 브릿지 구축 경험을 공유합니다. 이 시스템은 초기에는 Flux 2 Dev 및 Klein 9b를 지원하며, Tailscale과 같은 VPN을 이용해 원격 환경(카페 노트북-집 데스크톱)에서도 테스트가 가능함을 보여줍니다. 또한, 32B 및 70B LLM 모델 분산 버전도 개발하여 출시할 예정입니다.
Pixal3D는 단일 이미지를 입력받아 고충실도의 3D 에셋을 생성하는 모델입니다. 기존 방식이 이미지 특징을 느슨하게 주입했던 것과 달리, Pixal3D는 역투영(back-projection) 기법을 사용하여 픽셀 특징을 3D 공간으로 명시적으로 들어 올려 직접적인 픽셀-3D 대응 관계를 구축합니다. 이를 통해 상세한 기하학적 구조와 PBR 텍스처를 갖춘, 재구성 수준에 근접한 높은 충실도의 결과물을 얻을 수 있습니다.
본 기사는 LTX-2.3 LipDub 워크플로우를 활용한 추가 실험 결과를 공유합니다. 이 테스트는 'The Office'의 Dwight 캐릭터가 워크플로우 기능을 설명하는 모큐멘터리 스타일의 인터뷰 장면을 구현했습니다. 이러한 설정은 고정 카메라, 단일 피사체, 직접 응시, 그리고 실제와 같은 휴지(pause)를 포함하여 이상적인 스트레스 테스트 환경을 제공합니다.
본 기사는 LTX 2.3 모델을 활용하여 영화 및 비디오 제작에 적용할 수 있는 오픈 소스 LoRA 모음들을 소개합니다. 주요 기능으로는 VFX용 클린 플레이트 생성(Remove Foreground), 다양한 화면 비율 변환(Video Outpainting), 대사 수정(Dubbing) 등이 있습니다. 또한, 오래된 푸티지 복원(DeArchive), 캐릭터 연속성 유지(Character LoRA), 360도 환경 제작(VR Video Outpaint) 등 전문적인 영상 후반 작업에 유용한 다양한 도구들을 제공합니다.
이 콘텐츠는 LTX2.3 모델과 특정 LoRA를 활용하여 스타트렉 TNG(The Next Generation) 스타일의 이미지를 생성한 결과물입니다. 해당 LoRA는 StarTrek_TNG_Style이라는 이름으로 Hugging Face에 공유되어 있으며, 이를 통해 사용자는 보다 진지하고 높은 품질의 TNG 콘텐츠 제작을 시도할 수 있습니다.
Qwen-Image-VAE-2.0은 재구성 충실도와 확산 가능성 모두를 개선한 고압축 Variational Autoencoder(VAE)입니다. 이 모델은 Global Skip Connections (GSC), 비대칭 및 Attention-Free 백본, 그리고 의미론적 정렬 전략을 도입하여 압축 병목 현상을 해결하고 효율성을 높였습니다. 특히 대규모 합성 렌더링 학습과 OmniDoc-TokenBench 평가를 통해 OCR이 풍부한 문서 시나리오에서 최첨단 재구성 성능을 입증했습니다.
Anima TrainFlow는 복잡한 LoRA 학습 도구들의 진입 장벽과 '탭 피로' 문제를 해결하기 위해 설계된 원페이지 트레이너입니다. 이 도구는 모든 필수 제어 기능을 단일 인터페이스에 통합하여 사용자가 창의적인 결과물에 집중할 수 있도록 돕습니다. 특히 Anima 2B 모델을 위한 최적화된 설정과 Step 기반 학습 시스템을 제공하며, 낮은 VRAM 환경에서도 효율적으로 작동하도록 설계되었습니다.
LTX Director는 LTX 비디오를 쉽게 구성할 수 있도록 설계된 타임라인 에디터입니다. 이 도구는 이미지, 텍스트, 오디오 세그먼트를 추가하고 편집하여 영상의 시간적 흐름을 정밀하게 제어할 수 있게 합니다. Prompt Relay 통합, 커스텀 오디오 지원, 그리고 Image to Video 및 Text to Video 기능을 포함하여 LTX 2.3의 잠재력을 극대화합니다.
이번 주 생성형 AI 분야의 주요 하이라이트는 비디오, 이미지 등 멀티모달 콘텐츠 제작 기술의 발전입니다. CausalCine은 대화형 자기회귀 프레임워크를 통해 긴 비디오 내러티브 생성을 개선했으며, SwiftI2V는 효율적인 2K Image-to-video 기능을 제공합니다. 또한, OmniGen2와 HiDream-O1-Image 같은 통합 모델들이 등장하여 텍스트-이미지 생성 및 편집의 범위를 확장하고 있습니다.
AsymFlow는 고차원 데이터의 저계수 구조를 활용하여 데이터 예측은 전체 차원에서, 노이즈 예측은 저계수 부분 공간에서 수행하는 비대칭 속도 파라미터화 방식을 제안합니다. 이 모델은 기존 네트워크 구조 변경 없이도 높은 성능을 내며, ImageNet 256x256에서 1.57 FID라는 뛰어난 성적을 기록했습니다. 또한 사전 학습된 잠재 흐름 모델을 픽셀 공간 모델로 효과적으로 미세 조정할 수 있는 새로운 경로를 제시합니다.
본 글은 LTX 2.3 모델의 추론 속도 최적화에 대한 정보를 제공합니다. INT8 가속을 적용하면 기본(Stock) 대비 약 2배 빠른 성능 향상을 확인할 수 있습니다. 이 최적화는 특히 Ampere GPU(예: RTX 3080 Ti) 사용자에게 효과적이며, 워크플로의 모델 로딩 부분만 변경하여 쉽게 적용할 수 있습니다.
본 기사는 Ace-Step 1.5용으로 다양한 개념 슬라이더 LoRA(Slider LoRAs) 컬렉션을 제작하여 공유합니다. 기존 AI Toolkit은 이 기능을 기본 지원하지 않았으나, 코드를 수정하여 특정 데이터셋 없이도 약 10분에서 1시간 내에 컨셉 슬라이더를 학습시킬 수 있는 방법을 구현했습니다. 제공된 슬라이더들은 음성 변환(남성→여성), 사운드 질감 변화(스튜디오→로파이, 디지털→어쿠스틱), 감정/스타일 변화(공격적→부드러움, 행복감) 등 다양한 개념을 다룹니다.
작성자는 LTX 2.3 및 Wan 2.1 같은 오픈 소스 모델을 활용하여 자체 클러스터(GPU 4개 보유 및 필요시 대여)에서 AI 비디오 생성 사이트인 loremotion.com을 구축했습니다. 이 플랫폼은 크레딧이나 구독 제한 없이 Text-to-Video 및 Image-to-Video 기능을 무료로 제공하는 것을 목표로 합니다. 현재 720p/10초 클립의 렌더링 시간은 GPU 성능에 따라 50초에서 110초가 소요되며, 운영비 충당을 위해 광고를 배치했습니다. 다음 개발 계획으로는 Video-to-Video 변환 기능을 추가할 예정입니다.
Stable Diffusion(SD)을 휴대폰에서 완전히 구동할 수 있는 Android 앱이 출시되었습니다. 이 앱은 서버, 계정, 구독, 광고 없이 모델 다운로드 후 오프라인 환경에서도 작동하며, 사용자가 프롬프트 데이터를 기기 외부로 전송할 필요가 없습니다. 다만, 성능과 배터리 소모는 감수해야 합니다. 이미지 생성에 1~5분 정도의 시간이 걸리고, 지속적인 부하로 인해 휴대폰이 뜨거워질 수 있습니다. 따라서 장시간 사용 시에는 전원 연결을 권장합니다.