비싼 영상 편집 SaaS를 사거나, 剪映에서 시간축을 수동으로 맞출 필요 없이 자동화된 쇼츠 제작 파이프라인 완성
요약
Codex와 로컬 오픈소스 TTS만을 활용하여 주제 선정부터 대본 작성, 이미지 생성, 더빙, 자막 합성까지 전 과정을 자동화하는 쇼츠 제작 파이프라인을 구현했습니다. 이 시스템은 원클릭으로 고화질 비디오를 완성하며, 기존의 높은 진입 장벽을 크게 낮춥니다.
핵심 포인트
- Codex와 로컬 오픈소스 TTS로 완전 자동화된 쇼츠 제작 가능
- 주제 선정부터 최종 합성까지 전 과정이 원클릭 워크플로우 구현
- IndexTTS 2.0과 voxcpm2가 가장 자연스러운 음성 클로닝 성능을 보임
- 영상 제작의 한계 비용(边际成本)을 거의 제로에 가깝게 낮춤
몇백 위안짜리(块) 영상 편집 SaaS를 살 필요도 없고,
혹은 剪映에서 시간을 초 단위로 수동으로 맞춰볼 필요도 없습니다. Fengdu 선생님(@fengdu2077)이 오늘 엔드투엔드(end-to-end) 쇼츠 자동화 파이프라인 전체를 완벽하게 구현했습니다. 핵심은 Codex와 로컬 오픈소스 TTS만을 사용한 것입니다.
그가 트윗에 올린 이 완전 자동 완성본을 보면, 음성 질감이 매우 깨끗하고 자연스러워서 AI 느낌이 전혀 나지 않습니다.
주제 선정부터 대본 작성, 자동 분장 설계(分镜), 모델 호출을 통한 배치 이미지 생성,
로컬에서 클론된 목소리로 자동 더빙 및 밀리초 단위 자막 인식,
마지막으로 Codex가 로컬 환경을 자동으로 스케줄링하여 이미지, 음성, 자막을 압축 합성해 고화질 비디오를 완성합니다.
전 과정이 원클릭으로 연결되어 사람이 전혀 개입할 필요가 없습니다.
가장 가치 있는 부분은 그가 모두에게 4가지 주요 오픈소스 음성 클로닝 모델의 실제 성능 계층(梯队)을 테스트해 보여줬다는 것입니다:
IndexTTS 2.0과 voxcpm2가 1티어에 나란히 위치하며, 가장 자연스러운 음성과 높은 클론 유사도를 자랑합니다.
알리(阿里)에서 오픈소스로 공개한 qwen3-tts 1.7B가 그 뒤를 이어 2티어에 배치되었습니다.
반면, 버전 번호만 높아 보이는 IndexTTS 2.5는 실제 사용에서 오히려 성능이 다소 떨어진 모습을 보였습니다.
이 간결한 워크플로우(workflow)가 따라 할 만한 가치가 있는 이유는 쇼츠 제작의 진입 장벽을 바닥까지 낮췄기 때문입니다:
과거에 카드뉴스 형식의 해설 비디오를 하나 만들려면, 대본, 더빙, 이미지 검색, 편집 네 가지 단계에서 각각 다른 소프트웨어 사이를 오가며 반나절을 소비했습니다.
이제 Codex를 만능 스케줄링 총사령관으로 활용하고,
로컬 오픈소스 소모델에게 무료 더빙을 맡기며, 코드 스크립트로 압축 합성을 해결하면,
단일 비디오 제작의 한계 비용(边际成本)이 거의 제로에 가깝게 줄어듭니다.
파이프라인이 한번 구축되면, 남은 작업은 체력을 소모하는 영상 제작이 아니라,
당신의 에너지를 모두 방출하여 매일 가장 흥미를 끄는 주제를 찾는 데 집중하는 것입니다.
이 간결한 아키텍처와 4가지 TTS 모델의 피해야 할 함정(避坑) 디테일까지 한 곳에 정리되어 있습니다. 자전적 미디어(自媒体)나 해외 영상 제작을 하는 분들은 즉시 저장할 것을 추천합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @ayi_ainotes (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기