
자연어로부터 편집 가능한 동영상을 생성하기: Timeline Studio Agent Skill의 설계와 메커니즘
요약
Timeline Studio Agent Skill은 단순한 동영상 생성을 넘어, 소재 분석부터 편집 계획 수립, 자막/음성 생성까지 전 과정을 워크플로우로 처리하는 에이전트 스킬입니다. 사용자는 최종 목적을 전달하면, 이 스킬이 요구사항을 분해하여 완성된 영상과 함께 재편집 가능한 `.timeline` 프로젝트를 출력합니다.
핵심 포인트
- 최종 목표 기반의 편집 워크플로우 제공
- 완성 동영상 외에 재편집 가능한 프로젝트 파일(.timeline) 출력
- 소재 분석, 편집 계획 수립 등 복잡한 과정을 자동화
- 선언적인 커맨드 플랜(Command Plan)을 통해 편집 내용을 추적 및 관리
하나의 지시로부터 소재 분석, 편집 계획, 자막·음성 생성, 타임라인 편집, 품질 검증까지 실행하여, 완성된 동영상과 재편집 가능한 프로젝트를 동시에 출력합니다.
참조 동영상의 재현, 제품 프로모션, 다국어 로컬라이제이션 (Localization), 스토리형 광고, 과학 해설 동영상 등의 사례를 공개하고 있습니다. 각 케이스에는 가능한 범위 내에서 프롬프트, 완성 동영상, 편집 판단, 재편집 가능한 .timeline 프로젝트를 포함하고 있습니다.
브라우저 동영상 에디터, Agent Skill, 타임라인 조작 프로토콜, 로컬 AI 기능, 빌드·배포 설정을 공개합니다.
npx skills add MartinDelophy/ai-video-editor \--skill edit-timeline-studio
생성형 AI (Generative AI)를 사용하면 문장, 이미지, 음성, 자막을 개별적으로 만드는 것은 쉬워졌습니다. 하지만 한 편의 동영상을 완성하기 위해서는 소재 정리, 컷 선택, 구성 설계, 나레이션, 자막 동기화, BGM, 내보내기, 품질 확인 등 많은 작업이 남아 있습니다.
Timeline Studio의 edit-timeline-studio Skill은 이것들을 하나의 실행 가능한 워크플로우 (Workflow)로서 Agent에게 제공합니다. 목적은 동영상 파일만을 생성하는 것이 아니라, 인간이 나중에 편집할 수 있는 .timeline 프로젝트도 남기는 것입니다.
사용자는 편집 소프트웨어의 조작 절차가 아닌, 최종 목적을 전달합니다.
"제품 데모 소재를 사용하여 약 40초 길이의 세로형 프로모션 동영상을 제작해 주세요. 실제 조작 화면을 남기고, 일본어 나레이션과 자막을 추가하여 동영상과 편집 가능한 프로젝트를 출력해 주세요."
Skill은 요구사항을 다음 처리 단계로 분해합니다.
- 소재를 검사한다
- 동영상, 음성, 텍스트를 분석한다
- 편집 방침을 결정한다
- 선언적인 편집 계획을 만든다
- 타임라인을 변경한다
- 자막, 음성, 이펙트 (Effect)를 생성한다
- 프로젝트와 완성 동영상을 검증한다
자연어에 의한 요구
↓
소재 분석 → 편집 판단 → 편집 플랜
...
Skill은 단순한 프롬프트 템플릿 (Prompt Template)이 아닙니다. "무엇을 실행할 것인가"뿐만 아니라, "무엇을 검사할 것인가", "어떤 상태라면 완료라고 판단할 수 있는가"까지 정의하고 있습니다.
자동 편집에서 자주 발생하는 문제는 소재의 의미를 이해하기 전에 컷을 시작하는 것입니다. 무음 구간이라도 제품의 결과를 보여주는 장면, 인물의 표정, 동작 전의 정적일 가능성이 있습니다.
Timeline Studio Skill에서는 필요에 따라 다음 정보를 조사합니다.
- 동영상의 길이, 해상도, 프레임 레이트 (Frame Rate)
- 음성 트랙의 유무
- 음성 인식 결과와 OCR 텍스트
- 샷 (Shot)의 전환
- 주요 피사체의 위치, 크기, 움직임
- 음성 에너지의 변화
- 영상의 명료도
분석 결과로부터 소재의 각 구간에 대한 판단 기록을 작성합니다.
{
"assetId": "product-demo",
"sourceStart": 12.8,
...
이를 통해 컷, 단축, 재배열의 이유를 추적할 수 있습니다.
분석 후, Agent는 편집 내용을 선언적인 커맨드 플랜 (Command Plan)으로 변환합니다. 화면 좌표가 아닌 프로젝트 ID, 트랙 ID, 클립 ID를 사용하여 대상을 지정합니다.
npm run agent -- project.inspect /path/to/project.timeline
npm run agent -- project.diff /path/to/edit-plan.json
npm run agent -- project.run /path/to/edit-plan.json
project.inspect : 프로젝트, 트랙, 클립, 자막을 확인 -
project.diff : 파일을 수정하지 않고 변경 내용을 검증 -
project.run : 검증된 편집 계획을 실행
편집 플랜의 간략한 예시입니다.
{
"version": 1,
"projectRevision": 8,
...
동영상 편집 자동화에서는 동일한 처리의 중복 실행이나, 중간까지만 적용된 불완전한 프로젝트가 문제가 됩니다. 따라서 커맨드 계층에는 다음과 같은 메커니즘이 있습니다.
- 리비전 확인 (Revision Check): 플랜 작성 후에 프로젝트가 변경되어 있다면, 오래된 플랜을 거부함 -
- 트랜잭션 (Transaction): 하나의 사용자 의도에 포함된 변경 사항을 한꺼번에 실행함 -
- 멱등성 (Idempotency): 동일한
operationId
가 재전송되어도 소재나 자막을 중복 추가하지 않음 -
차분 확인 (Diff Check): project.diff
에서 실행 전에 변경 내용을 확인합니다.
이것들은 데모용 Agent에서 실제 운용 가능한 Agent로 이행하기 위한 중요한 요소입니다.
Timeline Studio는 모든 기능을 무리하게 헤드리스 API (Headless API)화 하지 않았습니다.
| 경로 | 주요 용도 |
|---|---|
| 커맨드 계층 (Command Layer) | 프로젝트 분석, 소재 로드, 시간 조정, 자막 변경, 클립 조작 |
| 브라우저 편집 (Browser Editing) | AI 음성, 자막 생성, 복잡한 이펙트 (Effect), 아바타, 최종 프리뷰 |
안정적인 조작은 커맨드 계층에서 실행하고, 아직 커맨드화되지 않은 기능은 브라우저 에디터에서 처리합니다. 그 후, 프로젝트를 다시 열어 타임라인과 내보내기(Export) 결과를 검증합니다.
많은 AI 영상 서비스는 최종적인 MP4만을 출력합니다. 하지만 MP4만으로는 자막의 시간을 변경하거나, 하나의 컷만을 교체하는 것이 어렵습니다.
Timeline Studio에서는 .timeline을 편집의 중심으로 두고 있습니다.
project.timeline
├── project.json
└── media/
...
프로젝트에는 메인 영상, 픽처 인 픽처 (Picture-in-Picture), 자막, 나레이션, 원본 음성, BGM, 마스크 (Mask), 필터 (Filter), 애니메이션 (Animation), 소재와 원본 시간의 대응 관계를 저장할 수 있습니다.
Agent가 초안을 만들고, 그 후에는 인간이 일반적인 타임라인에서 세부 사항을 조정할 수 있습니다.
Timeline Studio Skill에서는 다음 규칙을 채택하고 있습니다.
자막을 활성화한 경우, 표시되는 각 자막은 표시 구간 전체에 걸쳐 실제로 들리는 음성과 대응해야 한다.
원본 영상에 발화가 있는 경우, 그 음성에 자막을 연관시킵니다. Agent가 새로 추가한 설명문에는 대응하는 나레이션을 생성합니다.
{
"captionId": "caption-result",
"audioClipId": "voice-result",
...
내보내기 전에는 자막 구간, 음성의 유무, 중복 나레이션, 음량 차이, 좌우 채널의 어긋남 등도 확인합니다.
Timeline Studio는 로컬 퍼스트 (Local-first) 구성을 채택하고 있습니다. WebGPU, ONNX Runtime Web, Web Worker, WebCodecs 등을 이용하여 대응하는 처리를 브라우저 내에서 실행합니다.
주요 기능은 다음과 같습니다.
- Whisper Small Q8 ONNX를 통한 자동 자막
- Piper/VITS를 통한 중국어 음성
- Kokoro를 통한 영어 음성
- Stable Audio 3 Small Q4 ONNX를 통한 음악 생성
- YOLOS Tiny를 통한 피사체 검출
- MODNet을 통한 인물 누끼 (Segmentation)
- MI-GAN을 통한 불필요 요소 제거
- NanoVSR를 통한 고해상도화 (Super-resolution)
- 음성과 반주 분리
- JoyVASA와 LivePortrait를 통한 디지털 휴먼
모델은 필요할 때 다운로드하여 브라우저 캐시에 저장합니다. Hugging Face와 ModelScope의 고정 버전 미러 (Mirror)를 이용할 수 있으며, 가능한 한 공통의 캐시 ID를 사용합니다.
완전한 편집 태스크에서는 다음 두 가지를 출력합니다.
output/
├── result.mp4
└── result.timeline
나아가 다음 항목을 검증합니다.
- 메인 영상이 연속적인가
- 클립의 순서와 길이가 올바른가
- 자막과 음성이 대응하는가
- 오버레이 (Overlay)의 표시 시간이 올바른가
.timeline을 다시 열 수 있는가- 영상을 끝까지 디코딩할 수 있는가
- 오디오 트랙이 존재하는가
- 무음, 마지막 프레임의 중복, 경계 정지(Boundary stall)가 없는가
완성된 영상과 편집 프로젝트를 모두 확인할 수 있을 때 비로소 태스크 완료로 판단합니다.
브라우저 에디터는 멀티 트랙 편집, AI 자막, 음성, 음악, 각종 영상 처리에 대응합니다.
한편, 커맨드 계층의 렌더링은 현재 Visuals, Voiceover, Music 등 대응이 완료된 이식 가능한 서브셋 (Subset)이 중심입니다. 복잡한 오버레이, 이펙트, AI 생성, 완전한 합성(Compositing)은 브라우저 편집 경로를 이용할 수 있습니다.
현재의 구성은 다음과 같이 표현할 수 있습니다.
안정적인 커맨드 계층 + 브라우저 호환 레이어
미구현 기능을 완전한 헤드리스 API로 취급하지 않고, 대응 범위를 단계적으로 확장하고 있습니다.
Timeline Studio Skill의 목적은 Agent가 동영상 편집 화면을 기계적으로 조작하게 만드는 것이 아닙니다.
소재를 이해하고, 편집 판단을 기록하며, 안전하게 타임라인 (Timeline)을 변경하고, 결과를 검증하기 위한 영상 제작 프로토콜을 구축하는 것입니다.
주요 요소는 다음과 같습니다.
- 멀티모달 (Multimodal) 소재 분석
- 콘텐츠별 편집 워크플로우 (Workflow)
- 선언적 타임라인 조작
- 리비전 (Revision), 트랜잭션 (Transaction), 멱등성 (Idempotency)
- 브라우저 내 로컬 AI
- 이식 가능한
.timeline - 완성된 영상과 편집 과정의 이중 검증
AI는 편집의 주도권을 빼앗는 것이 아니라, 소재 정리, 자막, 음성, 타임라인 조작, 확인 작업 등의 반복적인 작업을 줄여줍니다.
작례 및 재현 가능한 프로젝트:
설치, 소스 코드, 배포:
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기