영상 생성 AI의 레퍼런스 클립을 '재현 가능한 지시문'으로 분해하는 절차
요약
영상 레퍼런스 클립에서 생성 AI용 지시문(프롬프트)을 체계적으로 추출하는 절차를 설명합니다. 단순히 '같은 분위기'가 아닌, 관찰 가능한 요소와 제작 의도를 분리하여 편집 가능한 형태로 정리하는 것이 핵심입니다. 이를 위해 피사체 움직임과 카메라 움직임을 별도로 기록하고, 시간 축의 변화 지점까지 상세히 메모하는 방법을 제시합니다.
핵심 포인트
- 관찰(Observation)과 해석(Interpretation)을 반드시 분리해야 합니다.
- 피사체의 움직임과 카메라의 움직임을 각각 명확하게 구분하여 서술하세요.
- 시간 흐름에 따른 주요 이벤트와 변화 지점만 기록하고, 모든 초를 채울 필요는 없습니다.
- 최종적으로 주체-행동, 구도/카메라, 장소/조명 등 역할별로 정리하는 것이 효과적입니다.
영상의 한 장면만 보고도 '같은 분위기로'라고만 적으면, 생성 모델에게 무엇을 남기고 무엇을 변경해야 할지 전달하기 어렵다. 짧은 레퍼런스 클립에서 프롬프트를 만들 때는, 먼저 영상을 관찰 가능한 요소로 나누고, 그 후에 모델용 문장으로 정리하면 체계적으로 정리할 수 있다.
여기서 만드는 것은 원본 프롬프트의 복원물이 아니다. 영상 파일로부터 원래의 지시문을 읽어낼 수는 없으므로, 화면에 보이는 제작상의 선택을 단서 삼아 새로운 편집 가능한 지시문을 구성한다.
먼저, 화면에서 확인할 수 있는 것만 적는다. 인상이나 이야기의 해석은 별도의 칸에 둔다.
| 관찰 가능한 요소 | 해석・연출 아이디어 |
|---|---|
| 인물이 화면 중앙을 뒤쪽에서 앞쪽으로 걸어옴 | 고독감을 강조 |
| ... | |
| 왼쪽은 레퍼런스를 유지하기 위한 재료이고, 오른쪽은 제작자가 선택하는 변경점이다. 양쪽을 섞으면 원본 영상에 없는 움직임이나 물체를 사실처럼 지시하게 된다. 모호한 부분은 '불명', '확인 필요'로 남겨둔다. |
'다가옴', '흐름'과 같은 표현만으로는 피사체가 움직였는지, 카메라가 움직였는지가 모호해진다. 다음 두 가지를 별도로 기록한다.
- 피사체: 무엇이, 어느 방향으로, 어떤 속도로 움직이는지 -
카메라: 고정, 패닝(pan), 틸팅(tilt), 돌리(dolly), 추적 등, 화면이 어떻게 움직이는지
예를 들어 '인물은 일정한 속도로 전진하고, 카메라는 정면을 유지한 채 후퇴한다'라고 쓰면, 두 동작의 관계가 명확해진다. 렌즈 이름이나 전문 용어에 자신이 없다면, 눈으로 보이는 움직임으로 서술하는 것이 좋다.
시작・중간・종료 부근에서 일시 정지하며 주제, 위치, 움직임, 빛의 변화를 메모한다. 이벤트가 바뀔 경우에만 구간을 늘린다.
00:00–00:02 피사체와 장소를 제시. 카메라는 천천히 후퇴.
00:02–00:04 피사체의 움직임은 지속. 배경의 빛이 강해짐.
00:04–00:06 같은 동작을 유지하며 종료. 새로운 움직임은 추가하지 않는다.
이 예시에서는, 보이는 변화와 '변화하지 않는' 부분 모두를 적고 있다. 모든 초에 설명을 채우기보다는, 샷의 요점과 변화 지점만 남기는 것이 나중에 수정하기 더 쉽다.
관찰 메모는 다음 순서로 재배열하면 확인하기 좋다.
- 주체와 행동
- 구도, 거리, 카메라 움직임
- 장소, 색상, 조명, 질감
- 시간 축과 변화 지점
- 필요하다면 소리나 환경음
- 유지하고 싶은 조건, 피하고 싶은 변경 사항
주체・행동: 흰 우주복을 입은 인물이 온실을 일정한 속도로 걷는다.
카메라: 정면에서 같은 거리를 유지하며 후퇴한다.
화면: 청록색 식물, 옅은 안개, 유리 돔.
...
이러한 종류의 서술은 레퍼런스 영상의 요소를 정리하는 예시일 뿐이며, 모든 모델에서 동일한 결과가 나올 것이라고 보장할 수는 없다. 모델마다 받아들이기 쉬운 길이와 구문이 다르므로, 핵심 동작과 시간 축을 남겨 조정해야 한다.
하나의 카메라 이동을 보고 싶은데 짧은 시간에 장면이 여러 번 바뀌는 영상을 사용하면, 어떤 움직임을 지시로 남길지 결정하기 어렵다. 우선 하나의 주체, 하나의 장소, 하나의 카메라 동작이 구분되는 짧은 구간을 선택한다. 영상 사용 권한이 있는지 확인하는 것도 중요하다.
시작・중간・종료에서 같은 주체를 추적할 수 있는지, 카메라 이동과 주체의 이동을 구별할 수 있는지 살펴본 후에 분석을 진행한다. 보이지 않는 글자나 원래의 생성 지시문을 추측하여 채우지 않는다.
레퍼런스 영상으로부터 지시문을 만들 때는, ① 관찰과 해석을 분리하고, ② 피사체와 카메라를 분리하며, ③ 시간 축의 변화 지점을 기록하고, ④ 모델용으로 역할별로 배열하는 순서로 진행한다. 생성된 문장은 완성품이 아니라, 레퍼런스와 대조하여 사람이 편집하기 위한 초안으로 취급해야 한다.
이 절차를 짧은 영상에서 시도할 수 있도록 자작 툴 ShotToPrompt도 공개했다. 15초 이하・25MB까지의 MP4, MOV, WebM을 받아서 관찰 내용을 편집 가능한 프롬프트 안으로 정리해준다. 원본에 숨겨진 프롬프트를 복원하는 것이 아니므로, 출력물의 모호성이나 연출 선택은 사람이 확인해주기를 바란다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기