창의적 통제권은 누가 가질까? LLM을 전체 영화 제작진처럼 벤치마킹하다
요약
본 글은 LLM의 창의적 통제력과 일관성을 영화 제작 과정에 벤치마킹한 연구 내용을 다룹니다. 모델이 시놉시스, 캐릭터, 세트 등 여러 요소를 유지하며 '시대 변경', '예산 삭감' 같은 복합적인 지시를 얼마나 잘 따르는지 테스트합니다. 특히 언급되지 않은 요소까지 일관되게 관리하는 능력을 측정하여 LLM의 실제 창작 역량을 평가합니다.
핵심 포인트
- LLM의 핵심 과제는 단순한 스토리 작성을 넘어 '연속성(continuity)' 유지입니다.
- 모델은 전체 제작진 역할을 수행하며, 여러 제약 조건 하에서 일관된 결과물을 내야 합니다.
- 시대 변경이나 예산 삭감 같은 복합 지시를 받을 때도 모든 요소의 변화 여부를 정확히 파악해야 합니다.
- 단순한 형식 오류보다는 내용 누락이나 뒤섞임이 모델 성능의 주요 감점 요인입니다.
이것은 Kaggle Benchmarking Challenge에 제출하는 내용입니다.
저는 AI 비디오 툴을 다루는데, 계속 오류가 발생하는 부분은 멋진 단일 장면(single shot)이 아닙니다. 바로 '연속성(continuity)'입니다. 캐릭터, 장소, 소품 몇 가지를 정하면, 모델은 세 단계 만에 그중 하나를 조용히 잊어버립니다. 그래서 저는 "어떤 LLM이 최고의 이야기를 쓰는지?" 대신, 영화 제작에서 실제로 중요한 것을 질문했습니다.
감독이 계속 마음을 바꾸는 상황에서도, LLM이 아이디어부터 샷 리스트(shot list)까지 영화에 대한 창의적 통제권을 유지할 수 있을까?
제가 벤치마킹한 내용
각 모델은 한 줄짜리 시놉시스와 몇 가지 엄격한 규칙을 받고, 하나의 대화 속에서 전체 제작진 역할을 수행합니다.
- 작가(Writer): 3막 구성의 트리트먼트 (정확히 N명의 캐릭터, 제한된 수의 장소, 금지 단어 목록, 필수 스토리 요소 1개 포함)
- 캐스팅 디렉터(Casting director): 캐릭터당 한 항목씩 기재
- 프로덕션 디자이너(Production designer): 세트, 소품, 색상 팔레트 지정
- 촬영 감독(Director of photography): 모든 샷이 해당 세트, 캐릭터, 소품을 명시하는 샷 리스트
그런 다음 감독은 세 가지 지시 사항을 순차적으로 전달합니다. 이 중 어느 것도 그 결과에 대한 구체적인 설명은 없습니다.
- 시대 변경(Era shift): "전체 이야기를 1890년대 런던으로 옮기세요." 모든 전화, 노트북, 형광등이 어디서든 사라져야 합니다.
- 예산 삭감(Budget cut): "세트 X를 포기합니다." 해당 세트가 있는 모든 장면은 이동해야 하며, 제작물은 원래보다 하나의 세트를 적게 갖게 되어야 합니다.
- 병합(Merge): "캐릭터 A와 B가 캐릭터 C로 합쳐집니다." 이전 이름 중 어느 것도 살아남을 수 없습니다.
각 지시 사항이 끝날 때마다 모델은 전체 출연진, 세트, 소품 목록을 반환하지만, 오직 변경된 샷만 (실제 변경 요청 방식처럼) 반환합니다. 언급되지 않은 샷들은 건드리지 않고 그대로 유지됩니다. 따라서 모델은 어떤 샷에 지시 사항이 영향을 미치는지 스스로 파악해야 합니다. 하나라도 놓친다면, 이전의 소품이나 캐릭터 이름이 여전히 그곳에 남아있게 됩니다.
총 12개의 영화 아이디어(약국 느와르, 미래의 등대 일지, 은퇴한 박물관 경비원들의 강도 사건 등)가 있으며, 이는 Creative Control A와 B라는 두 개의 Kaggle 과제로 나뉘어 진행됩니다. 각 절반의 점수는 Kaggle 자체 리더보드 점수를 사용하며, 최종 점수는 이들의 평균입니다.
점수 산정 방식. 대부분은 다른 AI가 아닌 순수한 코드로 확인합니다:
| 파트 | 코드가 확인하는 내용 |
|---|---|
| 제약 조건 (Constraints) | 출연진 규모, 세트장 수, 금지 단어, 필수 요소 |
| ... | |
| 한 부분만 적용된 노트는 미적용으로 간주됩니다. 1890년대 빈에서 발견된 노트북은 5%의 문제가 아니라 재촬영(reshoot)입니다. |
제가 일관되게 지킨 두 가지 규칙이 있습니다:
- 형식상의 오류가 창의적인 실패는 아니다. 모델들이 JSON을 주석으로 감싸거나, 필드 이름을 대문자로 쓰거나, 추론 과정을 답변보다 먼저 배치하거나, 따옴표 이스케이프를 잊어버리는 등의 실수는 모두 관대하게 처리했습니다. 오직 누락되거나 내용이 뒤섞인 경우에만 모델의 감점 요인이 됩니다.
- 각 단계는 16,000 토큰 내에서 답변되어야 합니다. 이는 어떤 모델이 제공한 가장 긴 답변보다 약 두 배 많은 양입니다. 스토리 개요를 제출하지 않은 제작진은 통제력을 상실한 것으로 간주됩니다.
테스트된 모델들
저는 여러 연구소의 크고 작은 모델들과 오픈 소스 모델들을 선택하여, 플래그십(flagship) 제품에 비용을 지불하는 것이 창의적 통제권을 보장해 주는지 알아보고자 했습니다.
| 모델 | 전체 점수 | A / B | 감독 노트 | 스토리 품질 |
|---|---|---|---|---|
| GPT-5.5 | 0.94 | 0.96 / 0.92 | 0.94 | 0.85 |
| ... | ||||
| 감독 노트와 스토리 품질은 모델이 완성한 아이디어들을 평균하여 산출되었습니다. Claude Sonnet 5는 하나의 아이디어를, GLM-5는 세 개의 아이디어를 놓쳤고, Claude Opus 5는 여섯 개 중 세 개를 16,000 토큰 제한에 걸렸습니다. 이 모델들은 답변하기 전에 깊이 생각하는 경향이 있어, 시대적 변화(모든 장면을 재작성함)에 대한 사고 과정과 답변을 합치자 공간이 부족해진 것입니다. 전체 Opus 실행은 약 19달러가 소요되어 Kaggle의 일일 모델 예산 10달러로는 한 번의 실행도 불가능했기 때문에, A 절반만 테스트할 수 있었습니다. |
두 절반에 걸친 점수는 대부분의 모델에서 근접하게(0.03 이내) 나타났는데, 이는 점수가 어떤 아이디어를 받았는지 운에 좌우되기보다는 모델 자체를 반영한다는 것을 시사합니다.
두 모델은 평가할 수 없었습니다: Qwen 3 235B와 GPT-OSS 120B. 며칠 동안 이들을 위한 Kaggle의 공유 서비스는 재시도(retries) 및 백오프(backoff)를 사용했음에도 불구하고 대부분의 요청에서 과부하 상태였습니다. 서버 부하로 점수를 매기기보다는 평가 대상에서 제외했습니다.
발견 사항
1. 각본 작성보다 연출 노트(Director's notes)를 따르는 것이 모델들을 훨씬 더 분리합니다
스토리 품질은 세 개의 플래그십 모델을 제외하고 모든 모델에서 0.62에서 0.73 사이에 분포했습니다. 감독의 노트는 0.40에서 0.94까지 다양합니다. 스토리를만 읽으면 대부분의 모델이 비슷해 보입니다. 하지만 수정본(revision)을 주면 차이가 드러납니다.
2. 모든 모델은 자신만의 방식으로 통제력을 잃습니다
-
GPT-5.4 nano는 세계가 이동했다는 사실을 망각합니다. 12편의 영화 중 7편에서 현대 물품들이 "1890년대로 옮기기"에도 살아남았습니다: 1890년대 빈(Vienna)의 노트북, 컴퓨터 및 전화기, 1890년대 노르웨이(Norway)의 GPS, 1890년대 오하이오(Ohio)의 냉장고. 이들 물품은 마지막 노트가 끝난 후에도 6편에서 여전히 존재했습니다.
-
Gemini 3.7 Flash는 이 목록에서 가장 신뢰할 수 있는 모델이었습니다. 반복된 '실패'라고 여겨졌던 부분은 제 실수였습니다 (발견 사항 3 참조).
-
Gemma 4는 시대 변화를 깔끔하게 처리하지만 출연진을 서투르게 다룹니다. 현대 물품을 남겨둔 적은 없었지만, 4편의 영화에서 병합(merge) 과정이 출연진을 잘못 축소시켰습니다.
-
Claude Haiku 4.5는 건드린 장면만 업데이트하고 나머지는 망각합니다. "이 두 캐릭터를 병합한 후", 수정하지 않은 장면에는 여전히 이전 이름들이 남아 있었습니다 (11편 중 5편). 시대 변화 이후, 소품 목록에서는 1890년대를 위한 소품 이름을 변경했지만, 손대지 않은 장면들에서는 이전 이름을 그대로 남겨두었습니다.
-
DeepSeek R1은 Gemini에 근접했으며, 약간의 실수(1890년대 런던의 네온사인, 1890년대 오하이오의 형광등)만 있었습니다.
-
GPT-5.5는 모든 것을 다시 할 때를 압니다. 시대 변화 시에는 세상 전체가 바뀔 때 취할 수 있는 안전한 조치로 모든 장면을 재작성했습니다. 예산 삭감 및 병합 과정에서는 필요한 장면에만 손대었고, 이를 정확하게 수행했습니다. 이것이 바로 스크립트 감독(script supervisor)의 역할이며, 이 때문에 GPT-5.5가 가장 높은 점수를 받았습니다.
플래그십 모델 사용료 지불이 도움이 될까? 이는 실험실(lab)에 따라 다르다. GPT-5.5와 GPT-5.4 nano를 비교했을 때가 가장 큰 도약이다: 디렉터의 노트 점수 0.94 대 0.40이었다. Claude Sonnet 5와 Claude Haiku 4.5는 상대적으로 작은 차이(0.75 대 0.50)였으며, Sonnet의 실제 개선점은 작문 능력이다: 스토리 품질 점수가 0.82 대 0.62였다. Claude Opus 5가 모든 면에서 최고의 스토리를 작성했지만 (완성한 모든 영화에서 완벽한 품질 점수를 기록), 종종 길이 제한 내에서 결과물을 제출하지 못하는 경우가 많았다. 반면, 저렴한 Gemini 3.7 Flash와 오픈 소스 DeepSeek R1은 노트 지침을 따르는 능력 면에서 두 Claude 플래그십 모델보다 우수했다.
3. 규칙들이 서로 모순될 때, 모델들은 어느 편에 섰는가
내가 직접 작성한 개요(brief)에서 실수를 했다. 시작 규칙에는 "2개에서 N개의 세트 사이"라고 되어 있다. 하지만 예산 삭감 노트에서는 "세트를 하나 잃는다"고 한다. 정확히 두 개의 세트로 구성된 영화의 경우, 이 두 가지 지침을 동시에 따를 수 없으므로 모델들이 명확하게 분열되었다:
| 모델 | 원래 규칙 유지 (대체 세트 구축) | 감독 지시 준수 (세트를 하나 줄임) | 충돌 회피 (애초에 세트를 세 개로 설계함) |
|---|---|---|---|
| Gemini 3.7 Flash | 7 | 3 | 2 |
| ... |
Gemini는 "식당 공간을 잃는다"는 지침에 대해 요리사 사무실을 구축했고, "랜턴룸을 잃는다"는 지침에는 폭풍 현관(storm porch)을 만들었다. 즉, 원래 규칙이 승리했고 감독의 절약은 일어나지 않았다. Haiku와 DeepSeek은 항상 가장 최신 노트에 동조했다. 플래그십 모델들은 대부분 애초에 세트를 세 개로 설계함으로써 충돌을 회피했다.
나의 점검 시스템은 "세트를 하나 줄인다"는 선택지만 허용했기 때문에, 규칙을 유지한 모델들에게 불공평하게 페널티를 주었다. 나는 공식 Kaggle 점수는 그대로 사용했지만, 동일한 저장된 실행(saved runs)에 대해 두 가지 선택지 모두를 수용한 점수를 재산정했다: Gemini 3.7 Flash는 0.90에서 0.93으로 상승했고, Gemma 4는 0.84에서 0.87로 상승했으며, 나머지 모델들은 0.01 이하의 변화였고, 순위 변동은 없었다.
4. 모두가 같은 약점을 보인다
Claude Sonnet 5를 제외한 모든 모델에 대해 심사위원들이 가장 흔하게 제기하는 불만은 같았습니다. 바로 '각 캐릭터가 각기 다른 것을 원하며, 그 욕망이 갈등을 만든다'는 설정이 12개 스토리 중 6~9개에서 실패했다는 것입니다. LLM 단편 영화는 하나의 목표를 가진 캐릭터와 반응하기 위해 존재하는 여러 캐릭터들로 구성되는 경향이 있습니다. 이는 스토리 개발에 이 모델들을 사용할 때 알아두면 좋을 점입니다.
5. 출연진이 화면에서 사라지다
자주 발생하는 일관성 오류 중 하나는 단 한 번의 장면에도 등장하지 않는 출연진이 있다는 것이었습니다. 모델은 그 캐릭터를 캐스팅하고, 외모를 묘사한 다음, 촬영하는 것을 잊어버렸습니다.
6. 두 번째 과제: 모델이 영화 촬영 감독처럼 생각할까?
두 번째 과제는 8가지 극적인 순간에 대해 각각 세 가지 방식으로 카메라 연출을 요청하며, 이는 새로운 채팅에서 진행되었습니다:
- 지시형(Instructed): '어느 날 저녁 식사 자리에서 모든 사람이 자신의 비밀을 알고 있다는 것을 한 여성이 깨닫는다. 돌리 줌(dolly zoom)을 사용하라.' 이 기술을 아는가?
- 의도 기반(Intent): '... 붐비는 방에서 갑작스러운 고립감을 관객이 느끼게 하라.' 감정을 카메라 선택으로 바꿀 수 있는가?
- 암시적(Implicit): 순간 자체만 제시한다. 아예 카메라를 사용한다는 생각을 하는가?
각 순간은 또한 그에 맞는 스톡 연출(‘늦잠을 자는’ 상황의 알람 시계 클로즈업, ‘누군가에게 따라잡히는’ 상황의 어깨 너머 엿보기)을 명시하며, 심사위원들은 이 계획이 그것에 의존하는지 확인합니다.
| 모델 | 종합 점수 | 진부함을 피함: 지시됨 → 방치됨 | 기술 설명 정확도 |
|---|---|---|---|
| Claude Sonnet 5 | 0.96 | 0.88 → 0.88 | 0.88 |
| ... |
- 방치된 모델은 자명한 것에 의존한다. 모든 모델에서 계획은 사용해야 할 기법을 알려주었을 때는 93%의 경우에 상투적인 연출(stock staging)을 피했지만, 단순히 순간만을 주어졌을 때는 각각 75%(첫 번째 실행)와 82%(두 번째 실행)에 불과했습니다.
- 기법의 이름을 아는 것이 작동 방식을 아는 것은 아니다. 이 부분에서는 Claude Haiku가 두 번의 실행 모두에서 가장 취약했습니다. 모델은 분할 조리개(split diopter)를 한 배우는 선명하게, 다른 배우는 흐릿하게 유지하는 것으로 설명했지만, 실제로는 분할 조리개가 정반대로 양쪽을 동시에 초점에 맞춥니다. '길고 끊김 없는 스테디캠 샷 하나'를 요청했을 때도 Haiku와 DeepSeek R1은 그 사이에 렌즈 교체가 있는 네 개의 별도 샷으로 계획했습니다.
주의사항 (Caveats)
- 영화 아이디어 12개는 작은 표본이다. 노트에서 한 가지 놓치는 것만으로 모델의 노트 점수가 약 2% 변하므로, 근접한 점수는 동률로 간주해야 합니다.
- 평가자는 Gemini 3.8 Flash이다. 이 모델은 Gemini 계열 스토리 편향이 있을 수 있으니, 품질(quality) 열을 주의 깊게 읽어보시기 바랍니다. 감독 노트(director's-notes)와 일관성(consistency) 열은 코드로 확인되므로 영향을 받지 않습니다.
- 인프라 노이즈. Kaggle의 공유 모델 서비스는 부하가 심할 때 요청을 거부하는 경우가 있습니다. 벤치마크는 백오프(backoff)를 사용하여 재시도하지만, 여전히 실패하는 아이디어는 점수 0점을 받습니다.
나의 벤치마크 (My Benchmark)
Creative Control: LLMs as a Film Crew on Kaggle
Kaggle의 전체 리더보드는 세 가지 작업을 평균하므로, 위 영화 파이프라인 표보다 모델들을 조금 더 가깝게 배치합니다: 카메라 작업은 모두에게 거의 최대치에 근접했습니다. 순위는 상단에서 동일합니다: GPT-5.5 (0.94), Gemini 3.7 Flash (0.92), DeepSeek R1 (0.90).
이 벤치마크에는 코드가 포함된 세 가지 Kaggle 작업과 모든 모델의 저장된 대화 기록이 있습니다:
• creative-control-a와 creative-control-b: 위 영화 제작 파이프라인에 대한 6가지 아이디어씩
• camera-storytelling: 카메라 작업
각 모델이 각 지시 사항을 어떻게 처리했는지 정확하게 읽어볼 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기