AI '감독'을 위한 영화 제작자 함정 설정하기. 모델은 하나에 걸렸고, 나의 평가 기준(rubric)은 세 개에 걸렸다.
요약
본 글은 AI 모델이 실제 영화 제작 현장에서 '감독' 역할을 수행하기 위한 새로운 평가 기준(DirectorBench)을 제시합니다. 이 벤치마크는 프롬프트 작성, 샷 목록 계획, 그리고 결함 검사(QC Judge)의 세 가지 적대적 과제로 구성되어 있습니다. 작성자는 모델 간 점수 비교보다 각 모델이 어떤 부분에서 실패했는지에 초점을 맞추며, 평가 기준 자체의 중요성을 강조합니다.
핵심 포인트
- AI 감독 역할을 위한 DirectorBench라는 새로운 벤치마크를 제시함.
- 평가 과제는 PromptCraft, ShotList, QC Judge 세 가지 적대적 테스트로 구성됨.
- 모델 성능 비교보다 각 모델이 실패한 구체적인 지점 분석이 중요함을 강조함.
AI '감독'을 위한 영화 제작자 함정 설정하기. 모델은 하나에 걸렸고, 나의 평가 기준(rubric)은 세 개에 걸렸다.
저는 영상이 되기 전에 사진 같은 사실성(photorealism)과 해부학적 구조를 위해 프레임을 품질 검사(QC)합니다. 나쁜 프레임이 나오면 재생성하죠. 저는 그것들과 논쟁하지 않습니다. 또한, 기업 행사, 신화 영화, 공포 단편, 스톡 촬영 등도 연출합니다.
만약 AI 모델들이 실제 세트장에서 도움을 주려면, '보통 정도'로는 충분하지 않습니다. 기준은 세 가지입니다: 결함을 절대 꾸며내지 않기(never invent a defect), 제약 조건(constraints) 보여주기, 그리고 인간 크루가 읽을 것처럼 프롬프트를 작성하는 것입니다. 제가 읽었던 벤치마크들은 이러한 작업을 측정하지 못합니다. 그래서 저는 DirectorBench를 만들었습니다: 비디오 감독의 역할을 수행하는 AI 모델들을 위한 적대적 과제(adversarial tasks).
설정 (The setup)
세 가지 과제가 있습니다:
- PromptCraft: 생성 준비가 된 프롬프트 작성하기.
- ShotList: 까다로운 제약 조건 하에 간략한 내용(brief)으로부터 샷 목록 계획하기.
- QC Judge: 프레임을 수락하거나 거부하기. 일부 프레임은 미끼(decoys)입니다: 의도적으로 정확하며, 통과되어야 합니다.
이것은 간소화된 파일럿 테스트입니다: 24개의 적대적 항목, 두 개의 모델 (Anthropic Opus 5.5, Grok 4.6), 둘 다 Notion AI를 통해 중간 정도의 노력(Medium effort)으로 진행되었습니다. 채점은 결정론적입니다: 정규 표현식(regex checks)과 단어 중복 검사만 사용하며, 인간의 판단은 없습니다. 실행은 Notion AI에서 이루어졌고, Kaggle 벤치마크 과제들은 빌드 대기열에 갇혔습니다.
| Task | Opus 5.5 | Grok 4.6 |
|---|---|---|
| PromptCraft (6) | 1.000 | 0.931 |
| ... | ||
| Opus 5.5가 세 가지 과제 모두에서 더 높은 점수를 받았습니다. 그것을 지나치게 해석하지 마십시오. 6개 항목 과제에서는 단 하나의 항목이 큰 변동폭(large swing)이며, 곧 보시다시피, 세 가지 과제 중 두 가지는 부분적으로 저의 키워드 채점기(keyword scorer)를 측정하고 있었습니다. 유용한 질문은 어떤 모델이 더 높은 점수를 받았느냐가 아닙니다. 각 모델이 실제로 잃은 한 점이 무엇을 의미하는지입니다. |
제가 주장하지 않을 것 (What I will not claim)
24개 항목, 계획했던 70개가 아닙니다. 두 개의 모델, 여섯 개가 아닙니다. 중간 정도의 노력, 최대가 아닙니다. Notion AI, 깨끗한 API 하니스가 아닙니다.
아래 세 가지 발견 중 두 가지는 모델에 관한 것이라기보다 저의 평가 기준(rubric)에 관한 것입니다. 댓글에서 누군가가 그것을 발견하게 하는 것보다는 여기서 말하는 편이 낫겠습니다.
발견 1: 편집증적인 심사위원 (the trap worked)
QC 작업은 픽셀이 아닌 프레임에 대한 서면 설명을 평가합니다. 이것은 실제적인 한계이며, 전체 실행에는 실제 이미지가 필요합니다. 이 한계 내에서 설계는 다음과 같습니다. 디자인적으로 정확하여 통과해야 하는 6개의 미끼 설명(decoy descriptions)과 진정한 결함이 있는 6개입니다.
Opus는 6개의 미끼를 모두 정확한 코드로 통과했습니다. 오탐지(false alarms)는 없고, 놓친 것도 없습니다(zero misses).
Grok은 6개의 실제 결함을 모두 포착했지만, 미끼 중 하나를 거부했습니다: '원반이 세운 검지 손가락 끝에 균형을 잡고 수직으로 회전한다.' 이는 FAIL [PHYS]로 표시되었습니다.
저 원반은 스다르샤나 차크라(Sudarshana Chakra)입니다. 이 장면은 도상학적 요소(iconography)이며, 지침에는 명시적으로 도상학적 요소를 물리 검토에서 제외한다고 되어 있습니다. 저는 모델 내부를 볼 수 없기 때문에 왜 그런지 주장할 수는 없습니다. 제가 관찰할 수 있는 것은 서면 지침이 그렇지 않다고 말한 곳에 물리적 이의 제기를 적용했다는 것입니다.
6개의 미끼 중 1번의 오탐지는 성격이라기보다는 단일 데이터 포인트입니다. 하지만 그것은 미끼가 존재하기 위해 포착하도록 설계된 정확한 실패 사례이며, 제 워크플로우에서 가장 중요한 부분입니다. 거부(rejection)는 사용 가능한 프레임을 재생성 과정으로 돌려보냅니다. 결함을 지어내는 심사관은 신뢰를 잃게 합니다. 한 번 잘못된 것을 플래그 지정하면, 저는 그 판단을 스스로 재확인해야 하기 때문입니다.
| 오탐지 없음 (0 false alarms) | 오탐지 1회 이상 (1+ false alarms) | |
|---|---|---|
| 놓친 것 없음 (0 misses) | Opus 5.5: 유용함 | Grok 4.6: 편집증적임 |
| 놓친 것 1회 이상 (1+ misses) | 관대함 (lenient) | 쓸모없음 (useless) |
이것은 저의 채점관에 대한 것이라기보다는 감독의 역할에 관한 유일한 발견입니다.
발견 2와 3: 제 루브릭이 함정에 빠진 곳
ShotList는 두 모델 모두 점수가 가장 낮았으며, 피해 대부분은 저 자신의 검토에서 비롯되었습니다. 각 작업 점수는 6개 항목의 평균이며, 각 항목은 6개의 하위 검사(sub-checks)의 평균입니다. 실제로 점수가 떨어진 곳이 바로 여기입니다.
제외 사항을 명명하는 것이 처벌받는다. 두 모델 모두 ShotList 점수에서 약 14점을 잃었는데, 이는 그들이 잃은 모든 것 중 대략 3분의 2에 해당하며, 단일 하위 검사: f_clean 때문이었습니다. 모델당 6개 항목 중 5개가 이 검사에 걸렸습니다:
- Opus: 'no visible logo or markings'에서 'logo'라는 단어로 플래그 지정
- Opus: 'plain dial with no numbers'에서 간행물(brief) 자체의 단어인 'dial'로 플래그 지정
- Grok: 'no signage, no readable marks'에서 'signage'로 플래그 지정
Grok은 한 번 통과했다: 'blank cream pages, no writing, no print.' 이는 트리거 단어를 피했기 때문에 좋은 샷 리스트(shot list)의 증거는 아니다.
모델들은 올바른 감독 역할을 했다: 제한 사항을 명시하여 제작진이 볼 수 있게 한 것이다. 검사기는 이 언급을 위반으로 읽는다. 이것은 모델의 실패가 아니라 평가 기준(rubric)의 경계점이다. 만약 당신의 평가가 명확성보다 침묵에 보상을 준다면, 당신은 제한 사항을 숨기는 모델들을 선택하게 될 것이다.
자연스러운 구문이 처벌받는다. PromptCraft에서 Grok은 'moon' 대신 'moonlight'와 'moonlit'를 썼고, 'candle' 대신 'candlelight'를 썼다. 명사 점수 측정기는 'moon'에 대한 전체 단어 일치를 원했다. 'moonlight'는 계산되지 않는다. Opus는 순수한 명사를 작성했고 6점 만점에 6점을 받았다.
그것이 Opus가 더 나은 프롬프트를 작성했음을 증명하지는 않는다. 그것은 이 점수 측정 부분이 프롬프트의 품질이 아니라 어휘적 형태(lexical form)를 측정했다는 것을 증명한다. 벤치마크가 모델이 나쁜 프롬프트를 작성한다고 알려줄 때, 이것이 기술적인 완성도(craft)를 평가하는 것인지 아니면 grep 패턴을 평가하는지 확인하라.
의역은 0점이다. b04 ShotList 항목에는 브랜드 약속이 담겨 있었다: 호출은 들리지만 절대 인쇄되지 않는다. 두 모델 모두 내 읽기에서는 의도를 전달했다. Opus는 'coach calls out in Hindi, stopwatch face turned away'를 작성했고, Grok은 'Split is heard, not seen'을 작성했다. 단어 중복(word-overlap) 하위 점검은 둘 다 0.0점을 받았다. 그것은 의역을 볼 수 없다. 이 0점들은 위 표의 ShotList 평균에 포함되어 있다.
다음 단계
전체 테스트는 70개 항목과 6개 모델로 구성되었으며, 이번 파일럿으로 두 가지 개선 사항이 얻었다: 키워드 존재 여부가 아닌 의미로 점수를 매기는 준수도(compliance), 그리고 설명이 아닌 실제 프레임으로 판단하는 품질 관리(QC). DirectorBench의 테스트는 규칙을 위반하는 모델과 그것을 설명하는 모델, 그리고 결함이 있다는 것을 발명하는 모델과 규칙이 적용되지 않는다는 것을 아는 모델을 구별할 수 있는지 여부이다.
벤치마크는 나쁜 답변과 다르게 표현된 좋은 답변을 구별할 수 있어야 한다. 이번 파일럿 테스트를 통해 내 벤치마크가 그 역할을 못 한다는 것을 알게 되었다.
아이템, 정답지, 채점자: https://github.com/rsaxena3011/directorbench
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기