AI 편집을 패널 1에 국한하고 패널 4에서 차이점을 발견하다
요약
본 글은 AI 모델이 만화 페이지 전체를 하나의 단위로 처리하는 능력을 테스트한 내용을 다룹니다. 특히 네 개의 패널, 두 화자, 짧은 대사 등 복잡한 구조에서 발생하는 오류와 편집 과정을 분석했습니다. 그 결과, 특정 요소(예: 말풍선)의 오류는 패널 1에 집중되는 경향을 발견하고, 가장 깨끗한 패널 4를 기준으로 삼아 편집하는 것이 효과적임을 보여줍니다.
핵심 포인트
- AI 모델은 복잡한 만화 페이지 구조에서 일관성 문제를 보임.
- 패널별로 변수를 하나씩 변경하며 테스트할 때 개별 주장을 확인하기 용이함.
- 오류가 발견된 경우, 가장 완성도가 높은 패널을 기준으로 삼아 편집하는 것이 중요함.
저는 AI 모델이 만화 페이지 전체를 하나의 단위로 얼마나 잘 처리하는지 알고 싶었습니다. 즉, 네 개의 패널, 두 명의 화자, 그리고 특정 말풍선에 속해야 하는 짧은 대사 두 줄입니다. 그래서 이 페이지를 스펙으로 작성하고 PixAI에서 Tsubaki.3을 이용해 생성했습니다. 그런 다음 PixAI Studio에서 일련의 편집 과정을 거치게 하고, 제가 diff(차이점)를 확인할 때처럼 각 출력을 검토했습니다.
첫 번째 실행에서는 대부분의 주장이 통과했습니다. 저는 선언된 범위를 벗어난 부작용을 발견하는 과정에서 편집들을 진행했습니다.
테스트 환경 (The fixture)
테스트 페이지는 의도적으로 다른 실루엣을 가진 두 캐릭터 간의 가라오케 원한 매치입니다. 따라서 신원 교체나 잘못 할당된 대사는 썸네일 크기에서도 눈에 띌 것입니다.
page:
style: black-and-white manga, ink lines, screentone
layout: [wide, half + half, wide]
...
실제 프롬프트는 일반 영어였으며, 페이지 규칙에 대한 단락 하나, 각 캐릭터에 대한 단락 하나, 그리고 패널당 번호가 매겨진 단락으로 구성되었습니다. 위에 있는 YAML은 제가 테스트한 구조일 뿐입니다. 각 패널은 이전 패널과 정확히 하나의 변수(샷, 액션 또는 화자)에서 차이가 나기 때문에, 저는 각 주장을 개별적으로 확인할 수 있었습니다.
첫 번째 실행: 네 가지 버전, 여덟 개의 주장
저는 Prompt Helper를 끄고 한 번에 네 가지 버전을 생성했기 때문에 모델은 변경되지 않은 프롬프트를 받았습니다. 그런 다음 세 배에서 네 배 크기로 각 버전을 확인했습니다.
| 주장 (Assertion) | 통과율 (Pass rate) |
|---|---|
| 선언된 레이아웃의 네 개의 패널 | 4/4 |
| ... | |
![]() |
실패한 두 행은 모두 패널 1에 있었습니다. 모든 버전에서 텍스트는 정확했지만, 말풍선은 깨끗했고 화자가 잘못되었습니다. 모델은 또한 화면에 요청되지 않은 점수(score)를 표시했습니다: 한 번은 190, 두 번은 100, 그리고 한 번은
가장 깨끗한 패널 4를 기반으로 편집할 버전을 선택했습니다.
PixAI Studio에서의 패치(Patching)
PixAI Studio에서는 모든 단계가 캔버스 위의 노드이며, 입력으로 받는 이미지에 연결되어 있습니다. 각 편집은 하나의 출력을 가진 새로운 Tsubaki.3 노드였습니다. 모든 지침은 두 부분으로 구성되었습니다: 한 패널로 범위가 지정된 변경 사항과 무엇이 동일하게 유지되어야 하는지 명명하는 '유지 목록(keep list)'.
| 노드 | 의도한 변경 | 실제 적용된 변경 | 부작용 | :--- |
| 2 | 패널 2: 새로운 표정 | 예 | Genzo가 Fumiko와 같은 안경을 쓰게 됨 |
| ... |
I dropped Node 3를 건너뛰고 노드 2에서 다시 분기하여, 최종 페이지는 경로 1, 2, 4, 5, 6의 출력이 되었습니다.
저는 노드 5에서 가장 많은 것을 배웠습니다. 그곳에서는 변경 사항을 모두 패널 1로 범위 지정하고, 유지 목록에 패널 4의 '100'을 명시했습니다.
패널 1에서만 두 가지 변경을 수행하세요. "BEAT 98, OLD MAN."이라고 적힌 말풍선을 패널 상단 좌측, Fumiko 위로 이동시키세요...
벽에 있는 점수 화면을 어둡고 공백으로 만드세요...
...
모델은 요청대로 말풍선을 이동시켰습니다. 하지만 화면의 경우, 패널 범위를 무시했습니다: 유지 목록에서 '100'을 명시했음에도 불구하고 패널 1에 있는 것은 제거하고 패널 4에 있는 것도 비웠습니다. 외부적으로 볼 때, 이것은 선언된 패널 내부의 개체가 아니라 페이지상의 동일한 유형의 모든 객체와 일치하는 선택자처럼 보였습니다. 이는 제가 관찰한 것을 비유한 것이며, 모델이 내부적으로 어떻게 작동하는지에 대한 주장은 아닙니다.
노드 6에서는 모델이 '100'을 복원했을 뿐만 아니라 다른 두 개의 반복되는 객체도 편집했습니다: 패널 1의 Fumiko의 찻잔은 이제 기울어진 받침대 위에 떠 있고, 패널 4에 두 번째 컵이 나타났습니다.
체크리스트에 넣을 것들
- 배치(batch)를 실행하고 패널별로 단언(assert)하기. 단일 버전으로는 화자 오류가 네 곳 모두에서 나타난 것을 볼 수 없었다.
- 화자 할당(speaker assignment)을 별도의 단언으로 처리하기. 대사는 올바르게 표기되었더라도 여전히 잘못된 캐릭터의 말풍선 안에 있을 수 있다.
- 말풍선에 페이지 상에서의 위치와 함께 화자의 설명을 부여하기. 이 수정 사항을 한 번 실행했을 때, 모델이 그것을 오른쪽 캐릭터에게로 이동시켰다.
- 범위 밖에 있는 패널들을 포함하여 모든 편집 후 전체 페이지를 비교(Diff)하기. 이번 테스트에서 모델은 목표 범위 외의 후미코의 얼굴, 점수 화면, 그리고 찻잔들을 변경했다.
- 편집이 실패할 때 브랜치(Branch) 분기하기. 만약 노드 3부터 계속 진행했더라면, 그 요청되지 않은 변경 사항들이 모든 이후 단계에 포함되었을 것이다.
다음 실행을 위한 미실험 아이디어: 어떤 객체가 여러 패널에 나타날 경우, 패널 번호뿐만 아니라 페이지 상에서의 위치로도 대상을 지정하기.
완성된 페이지는 위에서 아래로 읽기 쉬우며, 나는 그 위에 두 개의 찻잔 변경 사항을 증거로 남겼다. 만약 여러분이 자신만의 4비트 장면에서 동일한 실험을 실행하고 싶다면, PixAI에서 시도해 볼 수 있다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기

