
동일한 캐릭터 사양을 두 개의 AI 아트 플랫폼에서 실행해 보았습니다. 단 하나만이 재현 가능한 결과물을 제공했습니다.
요약
OpenArt와 PixAI 두 AI 아트 플랫폼을 대상으로 동일한 캐릭터 사양의 재현성을 테스트했습니다. 프롬프트의 세부 사항이 모델의 결과물 일관성에 미치는 영향을 분석하며, 특정 플랫폼의 성능 차이를 확인했습니다.
핵심 포인트
- 동일한 캐릭터 사양(머리색, 포인트 등)을 통한 플랫폼 간 재현성 비교
- 프롬프트의 세부 제약 조건이 모델의 결과물에 미치는 영향 분석
- 범용 플랫폼과 애니메이션 특화 플랫폼의 기능 및 결과물 특성 차이
이미지 모델에 프롬프팅 (Prompting) 하는 것은 스키마 (schema)도, 타입 (types)도 없고, 동일한 입력이 두 번 실행되었을 때 동일한 형태를 반환한다는 보장도 없는 API를 호출하는 것과 더 비슷합니다. 당신은 문자열을 보냅니다. 그리고 무언가를 돌려받습니다. 그것이 당신이 요청한 것과 일치하는지는 협상의 문제입니다.
저는 그 협상을 측정하고 싶었기에, 두 플랫폼을 대상으로 작은 통제된 테스트를 설정했습니다. 범용적인 크리에이티브 스위트 (creative suite)인 OpenArt와, 애니메이션 이미지 생성에 특화되어 그 이상의 기능은 거의 제공하지 않는 PixAI입니다.
사양 (The spec)
대상은 오리지널 캐릭터입니다. 그녀를 다음과 같은 필수 필드를 가진 고정 요소로 취급합니다:
character: Rin
hair_color: deep indigo
hair_accent: single teal streak, left side
...

애니메이션 특화 플랫폼에서 렌더링된 사양. 이 포스트의 모든 캐릭터 이미지는 PixAI에서 가져왔습니다. 다른 플랫폼의 무료 티어 결과물에는 워터마크가 찍혀 있기 때문입니다.
이 필드 중 두 개는 중요한 단언 (assertions)입니다. hair_accent는 의도적으로 까다롭게 설정했는데, 어두운 바탕에 있는 단 하나의 색상 줄기는 모델이 주의 깊게 읽는 것을 멈출 때 가장 먼저 뭉개버리는 부분이기 때문입니다. background: plain은 위장된 부정 제약 조건 (negative constraint)입니다. 모델에게 아무것도 추가하지 말라고 요청하는 것입니다.
테스트 조건
두 플랫폼 모두 무료 플랜으로 실행되었습니다. 애니메이션 중심 플랫폼에서도 사용 가능한 가장 낮은 품질 모드를 유지했는데, 한 서비스는 무료 티어로, 다른 서비스는 프리미엄 설정으로 벤치마킹 (benchmarking) 한다면 비교를 시작하기도 전에 비교 자체가 무효화될 것이기 때문입니다.
플랫폼당 두 번의 실행을 진행했습니다. 첫 번째는 작성된 사양 그대로 사용했습니다. 두 번째는 첫 번째 실패가 모델의 문제가 아니라 프롬프트 (prompt) 문제일 것이라는 이론에 따라, 더 강력하고 명시적인 문구로 hair_accent를 강화했습니다.
표본은 적으며, 저 또한 이를 하나의 사례로 보고하고 있습니다. 핵심은 벤치마크 점수가 아니라 실패 모드 (failure mode)입니다.
실행 1: 범용 플랫폼
플랫폼 자체는 매우 정교한 엔지니어링의 결과물입니다. 하나의 계정으로 방대한 모델 목록을 통한 이미지 생성, 비디오, 탐색 가능한 3D 장면, 오디오, 채팅 기반의 샷 시퀀서 (shot sequencer), 커스텀 모델 학습 (custom model training), 그리고 전체 편집 스위트 (editing suite)를 모두 이용할 수 있습니다. 모든 도구가 포함된 모노레포 (monorepo)라고 생각하면 됩니다. 즉, 관리해야 할 의존성 (dependency)은 하나지만 표면적 (surface area)은 매우 방대합니다.

왼쪽 사이드바(left rail)만 봐도 Director, Video, Image, World, Character, Audio가 포함되어 있습니다. 이것이 바로 한 열에 담긴 올인원 (all-in-one)의 약속입니다.
이 안에서 애니메이션 스타일을 찾는 데는 약간의 스크롤이 필요했습니다. 해당 스타일을 위해 구축된 단일 체크포인트 (checkpoint)가 있으며, 그 주변은 사진, 초상화, 제품 작업을 위해 튜닝된 모델들이 둘러싸고 있습니다.
스타일 출력은 통과되었습니다. 두 번의 실행 모두 반실사 (semi-realism)로 치우치는 현상 없이 깔끔한 셀 셰이딩 (cel-shaded) 애니메이션을 반환했습니다. 반실사로의 치우침은 이 스타일을 시도하는 범용 모델들이 흔히 겪는 실패 사례입니다.
필드 수준의 어서션 (assertions)은 실패했습니다:
| 필드 (Field) | 실행 1 (Run 1) | 실행 2 (Run 2, 강화됨) |
|---|---|---|
hair_accent | 단일 색상으로 붕괴됨 | 과하게 교정되어 청록색이 곳곳에 흩어짐 |
| ... |
강화된 실행 (reinforced run)이 흥미로운 지점입니다. 제약 조건을 강화했더니 정확도가 높아지는 대신, 반대 방향으로 다른 부정확성이 발생했습니다. 이는 요청이 불충분해서 발생하는 문제라기보다, 모델이 문자 그대로의 준수 (literal compliance)보다 미적 타당성 (aesthetic plausibility)을 최적화하려는 동작에 가깝습니다.
요청하지 않았음에도 두 실행 모두에서 아이스크림 콘이 나타난 것은 동일한 범주의 문제입니다. 모델이 사진에 무엇이 포함되어야 하는지에 대한 사전 지식 (priors)을 가지고 있으며, 그 사전 지식이 사용자의 입력보다 우선순위가 높기 때문입니다.
구조적 발견
이 발견은 그 어떤 단일 출력물보다 중요했습니다.
해당 애니메이션 체크포인트에서는 참조 이미지 (reference-image) 입력을 사용할 수 없었습니다. 참조 지원 기능은 범용 모델들에 구현되어 있습니다.
모델 간에 기능이 분리되어 있는 것은 일반적인 현상이며, 애니메이션 특화 플랫폼 또한 마찬가지입니다. 문제는 그 경계에서 무엇을 포기해야 하는가입니다. 여기서 참조 기능 (reference-capable)이 있는 모델로 이동한다는 것은 범용 모델 (general-purpose model)로 이동함을 의미하며, 이는 곧 해당 체크포인트 (checkpoint)를 선택했던 이유인 스타일 튜닝 (style tuning)을 포기하는 것을 의미합니다. 이는 타입 지정 인터페이스 (typed interface)와 비동기 인터페이스 (async interface)가 서로 배타적인 라이브러리와 같습니다. 둘 다 존재하지만, 동시에 둘 다 가질 수는 없습니다.

비교 사례: PixAI에서는 참조 슬롯 (reference slot)이 모델 타일 위에 위치하며, 참조 기능이 있는 모델들 또한 애니메이션에 맞춰 튜닝되어 있습니다.
실행 2: 특화 플랫폼 (the narrow platform)
동일한 사양, 애니메이션 네이티브 모델 (anime-native model), 최저 품질 등급, 무료 플랜.

모드는 Lite로 설정, 스타일 프리셋 (style preset) 없음, 애니메이션 모델 선택됨, 그 아래에 커뮤니티 애드온 (community add-on) 모델들이 쌓여 있음.
그 다음, 실제 제작 사례에 맞춰 정체성 필드 (identity fields)는 고정하고 비정체성 필드 (non-identity fields)를 변형했습니다. 세 가지 변형: 일반 스튜디오, 빛이 들어오는 교실 안의 교복, 공원에서의 여름 드레스.

정체성 필드는 고정된 채 세 가지 변형 적용. 후드티에서 교복 블레이저, 여름 드레스로 변경되었으나 얼굴은 동일함.
세 가지 변형 모두에서 정체성(identity) 필드는 유지되었습니다. 머리카락 색상, 청록색 포인트, 그리고 눈 색상은 공통점이 전혀 없는 장면 변화 속에서도 살아남았습니다. 변한 것은 정체성이 아니라 구도(framing)였습니다. 공원 변형 버전은 지정된 것보다 더 타이트한 크롭(crop)과 다른 각도로 나타났습니다.
이것이 올바른 실패 모드(failure mode)입니다. 정체성은 유지되면서 구도가 어긋나는 것은 복구가 가능합니다. 크롭(crop)은 다시 생성(re-roll)할 수 있기 때문입니다. 반면 구도는 유지되는데 정체성이 어긋난다는 것은 캐릭터가 사라졌음을 의미하며, 아무리 다시 생성해도 그 특정 인물을 되찾을 수 없습니다.
참고할 점은, 이 테스트가 참조 도구(reference tools)나 학습된 캐릭터 모델(trained character model)을 사용하기 전, 베이스 모델(base model)과 일관된 프롬프트(prompt)만으로 수행되었다는 것입니다. 해당 플랫폼에는 이 두 가지가 모두 존재하며, 둘 다 애니메이션에 최적화(anime-tuned)되어 있으므로, 단계를 높여도 스타일을 잃지는 않습니다.
핵심 요약 (Takeaway)
두 플랫폼 모두 훌륭한 애니메이션 이미지를 생성합니다. 이번 비교는 품질이 아닌 표면적(surface area)에 관한 것입니다.

모델 접근부터 참조 도구 및 최적 사용자까지, 워크플로우 축(workflow axes)에 대한 나의 요약.
출력물이 비디오, 광고, 제품 비주얼, 스토리보드 등 다양한 형식을 아우른다면 광범위한 플랫폼(broad platform)을 선택하는 것이 옳습니다. 통합(consolidation)은 실질적인 가치를 제공하며 도구 구성도 강력합니다.
반면, 하나의 반복되는 문제를 해결하고 싶고 전체 툴체인(toolchain)이 그 문제에 집중되기를 원한다면 좁은 플랫폼(narrow platform)이 승리합니다. 이 경우 그 문제는 캐릭터 일관성(character consistency)이며, 차이점은 특화된 도구(specialized tools)가 특화된 모델(specialized model) 옆에 위치하는지, 아니면 모델과 경계 너머에 위치하는지에서 나타났습니다.
반복되는 캐릭터를 유지하고 싶다면, 위와 같은 사양(spec)을 직접 작성하고 가장 까다로운 두 가지 필드를 선택하여 현재 사용 중인 도구에서 두 번 실행해 보십시오. 그 결과가 그 어떤 기능 비교표(feature matrix)보다 더 많은 것을 말해줄 것입니다.
애니메이션 네이티브(anime-native) 환경에서 테스트를 진행하고 싶다면 PixAI를 시도해 보세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기