10,000장 이상의 사진 애니메이션화, 평균 18초: Inithouse의 AI 사진-비디오 애니메이터인 Ziva Fotka의 생산 데이터
요약
Inithouse의 AI 사진-비디오 애니메이터 Ziva Fotka의 실제 운영 데이터와 파이프라인 성능을 분석합니다. 10,000장 이상의 처리 경험을 바탕으로 추론 시간, 입력 유형별 성공률, 얼굴 랜드마크 추적의 중요성을 다룹니다.
핵심 포인트
- 평균 처리 시간은 약 18초이며 대부분 추론 과정에서 소요됨
- 얼굴 랜드마크(68개 이상) 추적이 자연스러운 움직임의 핵심
- 최근 컬러 사진(92%) 대비 오래된 스캔 사진(78%)의 성공률이 낮음
- 사용자의 약 55%가 흑백 또는 오래된 사진을 업로드하는 경향을 보임
지난달 Ziva Fotka에서 애니메이션화된 사진이 10,000장을 돌파했습니다. 평균 처리 시간은 18초입니다. AI 사진-비디오 (photo-to-video) 도구를 그 정도 규모로 운영할 때 실제 생산 데이터가 어떤 모습인지 소개합니다.
Ziva Fotka가 하는 일
Ziva Fotka는 정지된 사진을 짧고 생동감 있는 비디오로 변환하는 AI 도구입니다. 또한 오래된 사진이나 흑백 사진을 편집하고 채색하여 결과물이 일반적이지 않고 자연스럽게 보이도록 할 수 있습니다. 회원 가입은 필요하지 않습니다. 사진은 처리 후 삭제됩니다.
우리는 다양한 제품 포트폴리오를 병렬로 출시하고 있는 스튜디오인 Inithouse에서 이를 구축했습니다. Ziva Fotka는 단일 코드베이스를 통해 5개 도메인과 5개 언어(체코어, 슬로바키아어, 폴란드어, 영어, 독일어)에서 작동합니다.
수치로 보는 파이프라인
애니메이션 파이프라인은 얼굴당 68개 이상의 얼굴 랜드마크 (facial landmark) 포인트를 추적합니다. 이러한 추적 기술이 단순히 움직이는 사진과 설득력 있게 움직이는 사진의 차이를 만듭니다. 눈, 입, 턱선, 이마 주름 모두 독립적인 모션 벡터 (motion vectors)가 필요합니다. 충분한 랜드마크가 없으면 얼굴 전체가 가면처럼 미끄러지는 듯한 불쾌한 골짜기 (uncanny valley) 효과가 나타납니다.
10,000장 이상의 처리된 사진을 통해 측정한 결과는 다음과 같습니다:
처리 시간: 평균 18초입니다. 이 시간의 대부분은 업로드나 다운로드가 아닌 추론 (inference) 과정입니다. 더 큰 파일(3000x4000 이상의 스캔본)은 5~10초가 추가됩니다. 표준 해상도의 휴대폰 사진은 보통 15초 이내에 완료됩니다.
입력 유형 분류: 업로드된 파일의 약 40%는 오래된 사진이나 스캔된 사진입니다. 다른 15%는 흑백 원본입니다. 나머지 45%는 최근의 컬러 사진으로, 대부분 인물 사진과 단체 사진입니다.
오래된 사진 vs 최근 사진 성공률: 최근 컬러 사진은 약 92%의 확률로 첫 시도에 사용 가능한 결과물을 얻습니다. 오래된 스캔 사진은 약 78%로 떨어집니다. 이러한 격차는 스캔 아티팩트 (scan artifacts)에서 발생합니다: 주름, 먼지 점, 플랫베드 스캐너의 불균일한 조명, 그리고 얼굴 랜드마크를 감지하기 어렵게 만드는 흐릿한 대비 등이 원인입니다.
채색 정확도 (Colorization accuracy): 흑백 사진의 경우, 애니메이션 단계 이전에 채색 (colorization) 단계가 실행됩니다. 우리는 과도하게 채도가 높은 현대적인 색상보다는 차분하고 시대에 적합한 톤을 생성하도록 튜닝했습니다. 1940년대 초상화는 인스타그램 필터처럼 보이는 것이 아니라, 컬러로 된 1940년대 초상화처럼 보여야 합니다.
평점 (Rating): 1,200개 이상의 사용자 평점 기준 5점 만점에 4.8점입니다. 가장 낮은 점수들은 애니메이션이 불균일해지는 4명 이상의 얼굴이 포함된 단체 사진, 그리고 랜드마크 감지 (landmark detection)가 어려운 심하게 손상된 원본 사진들에 집중되어 있습니다.
우리가 놀랐던 점
가장 놀라웠던 점은 오래된 사진 부문이었습니다. 우리는 대부분의 사용자가 최근의 셀피 (selfie)나 초상화를 애니메이션화할 것이라고 예상했습니다. 하지만 실제로는 전체 업로드의 거의 절반이 가족 기록물, 스캔된 인화물, 그리고 물려받은 사진첩이었습니다.
사람들은 조부모님의 사진, 1970년대와 1980년대의 어린 시절 사진, 수십 년 전의 결혼 사진들을 가져오고 있습니다. 더 이상 이곳에 계시지 않는 누군가의 정지된 사진이 움직이기 시작하는 것을 보는 정서적 무게감은, 우리가 이 도구를 만들 때 완전히 예상하지 못했던 부분입니다. 이것이 바로 우리가 애니메이션을 미묘하고 존중하는 방식으로 유지하는 이유입니다. 과장된 표정은 없습니다. 인위적인 미소도 없습니다. 그저 원본 사진이 포착한 것을 보존하는 부드럽고 자연스러운 움직임뿐입니다.
이 정도 규모의 구축을 통해 배운 점
Ziva Fotka를 운영하며 우리는 Inithouse의 다른 제품들에도 적용할 수 있는 것들을 배웠습니다. 처리 속도는 신뢰의 신호 (trust signal)로 작용합니다. 30초 이상 기다리는 사용자들은 무언가 고장 난 것이 아닌지 의심하기 시작합니다. 처리가 끝난 후 업로드된 사진을 삭제하는 것은 개인정보 보호 (privacy)를 부가적인 사항이 아닌 하나의 기능으로 만듭니다. 그리고 당신이 설계한 유스케이스 (use case, 활용 사례)(재미있는 셀피 애니메이션)가 사람들이 실제로 발견하는 유스케이스(가족의 기억 보존)와 다를 수 있습니다.
우리가 AI 반려동물 초상화 생성기인 Pet Imagination을 구축했을 때도 이러한 패턴 중 일부가 다시 나타났습니다. 동일한 교훈을 얻었습니다. 우리가 설계한 유스케이스(재미있는 반려동물 예술)가 사람들이 발견한 유일한 유스케이스(세상을 떠난 반려동물의 추모 초상화)는 아니었습니다. 두 제품 모두 정서적 콘텐츠(emotional content)에 대한 동일한 종류의 세심한 주의가 필요했습니다.
기술 스택 (The technical stack)
Ziva Fotka는 alivephoto.online (영어), zivafotka.cz (체코어), zivafotka.sk (슬로바키아어), zywafotka.pl (폴란드어), lebendigfoto.de (독일어)를 통해 5개 국가 도메인에 서비스를 제공하는 단일 코드베이스(single codebase)로 운영됩니다. 멀티 도메인이지만 배포(deployment)는 하나입니다. 애니메이션 모델은 서버 사이드(server-side)에서 실행되므로 클라이언트 하드웨어 의존성(client hardware dependency)이 없습니다.
우리는 계정을 요구하지 않고 사진을 처리합니다. 업로드, 애니메이션화, 다운로드하면 끝입니다. 사진은 전달 후 우리 서버에서 삭제됩니다. 이러한 제로 프릭션(zero-friction, 마찰 없는) 흐름은 의도적인 선택입니다. 누군가가 가족사진이 살아 움직이는 것을 보고 싶어 할 때, 또 다른 계정을 만들라고 요구하는 것은 방해가 될 뿐이기 때문입니다.
현재 상황 (Where we are now)
10,000장 이상의 사진은 의미 있는 샘플입니다. 사람들이 도구를 사용하는 방식, 무엇이 고장 나는지, 그리고 무엇이 예상보다 더 잘 작동하는지에 대한 실제 패턴을 파악하기에 충분히 큰 규모입니다. 우리는 데이터가 보여주는 것을 계속해서 측정하고 공유할 것입니다.
직접 체험해보고 싶다면: alivephoto.online
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기