
추가 비용 없이 '립 싱크': Synthesia Dubbing 2.0이 모든 연결 부위에서 입술 동기화 유지
요약
Synthesia가 모든 요금제에 기본 포함되는 Dubbing 2.0을 출시했습니다. 새로운 립싱크 모델은 장면 전환이나 다중 화자 상황에서도 프레임 단위의 정확한 입술 동기화를 유지하며 추가 비용 없이 제공됩니다.
핵심 포인트
- 모든 요금제에 새로운 립싱크 모델 기본 포함 및 추가 비용 없음
- 장면 전환 및 다중 화자 상황에서도 정교한 입술 동기화 유지
- 영상 길이에 맞춘 적응형 타이밍 모드 및 용어집 기능 지원
- Wav2Lip 등 기존 모델의 한계를 극복한 엔드 투 엔드 스택 구축
익숙한 광경입니다. AI 더빙을 위해 영상을 맡겼더니, 번역본을 돌려받았는데 첫 번째 연결 부위(splice)부터 스피커의 입술이 제멋대로 움직이는 경우입니다. 소리는 맞고 단어도 정확하지만, 보기에는 불가능합니다. 이런 부분을 수동으로 수정하는 데는 몇 시간이 걸렸고, 그동안 정상적인 립 싱크를 제공하는 서비스들은 이전까지 별도의 비용을 요구했습니다.
2026년 7월 중순, Synthesia가 전체 더빙 스택을 재구축하여 Dubbing 2.0을 출시했습니다. 새로운 lip-sync 모델이 모든 요금제에 기본으로 포함되었으며 추가 비용은 발생하지 않습니다 (릴리스 피드 기록 기준: 2026년 7월 15일). 이는 전체 분야의 판도를 바꿉니다. 이제는 초 단위 결제가 가능한 '순수' 입술 동기화 API가 근접해 있습니다. 무엇이 바뀌었는지, 그리고 이것이 분당 및 크레딧 측면에서 어떤 의미인지 분석해보겠습니다.
러시아에서 서방 서비스를 이용하려면 여전히 해외 카드가 필요하며, 모든 요금은 달러로 책정되어 있습니다. 작동 가능한 방법은 두 가지입니다: 외국 은행 카드 사용 또는 provod.ai와 같은 러시아 애그리게이터를 통해 공식 요율로 루블화하여 모델을 결제하는 것입니다. 다음은 2026년 7월 19일 기준의 수치입니다.
lip sync란 무엇이며, 왜 연결 부위에서 '오류'가 발생했나?
간단히 말해, lip sync는 영상 프레임 속 캐릭터 입술 움직임을 음성 트랙과 동기화하는 것입니다. 시청자의 눈은 편집이 이루어진 지점에서 싱크가 맞지 않는 것을 민감하게 감지합니다. 연결 부위에서는 포즈와 앵글이 바뀌는데, 기존 모델들은 이 지점에서 '표류(drift)'했습니다.
번역된 문장이 원본보다 길거나 짧을 경우, 알고리즘은 새로운 음성에 맞춰 입 모양을 다시 그려야 합니다. 두 클립의 경계에서 모델은 얼굴의 기준 트랙을 잃어버립니다: 반 초 동안 입이 박자에 맞지 않게 움직이고, 우리의 뇌는 이를 즉시 감지합니다. 마치 90년대 저가 번역 같은 효과입니다.
Synthesia에 따르면, 이전 모델은 빠른 연결 부위, 장면 전환, 여러 사람이 동시에 말할 때 표류했습니다. 오랫동안 '임시방편적인 리프싱크'의 표준이었던 것은 오픈 웨이브투립(Wav2Lip) (ACM Multimedia 2020)이었지만, 이 역시 편집에 필요한 것이 아니라 정지된 입 모양 하나에 국한되었습니다.
Synthesia Dubbing 2.0의 새로운 기능은 무엇인가?
요약하자면: 완전히 새로운 엔드 투 엔드 (end-to-end) 스택 — (벤더의 표현을 빌리자면) 최첨단 (state-of-the-art) 수준의 립 싱크 (lip sync) 모델, 원본의 타이밍을 유지하는 더 자연스러운 목소리와 번역이 도입되었습니다. 새로운 버전의 립 싱크는 무료이며 모든 요금제에 기본적으로 포함됩니다.
새로운 모델은 입의 미세한 움직임을 추적하며, 빠른 컷 편집, 장면 전환, 그리고 다중 화자 (multi-speaker) 장면에서도 프레임 단위의 정확도를 유지합니다. 폐쇄 (occlusions) 상황에 대한 처리 능력도 발표되었습니다. 즉, 화자의 입 앞을 무언가가 짧게 지나가더라도 동기화가 올바른 사람에게 유지됩니다. 조음 (articulation) 방식이 다른 두 언어인 영어와 일본어를 시연 쌍으로 사용했습니다.
동기화 기능 외에 세 가지 실용적인 요소가 추가되었습니다. 첫째, 두 가지 타이밍 모드입니다: Adaptive video duration (기본값, 번역된 음성 길이에 맞춰 영상이 조정됨; 교육용 콘텐츠에 권장됨) 및 Original video duration (영상이 기존대로 진행되며 음성만 조정됨). 둘째, 용어집 (glossary): 브랜드명, 제품명, 약어가 워크스페이스 전체에서 자동으로 일관되게 적용됩니다. 셋째, Enterprise 요금제 전용 기능: 크레딧 소모 없이 스크립트 및 번역 수정 가능, 전체 영상 대신 수정된 세그먼트만 재생성 가능; 수정 감사 로그 (audit-log) 기능은 출시 예정 (coming soon) 상태입니다.
공식 블로그 발표에는 Merck Group의 Florian Metz의 말이 인용되어 있습니다. 이는 마케팅 자료에 포함된 벤더 측의 인용구이므로, 독립적으로 검증할 수 없다는 점을 유념하십시오.
비디오를 더빙하는 방법: 무엇을 눌러야 하는가?
요약하자면: 파일을 업로드하거나 YouTube 링크를 입력하고, Lip Sync 스위치를 켠 뒤, 지속 시간 모드를 선택하고, 스크립트를 확인한 후 결과물을 받으면 됩니다. 2026년 7월 Synthesia 고객 센터 데이터에 따르면 전체 과정은 브라우저 내에서 이루어집니다.
순서는 다음과 같습니다:
- MP4, MOV 또는 WebM(최대 4K)을 업로드하거나 YouTube 링크를 붙여넣으세요. 원본 언어는 자동으로 감지됩니다. 주의: self-serve 요금제 사용자의 경우, YouTube 링크로 복제된 비디오는 게시할 수 없습니다.
- Lip Sync(립 싱크) 토글을 켭니다. 이 기능은 크레딧 소모를 두 배로 늘린다는 점을 유의하세요(자세한 내용은 아래 참조).
- 모드를 선택하세요: 학습용으로는 Adaptive(적응형)를, 프레임 내의 모든 시각적 강조가 중요한 경우에는 Original(원본) 모드를 선택합니다.
- 트랜스크립트(Transcript, 전사)와 번역 내용을 확인하세요. 자신만의 전문 용어는 미리 글로사리(Glossary, 용어집)에 등록해 두는 것이 좋습니다.
- 결과물을 받으세요: 각 언어별 MP4, WAV 오디오, SRT 또는 VTT 자막, 또는 다국어 플레이어가 포함된 통합 스마트 링크를 제공합니다.
만약 원본 오디오의 음질이 좋지 않다면, 업로드하기 전에 auphonic을 통해 오디오 트랙을 처리하세요. 이 서비스는 볼륨을 균일하게 맞추고 노이즈를 제거해 줍니다. 이는 매우 중요한데, 모델이 각 화자의 목소리를 개별적으로 클로닝(Cloning)하기 때문입니다. 원본 소스에 노이즈가 있으면 클로닝을 방해합니다.
실제 비용은 얼마인가요?
요약하자면: 립 싱크(Lip Sync) 기능 자체는 더 이상 별도로 판매되지 않지만, "무료"라고 해서 "비용이 들지 않는다"는 뜻은 아닙니다. Lip Sync 토글을 켜면 크레딧이 두 배로 소모되며, 사용 가능한 분량은 요금제에 따라 엄격히 제한됩니다. 가격은 2026년 7월 19일에 확인된 공식 요금제 페이지를 기준으로 합니다.
| 요금제 | 가격 | 월간 더빙 가능 시간 | 크레딧 | 더빙 지원 언어 |
|---|---|---|---|---|
| Basic | $0, 카드 등록 불필요 | 10분 | 월 1,200개 | 70개 이상 |
| ... |
예산을 결정짓는 두 가지 변수가 있습니다. 첫째, Lip Sync가 활성화되면 동일한 시간 대비 2배의 크레딧을 지불해야 합니다. 둘째, 출시 기념 프로모션으로 2026년 7월 15일부터 8월 15일까지 모든 사용자에게 매일 15분의 무료 더빙 시간을 제공하며, 총 450분 이상을 이용할 수 있습니다. 단, 사용하지 않은 분량은 소멸됩니다. CEO의 10분짜리 메시지는 일일 프로모션 할당량 안에 충분히 들어갑니다.

Dubbing 2.0은 Sync Labs 및 Kling의 내장 립 싱크와 무엇이 다른가요?
요약하자면: 세 가지 서로 다른 접근 방식입니다. Synthesia는 "업로드 후 영상 수령" 방식의 SaaS 파이프라인입니다. Sync Labs는 초 단위로 비용을 지불하는 립 싱크 (lip-sync) API를 판매합니다. Kling의 립 싱크 (lip sync)는 생성기 내에 내장되어 있으며 해당 서비스 내부에서만 작동합니다.
| Synthesia Dubbing 2.0 | Sync Labs (sync.so) | Kling | |
|---|---|---|---|
| 성격 | 전체 더빙: 번역, 음성, 동기화 | "순수" 립 싱크 (lip-sync) API | 클립 생성기의 기능 |
| ... |
Sync Labs의 가격은 2026년 7월 19일 기준 모델 문서에 근거합니다. 플래그십 모델인 sync-3는 4K 네이티브 (native), 오클루전 (occlusions) 및 프로필 뷰 (profile views) 처리 기능을 기본 제공하며, 활성 화자 탐지 (active speaker detection) 기능을 갖추고 있습니다. 또한 Kling, Sora, Veo, Runway의 AI 클립을 보통 3분 이내에 복제합니다. Kling은 자체적인 로직을 가지고 있습니다: TTS를 위한 텍스트를 제공하거나 오디오를 업로드하면 캐릭터의 입을 애니메이션화하지만, 이는 서비스 내부에서 생성된 클립(이미 6억 개 이상)에서만 가능합니다. Kling의 최신 기능인 elements는 완성된 영상의 더빙이 아니라 레퍼런스 (references)를 통해 캐릭터를 조립하는 것에 관한 것입니다.
선택은 작업 목적에 달려 있습니다: 촬영된 영상이 있고 "턴키 (turn-key)" 방식의 현지화가 필요하다면 Synthesia를, 초 단위 결제가 가능한 자체 파이프라인을 구축하려면 sync.so와 같은 API를, 생성기 내부에서 처음부터 촬영한다면 내장된 동기화 기능으로 충분합니다.
만약 번역, 음성 합성 (speech synthesis), 립 싱크 (lip-sync)를 포함한 이러한 현지화 파이프라인을 직접 구축하고자 한다면, 이 모든 모델 클래스는 provod.ai (러시아의 OpenRouter)의 단일 API에서 제공됩니다. 특정 파이프라인을 위해 해당 서비스에 사용 가능한 모델, 엔드포인트 (endpoints), 가격 및 코드 요구 사항을 확인하십시오.
기술이 어떻게 "스튜디오" 수준에 도달했나요?
요약하자면: Synthesia가 자체적인 DNA로 돌아온 것입니다. 이 회사는 2018년에 전문적인 립 싱크 (lip sync) 서비스로 시작되었으며, Dubbing 2.0은 셀프 서비스 (self-serve) 규모로 확장된 동일한 전략입니다.
2018년에 Synthesia는 스튜디오를 위한 "네이티브 더빙 (native dubbing)"을 수행했습니다: ENACT 도구, BBC와의 프로젝트, 그리고 Face2Face 팀 출신의 공동 창립자 Matthias Niessner가 참여했습니다 (2018년 11월 19일 fxguide 자료 기준). 이후 회사는 아바타 (avatars) 분야로 전환했고, 더빙은 반제품 상태로 남았습니다. 2025년 12월에는 스트리밍 방식의 비디오 번역 자동화를 위한 Dubbing API와 Assets API가 출시되었으며, 2026년 7월에는 스택 (stack) 전체를 재구축했습니다.
이와 병행하여 오픈 소스 기반이 성숙해졌습니다: 2020년의 Wav2Lip, 그 후 lipsync-2와 같은 제로샷 (zero-shot) 모델, 그리고 비디오 생성기 (video generators)의 내장된 동기화 기능이 등장했습니다. 어제까지만 해도 스튜디오가 필요했던 작업이 오늘날에는 브라우저의 스위치 하나로 가능해졌습니다. 이는 인상적이면서도 약간은 불안한 요소입니다. "무엇을 저렴한 번역으로 간주할 것인가"에 대한 시장 전체의 기준선이 방금 높아졌기 때문입니다.
Dubbing 2.0이 해결하지 못하는 것은?
요약하자면: 이 서비스는 주요 시각적 결함인 컷 전환 시의 싱크 어긋남 (out-of-sync)을 해결하고, 싱크 작업 자체에 대한 가격 장벽을 제거합니다. 하지만 분량 제한, 크레딧 (credits) 이중 소모, 언어적 한계, 원본에 대한 권리 및 모더레이션 (moderation) 문제는 여전히 남아 있습니다.
한계점에 대한 솔직한 목록:
- 분량 제한은 이월되지 않음: 셀프 서비스 (self-serve)의 경우 월 10분 또는 30분이며, 일일 프로모션 15분은 매일 소멸됩니다.
- 립 싱크 (Lip Sync) 포함 시 - 크레딧이 두 배로 소모됩니다. 긴 영상의 경우 이것이 예산의 결정적인 항목이 됩니다.
- Enterprise 요금제의 140개 이상의 언어와 달리, Basic, Starter, Creator 요금제는 70개 이상의 언어를 지원합니다. 1-Click Translations 또한 80개 이상의 언어를 지원하는 Enterprise 전용 기능입니다.
- 크레딧 소모 없이 전사 (transcript) 수정 가능 - Enterprise 요금제만 가능합니다. 셀프 서비스에서 원본에 오류가 있다면 모든 것을 다시 생성해야 합니다.
- 업로더는 반드시 비디오와 음성에 대한 권리를 보유해야 합니다. 모더레이션은 정치적, 차별적 및 기타 부적절한 콘텐츠를 자동으로 거부합니다. 그 외의 카테고리에 대해서는 제공업체의 최신 정책을 확인하십시오.
- 모든 비디오에 적합한 것은 아님: Sync Labs는 클래스의 한계를 명확히 기술하고 있습니다 - 활발한 언어적 안면 근육 움직임 (speech-based facial mimicry)이 필요합니다 (모델은 2초 단위의 청크 (chunks)로 작동하므로, 정지 화면이나 정적인 상태는 동기화되지 않음). 인간과 유사한 (human-like) 얼굴만 가능하며, 극단적인 측면 프로필은 결과를 악화시킵니다. 노래나 합창은 이러한 시스템이 감당하지 못합니다: 모델이 포착할 수 있는 언어적 안면 근육 움직임이 없기 때문입니다.
provod.ai가 적합하지 않은 경우
요약하자면: 애그리게이터(Aggregator)는 Synthesia의 자체 스튜디오를 대체할 수 없으며, 일회성 작업에는 필요하지 않습니다. 이 서비스의 역할은 실제 사용량에 따라 비용을 지불하는 스트리밍 로컬라이제이션 (Streaming Localization)입니다.
Synthesia의 고유한 워크플로우(Flow) — 브라우저 기반 스튜디오, 아바타(Avatar), 립 싱크 (Lip Sync) 토글 스위치, 엔터프라이즈급 세그먼트별 편집 — 가 필요하다면 벤더(Vendor)의 직접 구독이 필요합니다. API를 통해서는 이러한 인터페이스를 얻을 수 없습니다. 분기에 한 번, 10분 정도의 더빙이 필요한가요? 그렇다면 Synthesia 자체의 무료 Basic 플랜을 사용하는 것이 더 간단합니다. 하지만 번역, 음성 녹음, 동기화, 컷 편집 등 로컬라이제이션 (Localization)이 스트리밍 방식으로 이루어지고, 단일 잔액으로 실제 사용된 초 단위만큼만 비용을 지불하고 싶다면, 구독보다 통합 API가 더 적합합니다.
클러스터 검색어 사전
요약하자면: 립 싱크 (Lip Sync) 주제와 함께 검색어는 브랜드 오타, 전화 관련 질문, 음악 및 일상생활과 같은 인접한 표현들을 함께 끌어옵니다. 이를 더빙과 혼동하지 않도록 분류해 두었습니다.
비디오 생성기 및 관련 왜곡 검색어
-
"klin" - 비디오 생성기인 Kling의 오타.
-
"klinik" - Kling의 또 다른 오타이며, 병원(Clinic)과는 관련이 없습니다.
-
"шот" - Kling 클립 관련 검색어의 파편 ("мультя шота").
-
"кл" - "클립 (Clip)" 또는 "Kling"의 파편.
-
"ки" - 애니메이션 관련 검색어의 파편.
-
"пикачу" - 포켓몬 피카츄; Pika Labs가 아니라 음악을 검색한 것입니다.
-
"boost" - "pika boost" 검색어의 뒷부분이며, 의미가 불분명합니다.
-
"diller" - "pika diller", 아마도 닉네임이거나 오타일 것입니다.
-
"effected" - "pika effected", Pika의 효과(Effect)에 관한 것입니다.
-
"xd" - "pika xd", 기능이 아닌 감정 표현입니다.
-
"уе" - "pika уе", 의미 없는 검색어 파편입니다.
-
"tikkurila" - Tikkurila 페인트; Pika와의 발음 유사성 때문에 포함되었습니다.
-
"vinha" - 동일한 페인트 브랜드의 조색 시스템입니다.
-
"Banana" - Nano Banana, 이미지 편집 모델입니다.
-
"AnythingLLM" - LLM을 위한 로컬 채팅 클라이언트입니다.
-
"kt" - Midjourney 관련 검색어의 파편.
-
"kontakt" - "flux kontakt", Flux의 Kontext를 잘못 표기한 것입니다.
-
"klap" - 영상 편집 서비스인 Klap입니다.
-
"skild" - Skild AI, 이는 로보틱스(Robotics) 분야입니다.
-
"spore" - 게임 Spore, 사람들이 게임 내에서 "grok"를 만드는 것과 관련이 있습니다.
-
«tik» - 음악 검색어에서 유래한 TikTok의 파편.
채팅, 접속 및 설치
- «cht» - ChatGPT의 오타.
- «тык» - chatgpt.com 주소를 변형하여 입력한 것.
- «ka» - «ai ka digital singer» 검색어에서 유래한 음악 관련 용어.
- «taki» - «beni ai taki», 다시 음악 관련.
- «pa» - Gemini 관련 검색어의 파편.
- «pk» - PC에 챗봇(Chatbot)을 설치하는 것.
- «py» - Stable Diffusion의 Python 스크립트 실행.
- «поч» - «поч дипсик не работает(왜 DeepSeek이 작동하지 않나요)», 불만 사항.
- «соо» - «как удалить соо в дипсик(DeepSeek에서 메시지를 어떻게 삭제하나요)», 메시지 관련.
- «лк» - «дипсик вход в лк(DeepSeek 개인 계정 로그인)», 개인 계정(Personal Account).
- «вка» - VKontakte의 역할극(Roleplay) 채팅.
- «ек» - «клип есенин ек жалеть(예세닌 클립 ek zhaleть)», 음악 검색어.
- «кел» - «милс кел гигачат(mils kel gigachat)», 닉네임 또는 오타.
- «созд» - 신경망(Neural Network) 관련 검색어에서 유래한 «создать(생성하다/만들다)」의 파편.
전화기, 결제 및 음성 비서
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기