
“다스 베이더의 목소리 신경망”과 생성형 NPC: 2026년에 실제로 플레이 가능한 것은 무엇인가
요약
Fortnite에 도입된 다스 베이더 AI NPC는 Google Gemini 2.0 Flash와 ElevenLabs Flash v2.5를 결합하여 실시간 대화 기능을 구현했습니다. 이는 단순한 데모를 넘어 공식적인 권리 승인을 통해 게임 내 실제 기능으로 작동하는 생성형 NPC의 사례를 보여줍니다.
핵심 포인트
- Gemini 2.0 Flash와 ElevenLabs를 결합한 대화형 AI 시스템 구현
- 성우의 권리 양도 및 가족의 공식 승인을 통한 법적 정당성 확보
- 욕설 및 부적절한 대화를 방지하기 위한 엄격한 필터링 시스템 적용
- 사용자 음성 데이터를 학습에 사용하지 않는 개인정보 보호 정책 준수
2025년 5월 16일, Fortnite 플레이어들은 "스타워즈 (Star Wars)" 팬들이 꿈만 꾸던 메커니즘을 경험했습니다. 보스로서 다스 베이더 (Darth Vader)를 물리치고 그를 팀원으로 영입하여 목소리로 대화하면, 그는 2024년에 사망한 제임스 얼 존스 (James Earl Jones)의 목소리로 대답합니다. 출시 당일 The Verge와 The Hollywood Reporter는 대화의 의미는 Google Gemini 2.0 Flash가 담당하고, 음색은 ElevenLabs Flash v2.5가 담당한다고 보도했습니다.
지난 1년 동안 수천 명의 사람들이 검색창에 “다스 베이더의 목소리 신경망 (voice Darth Vader neural network)”을 입력했습니다. 어떤 이들은 이것이 가짜인지 확인하려 했고, 다른 이들은 모드(mod), 영상 또는 밈(meme)을 만들기 위해 집에서 어떻게 이를 재현할 수 있을지 알고 싶어 했습니다. 첫 번째 질문에 대한 답변은 짧습니다. 가짜가 아닙니다. 두 번째 질문에 대한 답변은 기사 한 편 분량이 필요합니다. 왜냐하면 지난 1년 동안 업계는 역사상 가장 긴 성우 파업을 겪었고, Epic Games에 맞선 노동조합의 소송을 경험했기 때문입니다.
핵심 논지는 이렇습니다. 2026년의 “캐릭터와 대화하기”는 전시회의 데모가 아니라 대중적인 게임의 작동 가능한 기능입니다. 하지만 타인의 목소리로 가는 합법적인 길은 오직 공식적인 구현과 소유자의 동의를 통해서만 가능합니다. 아래에서는 2026년 7월 기준으로 실제로 플레이 가능한 것, 티저로 남은 것, 그리고 법적 경계가 어디에 있는지를 다룹니다.
Epic이 2025년 5월 16일 Fortnite에 출시한 것은 정확히 무엇인가?
요약하자면, 두 개의 신경망(neural networks)을 결합한 완전한 대화형 컴패니언(companion)입니다. Gemini 2.0 Flash가 답변의 의미를 생성하고, ElevenLabs Flash v2.5가 제임스 얼 존스의 목소리를 합성합니다. 배우는 생전이었던 2022년에 AI 목소리 재현 권한을 이미 양도했습니다. 당시에는 시리즈 "오비완 케노비 (Obi-Wan Kenobi)"를 위해 우크라이나 기업인 Respeecher가 베이더의 목소리를 연기했습니다. 존스의 가족은 Fortnite와의 협업을 공식적으로 승인했습니다. 가족 측의 발표에 따르면, 제임스 얼는 베이더의 목소리가 "스타워즈 (Star Wars)"의 역사와 분리될 수 없다고 생각했습니다 (The Hollywood Reporter, 2025.05.16).
초기 몇 시간의 운영은 우리가 무엇을 마주하게 될지를 보여주었습니다. 스트리머 Loserfruit가 AI Vader가 욕설을 하게 만들자, Epic은 GamesRadar과 The Verge의 보도에 따르면 30분 이내에 핫픽스(hotfix)를 출시했습니다. 이후 필터링 시스템이 엄격한 경계선을 설정했습니다. Vader는 로맨틱한 대화에 참여하지 않으며, 모욕적인 언사를 반복하지 않고, 자해에 관한 대화 시에는 도움을 요청하도록 안내합니다. 13세 미만 또는 해당 지역의 디지털 동의 연령에 도달하지 않은 플레이어는 부모의 허가가 필요합니다.
개인정보 보호(privacy)와 관련하여 Epic은 FAQ를 통해 직접적으로 설명했습니다: 플레이어의 음성 오디오는 답변 생성을 위해 Gemini로 직접 전송되지만, 저장되거나 모델 학습에 사용되지는 않습니다. Epic은 신고(complaint)에 대비하여 Vader의 대사 트랜스크립트(transcript)만을 보유합니다. 많은 이들이 뒤늦게 알게 되는 제한 사항은 AI Vader가 영어로만 말한다는 점입니다.
이 시스템의 이면에는 음성 인식(speech recognition), 언어 모델(language model), 음성 합성(voice synthesis)이라는 세 가지 고리의 체인이 존재합니다. 오늘날 자신의 영상, 모드(mod) 또는 봇(bot)을 위해 이와 유사한 체인을 구축하는 것은 Disney 스튜디오 없이도 가능합니다: provod.ai (러시아의 OpenRouter)에서는 세 가지 유형의 모델을 모두 하나의 API를 통해 사용할 수 있으며, 러시아 카드로 결제도 가능합니다. 실습 부분은 아래에서 다시 다루기로 하고, 우선 왜 이 출시로 인해 소송이 제기되었는지 살펴보겠습니다.
왜 Vader의 목소리 때문에 소송이 제기되었는가 - 그리고 배우들의 파업은 어떻게 끝났는가?
요약하자면: 노동조합인 SAG-AFTRA는 파업 기간 중 노조에 대한 통지나 협상 없이 출시가 진행되었다고 주장하며 불만을 제기했습니다. 2025년 5월 19일, 출시 3일 후, 노조는 Epic Games의 자회사인 Llama Productions를 상대로 노조와의 통지 및 협상 없이 AI 음성을 배포한 부당 노동 행위에 대해 국가 노동 관계 위원회(National Labor Relations Board)에 고발을 접수했습니다 (ScreenHub, 2025.07.10; Creative Labour Critical Futures 트래커).
맥락을 살펴보면 이 고발 내용이 더욱 명확해집니다. 비디오 게임 성우들의 파업은 2024년 7월 26일에 시작되어 Activision, EA, Disney Character Voices, Epic/Llama, Insomniac, Take-Two, WB Games 및 기타 9개 기업을 상대로 11개월 동안 이어졌습니다. 논쟁의 핵심은 바로 동의와 보상 없는 음성 복제(Voice Cloning) 및 디지털 복제(Digital Replicas)였습니다. 그리고 이 갈등의 한복판에서, 지구상에서 가장 큰 게임 속에서 사망한 배우의 목소리가 울려 퍼졌습니다. Jones의 가족은 동의했지만, Epic은 현직 배우들과는 합의에 도달하지 못했습니다.
결론은 2025년 7월 9~10일에 났습니다. 새로운 상호작용 미디어 협약(Interactive Media Agreement)이 95.04%의 찬성표로 비준되었습니다 (ScreenHub, Eurogamer, 2025.07.10). 배우들은 즉시 15.17%의 임금 인상과 더불어 2025년, 2026년, 2027년 매년 11월마다 3%씩 추가 인상을 이끌어냈습니다. 우리 주제와 관련하여 가장 중요한 점은 AI 복제본(AI Replicas)을 생성할 때 동의와 정보 공개를 의무화했다는 점이며, 파업 기간 동안 동의를 일시 중단할 수 있는 권리도 포함되었다는 것입니다. 음성 디지털 트윈(Digital Twin)은 이제 회색 지대가 아닌 계약의 대상이 되었습니다.
생성형 NPC가 이미 적용된 게임은 무엇인가?
요약하자면, 2026년 7월 기준으로 최소 6개의 출시작과 1개의 모드에서 확인됩니다. NVIDIA ACE는 기술 데모(Tech Demo) 단계를 벗어났습니다. 자율형 AI 캐릭터를 탑재한 게임들을 오늘 밤 바로 플레이할 수 있습니다 (Gaming Style, 2026.05.31).
| 프로젝트 | AI 역할 | 목소리 | 2026년 7월 기준 상태 | 체험 방법 |
|---|---|---|---|---|
| Fortnite | 베이더와의 대화: 의미 - Gemini 2.0 Flash, 음색 - ElevenLabs Flash v2.5 | 예, 제임스 얼 존스 (James Earl Jones) | 2025년 5월 16일 출시 | Fortnite 클라이언트, 분대 음성 채팅 |
| ... |
표의 두 가지 세부 사항은 별도의 단락으로 다룰 가치가 있습니다. KRAFTON의 inZOI는 사용자의 그래픽 카드(GPU)에서 직접 모델을 구동합니다: '교육받은' Zoi는 길을 잃은 행인을 직접 안내하거나 배고픈 이들에게 먹이를 주고, 하루 일과가 끝나면 일정을 재조정하며, 플레이어는 자유로운 텍스트로 캐릭터의 행동을 다시 작성할 수 있습니다 (Gaming Style, 2026.05.31; Manifold Markets 기술 분석). 그리고 miHoYo의 공동 창립자인 Cai Haoyu가 설립한 스튜디오 Anuttacon의 Whispers from the Star는 FPT(First-Person Talker)라는 새로운 장르를 고안했습니다. 대화 트리(Dialogue Tree) 없이, 오직 목소리로 구조하는 우주비행사와 생생하게 대화하는 방식입니다. 이 게임은 Steam에서 92~95%의 '매우 긍정적' 평가를 받았습니다 (Notebookcheck, 2025.08.15).

무엇이 아직 티저(Teaser)로 남아있는가?
요약하자면: PUBG와 Ubisoft의 화려한 발표들은 실제 출시로 이어지지 않았습니다. 발표는 출시가 아니며, 2026년에는 이 차이가 특히 명확하게 드러납니다.
PUBG: Battlegrounds는 KRAFTON의 AI 파트너인 PUBG Ally와 로컬 모델 Mistral-Nemo-Minitron-8B 기반의 NVIDIA ACE를 기다리고 있습니다. 데모는 CES 2025에서 공개되었으며, 2026년 1월 5일 NVIDIA는 장기 기억(Long-term Memory) 기능을 갖춘 업데이트를 발표했습니다. Ally는 이전 매치들을 기억할 것을 약속하며, 2026년 상반기에 영어, 한국어, 중국어로 공개 테스트를 진행할 예정입니다 (yenra.com, 2026.03.21; powerupgaming.co.uk, 2026.02.16). 공개 테스트는 2026년 상반기로 발표되었습니다.
Ubisoft는 GDC 2024에서 Inworld 엔진 기반의 NEO NPC를 선보였으나, 2026년 3월까지도 이 프로젝트는 실제 출시 게임에 적용되지 못한 채 "Teammates" 프로토타입으로 진화했습니다 (Wanderfolk, 2026.03.29). Creative Assembly는 Total War: PHARAOH에서 자연어 질문이 가능한 AI 어드바이저를 테스트 중이지만, 실험적 버전이 약 6GB의 VRAM을 소모하여 진입 장벽이 높습니다. 배경 상황을 살펴보면, SmartDev/Aream & Co.의 데이터에 따라 Steam의 게임 7,818개가 이미 생성형 AI (Generative AI) 사용을 공개했으며, 이는 2025년 신작의 약 20%에 해당합니다.
왜 업계의 절반은 생성형 AI를 의심의 눈초리로 바라보는가?
요약하자면, 문제의 핵심은 일자리와 자신의 목소리에 대한 통제권이기 때문입니다. 2026년 3월 GDC State of the Game Industry 보고서에 따르면, 업계 전문가의 36%가 업무에 생성형 AI를 사용하고 있지만, 52%는 그것이 산업에 미치는 영향이 부정적이라고 생각합니다 (yenra.com, 2026.03.21). 사용은 하고 있지만, 인상을 찌푸리고 있는 것입니다.
가장 강력한 거부 의사를 밝힌 인물은 Take-Two의 수장인 Strauss Zelnick입니다. 그는 GTA 6에 대해 "생성형 AI는 Rockstar Games가 만드는 것에 전혀 참여하지 않는다"라고 말했습니다 (Huxiu, 2026.04.11). 올해 최대 규모의 출시작이 의도적으로 생성형 AI를 배제하고 있으며, 이 또한 하나의 입장입니다.
여기서 제가 우려하는 점은 이것입니다. AAA급 게임사들이 논쟁하며 프로토타입 단계에서 머뭇거리는 동안, 실제로 플레이하고 있는 것은 인디 게임사와 모더(Modder)들입니다. Suck Up!은 AI 캐릭터를 목소리로 속이는 것을 게임플레이 전체의 핵심으로 구축했으며, Mantella 제작자들은 10년 전 게임 속 2,500명의 NPC에게 대화 능력을 부여했습니다. 선구자가 된 이들은 예산이 풍부한 이들이 아니라, 직접 해보고 싶어 안달이 난 사람들이었습니다.
캐릭터의 목소리를 직접 복제할 수 있는가 — 그리고 그 경계는 어디인가?
요약하자면: 기술적으로는 오래전부터 가능했지만, 법적으로는 지뢰밭입니다. 합법적인 경로는 세 가지입니다: AI-Vader와 같은 공식적인 구현, 라이선스가 부여된 합성 목소리, 그리고 본인의 목소리입니다. 소유자의 동의 없이 타인의 목소리를 복제하는 것은 이미 Epic Games 사례에서 폭발해버린 바로 그 지뢰밭이며, 당시 Epic은 Jones 가족의 권리를 가지고 있었습니다.
러시아의 사례는 시사하는 바가 큽니다. SteosVoice/CyberVoice 음성 합성 서비스들은 "게랄트의 목소리"로 텍스트를 더빙해 준다고 공개적으로 제안하며, "위쳐 3"의 게랄트, "매트릭스"의 네오, "슈렉"의 장화 신은 고양이 목소리를 맡은 성우 세보로드 쿠즈네초프(Vsevolod Kuznetsov)를 직접적으로 언급하고 있습니다 (CyberVoice.io, 2025-2026 업데이트; recsquare.ru의 전기 참조). 해당 서비스 페이지 어디에서도 그의 목소리에 대한 라이선스 언급은 찾아볼 수 없습니다. 검색 쿼리를 살펴보면 사람들은 다른 목소리들도 찾고 있습니다: 볼로다르스키(Volodarsky)의 신경 목소리, 레오니드 카네프스키(Leonid Kanevsky)의 목소리, 니콜라이 드로즈도프(Nikolay Drozdov)의 목소리, 그리고 S.T.A.L.K.E.R.의 강도 목소리 등입니다. 수요는 상업적이지만, 이러한 제안들의 법적 근거는 의문스럽습니다.
두 번째 경계는 플랫폼 측면입니다. Fortnite에서는 구체적인 제한 사항들이 문서화되어 있습니다: 베이더는 로맨틱한 대화에 참여하지 않으며, 모욕적인 언사를 반복하지 않고, 자해에 관한 대화 시에는 도움을 받도록 안내합니다. 세 번째 경계는 계약 측면입니다: 2025년 SAG-AFTRA 계약 이후, 미국 배우들의 경우 동의 없는 디지털 음성 복제는 노동법의 범위를 벗어납니다. /
2026년에 직접 말하는 NPC를 만드는 방법은?
요약하자면: 베이더의 3단계 체인인 음성 인식 (Speech Recognition), 언어 모델 (Language Model), 음성 합성 (Speech Synthesis)을 반복하면 됩니다. 모드(Mod) 제작에는 가정용 PC로 충분하며, 영상 제작의 경우에는 클라우드(Cloud)를 활용할 수도 있습니다. 아래는 특정 엔진에 대한 튜토리얼이 아니라, 위 표의 사례들로 검증된 프레임워크(Framework)입니다.
- 과업을 정의하세요. 게임 모드, 영상 더빙, 메신저 봇 등 목적에 따라 모델을 어디에서 구동할지(로컬 또는 클라우드)가 결정됩니다.
- 음성 인식 (ASR)은 당신의 목소리를 텍스트로 변환합니다. Fortnite에서는 이 단계가 채팅 내부에 숨겨져 있지만, Mantella에서는 별도의 단계로 존재합니다.
- 언어 모델 (Language Model)이 답변을 작성합니다. inZOI에서는 로컬에서 작동하며 약 1GB의 VRAM을 소모하지만, Total War: PHARAOH의 실험적인 고문(Advisor)은 이미 약 6GB의 VRAM을 사용합니다. 1GB의 VRAM은 inZOI의 특정 모델 기준이며, 선택한 런타임 (Runtime)의 요구 사항은 별도로 확인해야 합니다.
- 음성 합성 (TTS)이 답변을 소리로 출력합니다. 본인의 목소리를 사용하거나 라이선스를 가진 합성 음성을 사용하세요. 타인의 식별 가능한 음색을 사용하는 것은 피해야 하며, 이에 대한 경계는 위에서 설명했습니다.
- Fortnite 스트리머들처럼 욕설이 포함된 첫 영상이 나온 뒤에 대처하지 말고, 필터와 로그를 미리 준비하세요.
무료로 시작하는 방법도 있습니다. 사람들은 러시아어로 "딥치(deepchik)"와 같은 검색어를 통해 무료 신경망을 찾으며, 이는 첫 실험을 하기에 충분합니다. 비용을 지불하기 전에 대사의 품질을 확인할 수 있기 때문입니다. 만약 모드용 에셋 (Asset) 단계로 넘어간다면, 래스터 이미지의 벡터화 (Vectorization)가 별도의 주제로 떠오를 것입니다. 이는 그래픽에 관한 것이지 음성에 관한 것이 아니니 혼동하지 마세요.
이러한 전체 파이프라인 (Pipeline)은 러시아에서도 단 두 줄의 코드 변경만으로 구축할 수 있습니다. 키(Key)와 base_url을 단일 API인 provod.ai로 변경하면 됩니다. 이 API는 OpenAI-SDK (/v1/chat/completions) 및 Anthropic (/v1/messages)과 호환되므로, 호환되는 클라이언트, 봇, IDE를 코드 재작성 없이 그대로 사용할 수 있습니다.
이 기술이 해결하지 못하는 것은 무엇인가?
요약하자면: 언어, 하드웨어, 몰입감, 그리고 권리입니다. 이것이 현재 대화형 NPC가 부딪히고 있는 네 가지 장벽입니다.
Vader는 영어로만 말합니다. 러시아어 음성은 지원하지 않으며, 표에 있는 다른 프로젝트들 역시 러시아어 지원을 명시하지 않았습니다. 로컬 모델 (Local models)은 비디오 메모리 (VRAM) 문제에 부딪힙니다. inZOI의 1GB는 그나마 괜찮지만, Total War 어드바이저의 6GB는 이미 가정용 PC 절반을 탈락시키는 수준입니다. 안전 필터 (Safety filters)는 역할극 (Role-playing)을 망가뜨립니다. 욕설을 거부하는 캐릭터는 악당이 아니라 고객 지원 상담원처럼 행동하게 됩니다. 그리고 가장 중요한 점은, 어떤 API도 타인의 목소리에 대한 권한을 부여하지 않는다는 것입니다. 이는 구독이 아닌 계약을 통해 해결해야 할 문제입니다.
provod.ai가 적합하지 않은 경우
요약하자면: 타인의 라이선스된 목소리, 즉시 사용 가능한 게임 모드, 온프레미스 (On-prem) 구축, 그리고 단일 모델을 통한 24시간 채팅 — 이 네 가지 시나리오에서는 애그리게이터 (Aggregator)가 당신의 과제를 해결해 줄 수 없습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기