
3초의 도난: AI 음성 사기가 모든 방어 체계를 앞지르는 이유
요약
AI 음성 합성 기술을 이용한 사기가 급증하며 막대한 금융 피해를 야기하고 있습니다. FBI 보고서에 따르면 AI 관련 범죄로 인한 손실액은 8억 9,300만 달러를 넘어섰으며, 특히 노년층이 주요 표적이 되고 있습니다.
핵심 포인트
- AI 음성 복제 기술을 활용한 정교한 금융 사기 증가
- FBI, AI 기반 범죄를 별도 범주로 분류할 만큼 심각성 고조
- 60세 이상 노년층이 AI 금융 범죄의 주요 타겟
- 신고된 피해액은 실제 발생한 피해 규모의 하한선일 가능성
3초의 도난: AI 음성 사기가 모든 방어 체계를 앞지르는 이유

Sharon Brightwell는 전화기 너머로 딸이 울고 있는 소리를 들었고, 그것은 그녀가 세울 수 있었던 그 어떤 방어책도 무력화시켰습니다. 그 목소리는 April의 것이라고 모든 본능이 확신했습니다. 고통에 빠진 젊은 여성 특유의 동일한 음색과 동일한 끊어지는 리듬을 가지고 있었기 때문입니다. 목소리는 그녀가 운전 중에 문자를 보내다가 임신한 여성을 쳤으며, 경찰에게 휴대전화를 압수당했다고 말했습니다. 이어 한 남성이 전화를 넘겨받아 자신을 April의 변호사라고 소개하며, 보석금으로 현금 15,000달러가 필요하다고 설명했습니다. 그는 Brightwell에게 은행에 돈의 용도를 말하지 말라고 경고했는데, 딸의 신용에 해가 될 수 있기 때문이라고 했습니다. 한 시간도 채 되지 않아, 플로리다주 Dover 출신의 이 은퇴자는 돈을 인출하여 법원과 관련이 있다고 믿은 퀵서비스 기사에게 전달했습니다. 오전 내내 직장에서 시간을 보냈고 자동차 사고 근처에도 간 적이 없는 진짜 April에게 연락이 닿고 나서야, 그녀는 딸이 전화를 건 것이 아니라는 사실을 깨달았습니다. 인간이 건 것이 아니었습니다. 울음소리는 오디오 파편으로부터 합성(synthesised)된 것이었으며, 그녀가 구하고 있다고 믿었던 딸은 타인의 기계 속 숫자 패턴으로만 존재했습니다.
2025년 여름 미국 지역 뉴스 전반에 보도된 Brightwell의 피해는 이제 미국에서 가장 흔한 범죄 중 하나가 되었습니다. 또한 가장 기술적으로 진보된 범죄 중 하나이기도 합니다. 머신 러닝 (machine learning)의 최첨단 기술을 요구하는 사기가 평범한 할머니의 주방에서, 대규모로, 비용 한 푼 들지 않고 자행될 수 있다는 이 두 가지 사실의 충돌은, 법 집행 기관, 은행, 통신사 및 규제 기관들이 지난 2년 동안 막으려 노력했으나 실패해 온 문제의 결정적인 특징입니다. 문제는 이제 기술이 작동하느냐가 아닙니다. 기술은 끔찍할 정도로 잘 작동합니다. 문제는 공격의 정교함과 대상의 인지 능력 사이의 격차가 몇 달이 아닌 몇 년 단위로 측정될 때, 어떤 의미 있는 보호 조치가 필요한가 하는 점입니다.
26년 된 장부의 새로운 기록
2026년 4월, FBI의 인터넷 범죄 신고 센터(Internet Crime Complaint Center)는 전년도 온라인 범죄에 관한 연례 보고서를 발표했으며, 보고서가 작성된 26년 역사상 처음으로 인공지능(AI) 기반 사기를 별도의 범주로 분류했습니다. 수치는 극명했습니다. FBI는 AI와 연관된 신고를 22,000건 이상 기록했으며, 조정된 손실액은 8억 9,300만 달러를 초과했습니다. 이 금액 중 3억 5,200만 달러의 손실은 60세 이상의 피해자들에게 발생한 것으로 나타났으며, 이는 노년층이 AI 기반 금융 범죄에서 가장 집중적으로 표적이 되는 인구 집단임을 보여줍니다. AI 관련 수치는 훨씬 더 큰 전체 규모 안에 포함되어 있습니다. 미국의 사이버 범죄(cybercrime) 손실액은 단 1년 만에 26% 증가하여 209억 달러에 달했으며, 그중 60세 이상의 미국인이 차지하는 비중은 77억 달러로 전년 대비 약 60% 급증했습니다.
FBI는 이러한 수치조차 문제의 심각성을 과소평가하고 있다고 솔직하게 밝혔습니다. 보고서의 AI 귀속(AI attribution) 수치는 피해자들이 인지하고 신고한 내용만을 반영하며, 목소리 복제(cloned-voice) 전화를 받은 대부분의 피해자는 기계가 개입되었다는 사실조차 전혀 알지 못합니다. 그들은 샤론 브라이트웰(Sharon Brightwell)이 처음에 믿었던 것처럼, 자신의 자녀와 대화하고 있다고 믿습니다. 따라서 8억 9,300만 달러라는 금액은 상한선이 아닌 하한선으로 해석하는 것이 가장 적절합니다. 이는 그 본질상 피해를 입는 사람들에게 보이지 않도록 설계된 범주의 가시적인 부분일 뿐입니다. FBI가 이 범주를 만들어야 할 필요성을 느꼈다는 사실 자체가 하나의 신호입니다. 범죄 통계는 보수적인 도구입니다. 기관들은 일시적인 유행 때문에 26년 된 보고 분류 체계(taxonomies)를 다시 그리지는 않습니다. 장부에 새로 그어진 이 선은, 불과 3년 전만 해도 소비자용 형태로는 거의 존재하지 않았던 도구가 이제는 절도의 주류 수단이 되었음을 인정하는 것입니다.
국제적으로 상황은 더 광범위하며 악화되고 있습니다. 2026년 3월, INTERPOL은 '글로벌 금융 사기 위협 평가(Global Financial Fraud Threat Assessment)' 제2판을 발표하며, 2025년 전 세계 금융 사기로 인한 손실액을 4,420억 달러로 추산했습니다. 이는 덴마크의 연간 경제 총생산과 맞먹는 금액입니다. INTERPOL은 위협 궤도를 '상승 중'으로 평가하며, 이른바 '사기의 산업화(industrialisation of fraud)'라고 명명한 현상을 설명했습니다. 즉, 사기 수법이 기회주의적인 개인의 차원에서 인신매매 및 사이버 범죄와 결합된 조직적이고 초국가적인 운영 체제로 이동하고 있다는 것입니다. 결정적으로, INTERPOL은 AI로 강화된 사기가 전통적인 사기보다 약 4.5배 더 수익성이 높으며, 소위 에이전틱 AI (agentic AI) 시스템이 이제 정찰부터 몸값 요구에 이르기까지 전체 사기 캠페인을 자율적으로 계획하고 실행할 수 있다는 사실을 발견했습니다. 다시 말해, 경제적 논리가 역전된 것입니다. 사상 처음으로, 산업적 규모의 기망 행위는 제조 비용이 거의 들지 않으면서도 막대한 부를 가져다주고 있습니다.
3초면 충분하다
조부모 사기(grandparent scam)의 중심에 있는 기술적 능력은 설명하기가 잔인할 정도로 단순합니다. 현대적인 AI 음성 복제 (voice-cloning) 시스템은 단 3초의 오디오만 있으면 실제 원본과 실질적으로 구별할 수 없는 합성 음성을 만들어낼 수 있습니다. 3초는 음성 사서함 인사말, 팟캐스트의 한 조각, 혹은 공개된 인스타그램 계정에 게시된 생일 영상의 오디오 길이와 같습니다. 원재료는 보안 데이터베이스에서 도난당하는 것이 아닙니다. 기록되는 삶을 살아가는 평범한 일상에 의해 매일 자발적으로 제공됩니다. 단 하나의 TikTok 클립에 등장한 손주가 사기꾼이 자신의 납치 상황을 조작하는 데 필요한 모든 것을 제공한 셈입니다.
이 위협을 더욱 심각하게 만드는 것은 단순히 복제 기술이 작동한다는 사실뿐만 아니라, 이를 수행하는 도구들이 저렴하고 풍부하며 거의 완전히 규제의 사각지대에 놓여 있다는 점입니다. 2025년 3월, Consumer Reports는 Descript, ElevenLabs, Lovo, PlayHT, Resemble AI, Speechify 등 6개 기업의 음성 복제 (voice-cloning) 제품을 평가했으며, 대다수가 사기나 오용에 대한 의미 있는 안전장치가 부족하다고 결론지었습니다. 해당 기관은 조사 결과, 4개의 제품이 사용자가 해당 목소리를 복제할 법적 권리가 있음을 확인하는 체크박스에 표시하기만 하면 되도록 설계되어 있음을 발견했습니다. 이 4개 제품 중 그 어떤 것도 화자가 실제로 동의했는지 확인하거나, 복제를 사용자의 본인 목소리로만 제한하는 기술적 메커니즘을 채택하지 않았습니다. 6개 기업 중 4개는 계정을 개설하는 데 이름이나 이메일 주소 외에는 아무것도 요구하지 않았습니다. NBC News와 The Register를 통해 확산된 이 조사의 냉혹한 결론은, 업계가 누구든 사칭할 수 있는 도구를 만들어 놓고는 그 뒤에 '자기 확인 (self-attestation)' 체크박스 하나만을 배치해 두었다는 것입니다.
가장 저명한 제공업체 중 하나인 ElevenLabs는 다층적인 안전 프로그램(multi-layered safety programme)을 강조합니다. 여기에는 사칭을 금지하는 사용 금지 정책 (prohibited-use policy), 자사 시스템에서 생성되었을 가능성이 높은 오디오를 식별할 수 있는 공개 AI 음성 분류기 (AI speech classifier), 생성된 콘텐츠를 이를 생성한 계정으로 연결하는 추적성 (traceability), 그리고 선거 주기 동안 특정 보호 대상 인물의 복제를 차단하는 "금지된 목소리 (no-go voices)" 안전장치가 포함됩니다. 이는 사소한 조치가 아니며, 여러 경쟁사가 제공하는 것보다 더 많은 기능을 갖추고 있습니다. 하지만 이들은 구조적인 약점을 공유하고 있습니다. 거의 모든 조치가 사후에 작동한다는 점입니다. 이러한 조치들은 사기가 이미 발생하고 피해자가 이미 저축한 돈을 모두 잃은 뒤에야 수사관들이 출처 (provenance)를 파악하는 데 도움을 줄 뿐입니다.
이러한 방식은 애초에 3초짜리 복제본이 생성되는 것을 방지하는 데는 거의 도움이 되지 않습니다. 왜냐냐하면 이를 방지할 수 있는 수단인 '복제 대상자가 동의했음을 증명하는 강력하고 의무적인 검증 (robust, mandatory verification)'이야말로, 경쟁이 치열하고 빠르게 움직이는 시장이 스스로에게 부과하기를 꺼리는 마찰 (friction)이기 때문입니다. 보호 장치가 기업의 전환율 (conversions)을 떨어뜨리고 오직 경쟁사의 고객만을 보호하게 될 때, 시장은 이를 자발적으로 공급하지 않을 것입니다. 실제로 지금까지 그러해 왔습니다.
시력을 잃어버린 포렌식 권위자
탐지 기반의 방어 체계가 왜 실패하고 있는지를 보여주는 단 하나의 순간이 있다면, 그것은 2026년 6월에 발행된 New York Times의 프로필 기사에 담겨 있습니다. 그 기사의 주인공은 딥페이크 포렌식 (deepfake forensics) 분야에서 광범위한 합의를 통해 세계 최고의 권위자로 인정받는 UC 버클리(University of California, Berkeley)의 Hany Farid 교수였습니다. Farid는 20년 넘게 정부, 인권 단체, 언론인, 그리고 법 집행 기관의 요청을 처리하며 실제와 합성된 것을 구분하는 능력을 바탕으로 경력을 쌓아왔습니다. 하지만 최근 Times의 보도에 따르면, 그는 자신의 테스트에서조차 실패하기 시작했습니다. “마치 눈이 멀어가는 것 같습니다.”라고 그는 말했습니다. 실제 녹음과 AI가 생성한 녹음을 구분하는 데 있어 지구상에서 가장 뛰어난 역량을 갖춘 이 인물조차 더 이상 이를 신뢰성 있게 수행할 수 없게 된 것입니다.
그러한 인정은 어떤 종류의 논쟁은 이제 끝내야 함을 시사합니다. 수년 동안 합성 미디어 (synthetic media)에 대한 대응책의 암묵적인 약속은 탐지 (detection) 기술이 생성 (generation) 기술의 속도를 따라잡을 것이라는 점이었습니다. 즉, 더 설득력 있는 가짜가 등장할 때마다 더 민감한 탐지기가 등장할 것이며, 비록 불편할지라도 이 군비 경쟁 (arms race)은 최소한 승산이 있다는 믿음이었습니다. Farid의 고백은 적어도 오디오 영역에서는 그 경쟁에서 패배했다는 증거입니다. 해당 분야의 가장 뛰어난 탐지기가 동전 던지기 수준으로 전락했을 때, 가짜가 만들어지고 유포된 후에 이를 잡아내겠다는 전략은 전략이라고 할 수 없습니다. 그것은 단지 희망일 뿐입니다. 그리고 20분간의 패닉에 의존하는 사기는 피해자나 그들의 은행에, Hany Farid조차 더 이상 신뢰할 수 없는 법의학적 분석 (forensic analysis)을 수행할 20분의 시간을 허락하지 않습니다.
이것은 의미 있는 보호를 위해 우리가 받아들여야 할 첫 번째이자 가장 중요한 사실입니다. 탐지는 방어의 핵심 지지대 (load-bearing defence)가 될 수 없다는 점입니다. 전화기 너머로 흐느끼는 목소리를 듣는 할머니에게, 해당 분야의 최고 전문가가 사실상 포기해 버린 법의학적 분석을 수행하라고 기대할 수는 없습니다. 궁극적으로 대상자나 다른 누군가가 실제 목소리와 복제된 목소리의 차이를 구별할 수 있음에 의존하는 모든 계획은 이미 구식입니다. 이 함의는 전화 사기보다 더 깊은 곳까지 뻗어 있습니다. 합성 오디오 탐지의 세계적 권위자가 자신의 판단조차 신뢰할 수 없다면, 인간이 보조 검증자 (fallback verifier) 역할을 할 수 있다고 조용히 가정하는 모든 하위 시스템들 — "재량껏 판단하라"는 지시를 받는 은행원, "무언가 이상한 점이 없는지 주의 깊게 들으라"고 권고받는 친척들 — 은 이미 무너져 버린 토대 위에 서 있는 것입니다.
취약성의 구조 (The Architecture of Vulnerability)
노인들을 표적으로 삼는 것을 순진함 때문이라고 치부하고 싶은 유혹이 생기겠지만, 이는 잘못된 생각입니다. 이 글을 쓰게 된 배경이 된 브리핑은 더 불편한 진실을 지적합니다. 노인들을 불균형적으로 취약하게 만드는 특성들은 지능의 결핍이 아니라, 잘 살아온 삶의 특징들입니다. 그들은 수십 년간의 노동이 축적된 결과물로서 평균적으로 더 높은 저축 잔액을 보유하는 경향이 있으며, 이는 그들을 효율적인 표적으로 만듭니다. 단 한 번의 성공적인 전화가 젊은 층을 겨냥한 전화보다 훨씬 더 많은 수익을 가져다줄 수 있기 때문입니다. 그들은 신뢰 기반의 의사소통(trust-based communication)이라는 확립된 패턴 속에서 성장했고 여전히 그 안에서 활동하고 있습니다. 이러한 패턴 속에서는 고통을 호소하는 친척의 전화가 잠재적인 공격인지 심문받기보다는, 진정한 비상 상황으로 받아들여집니다. 또한 그들은 본인의 잘못이 아니라, 전화기 너머의 목소리가 곧 실제 사람이라는 정의가 당연했던 세상에서 평생을 보냈기에 AI 음성 합성(AI voice synthesis)의 존재에 상대적으로 생소합니다. 그리고 모든 부모와 조부모가 그렇듯, 그들은 가족 비상 상황이라는 특유의 감정적 구조(emotional architecture)에 노출되어 있습니다. 이 상황에서는 아이를 보호하려는 본능이 더 느리고 회의적인 모든 사고 능력을 압도해 버립니다.
학술 연구에서도 이를 공식화하기 시작했습니다. 2026년 6월에 발표된 한 arXiv 논문은 “고령층이 AI로 강화된 사기에 여전히 불균형적으로 취약하다”라고 명확히 언급했습니다. 또한 2026년 초에 발표된 Yixin Zou가 이끄는 팀의 별도 연구는, AI의 정교함이 고조되는 가운데 고령층을 위해 특별히 설계된 사기 개입(fraud interventions) 방안을 조사했습니다. 이 연구팀은 ROLESafe라고 불리는 역할 기반 시뮬레이션 도구(role-based simulation tool)를 개발했는데, 참가자들이 수동적인 관찰자가 아닌 피해자나 조력자의 역할을 직접 수행하며 학습할 때 사기를 식별하는 능력이 향상됨을 확인했습니다. 세 번째 논문은 Charm Security사의 연구진이 발표한 것으로, '인간 취약성 및 착취 프레임워크(Human Vulnerabilities and Exploits Framework)'를 제안했습니다. 이는 소프트웨어 보안 분야의 취약점 데이터베이스(vulnerability databases)를 모델로 하여, 사기 시스템이 이용하는 인지적 및 사회적 메커니즘을 분류하기 위한 구조화된 카탈로그입니다. 이 프레임워크의 전제 자체가 하나의 조용한 비판을 담고 있습니다. 즉, 보안 산업이 수십 년 동안 기계의 약점을 분류하고 패치(patching)하는 데 시간을 쓰는 동안, 인간의 약점은 기록되지도 관리되지도 않은 채 방치해 왔다는 점입니다. 조부모 사기(grandparent scam)가 성공하는 이유는, 그 어떤 패치도 작성된 적 없는 시스템의 단 한 부분을 공격하기 때문입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기