
OpenAI의 음성 AI는 듣기와 말하기를 동시에 수행하며 Siri 및 Alisa를 겨냥한다
요약
OpenAI가 듣기와 말하기를 동시에 수행하는 전이중(Full-duplex) 음성 AI 모델인 GPT-Live-1 및 mini를 출시했습니다. 기존의 순차적 방식에서 벗어나 실시간 대화가 가능하며, 기존 Advanced Voice Mode를 대체합니다.
핵심 포인트
- GPT-Live-1 및 mini 모델 출시로 실시간 연속 대화 가능
- 전이중(Full-duplex) 방식을 통한 지연 시간 최소화 및 자연스러운 상호작용
- 기존 Siri, Alexa 등 음성 비서 모델과의 차별화된 성능
- 개인정보 보호 및 마이크 상시 작동에 대한 논쟁 발생
18분 만에 파악하기 · 수준: 초보자용 · 데이터 검증일: 2026년 7월 11일
학습 내용:
- GPT-Live-1 및 mini란 무엇인가 - OpenAI의 전이중 (Full-duplex) 음성 AI (2026년 7월 8일 발표, 과장 없이)
- 기존 음성 모드 및 Siri, Alisa와의 차이점 - 쉬운 설명과 표를 통해 비교
- 벤치마크 (Benchmark)가 실제로 보여주는 것 (스포일러: 수치는 OpenAI가 직접 계산함) 및 음성이 여전히 끊기는 지점
- 주요 논쟁: 마이크가 이제 항상 듣고 있는 것이 사실인가와 개인정보 보호 문제 - 양측의 입장을 솔직하게 전달
- 러시아에서의 작동 여부, 사용자별 모델 배포 방식 및 개발자를 위한 API 존재 여부
- 현재 러시아어 사용자 및 개발자가 즉시 할 수 있는 일
핵심 요약. 2026년 7월 8일, OpenAI는 듣기와 말하기를 동시에 수행하는 음성 AI인 GPT-Live-1 및 GPT-Live-1 mini를 출시했습니다. 이전의 어시스턴트는 사용자가 말을 마칠 때까지 기다렸다가, 생각한 뒤에 답변했습니다. 이제는 대화를 연속적인 흐름으로 이어갑니다. 적절한 타이밍에 말을 끊거나, "음흠" 하며 맞장구를 치고, 침묵할 줄 알며, 복잡한 질문은 조용히 GPT-5.5 모델로 넘깁니다. 이 모델들은 Advanced Voice Mode를 대체합니다. mini 모델은 무료 요금제에 제공되며, 전체 GPT-Live-1은 유료 요금제에 제공됩니다. 소셜 미디어에서는 이를 Siri, Alexa, Alisa를 종결시키려는 시도로 부르며, 동시에 개인정보 보호에 대해 논쟁하고 있습니다. 전이중 (Full-duplex) 방식은 마이크가 소리를 지속적으로 처리함을 의미합니다. 아래에서는 무엇이 사실이고 무엇이 마케팅인지, 그리고 특히 ChatGPT가 공식적으로 작동하지 않는 러시아에 있는 당신에게 이것이 어떤 의미인지 분석합니다.
음성은 다시 AI의 주요 화두가 되었으며, 이는 지난 1년 동안 발생한 첫 번째 급증이 아닙니다. 하지만 GPT-Live는 음성 AI가 컨퍼런스의 데모 수준을 벗어나 산책 중에 실제로 사용할 수 있는 도구로 변모한 순간처럼 보입니다. 이 주제는 빠르게 움직이고 있습니다. 단 한 번의 주말 사이에 음성 API 모델과 소비자용 GPT-Live가 모두 출시되었으며, 이들은 서로 계속 혼동되고 있습니다. 저는 2026년 7월 11일 기준의 사실들을 수집하였고, 모든 수치를 날짜가 명시된 출처와 연결하였으며, OpenAI가 스스로를 측정(Self-measured)한 부분에 대해서는 솔직하게 경고를 남겼습니다.
음성 AI의 주제는 몇 주 단위로 소진되고 업데이트됩니다. 오늘날의 플래그십 모델은 내일 경쟁사들에게 따라잡힙니다. 따라서 본문 속 모든 버전, 가격 및 날짜 정보는 2026년 7월 11일 기준으로 작성되었으며, 데이터가 가장 먼저 구식이 될 수 있는 부분에는 표시를 했습니다.
GPT-Live란 무엇이며 왜 목소리가 다시 화제인가?
핵심. GPT-Live는 OpenAI의 두 가지 음성 모델 제품군입니다: 완전한 GPT-Live-1과 경량화된 GPT-Live-1 mini. 이들은 2026년 7월 8일에 발표되었으며, 기존 ChatGPT의 음성 모듈을 대체하고 iOS, Android, 웹, 심지어 CarPlay 전반에 걸쳐 글로벌하게 배포되고 있습니다. 특징은 하나지만 거대합니다: 모델이 살아있는 대화 상대처럼 듣기와 말하기를 동시에 수행한다는 것입니다.
기존 음성 비서는 순차적으로 작동했습니다. 사용자가 말을 하면, 시스템은 멈춤(pause)을 기다리고, 음성을 인식하고, 답변을 생성한 다음, 소리 내어 읽었습니다. 질문과 답변 사이에는 지연 시간이 있었고, 사용자의 말에 약간의 멈춤이라도 있으면 마치 끝났다고 반응하며 맥락에 맞지 않게 대답하려 했습니다. GPT-Live는 이 순차성을 제거합니다: OpenAI 설명에 따르면, 모델은 들어오는 소리를 처리하고 응답을 병렬로 형성하며, 초당 여러 번 '말하기, 듣기, 멈추기, 끼어들기 또는 도구 호출' 결정을 내립니다 (Introducing GPT-Live, OpenAI, 2026년 7월 8일; TechCrunch, 2026년 7월 8일).
이것이 모든 새로운 행동 방식의 근원입니다. 음성 AI는 이제 말을 끊지 않고 '음...'이나 '아하'와 같은 추임새를 넣을 수 있고, 사용자가 생각할 시간이 필요하면 침묵할 수도 있으며, 말하는 도중에 끼어들어도 그만두고 조용해질 수 있습니다. Sam Altman은 출시 당일 이 기능이
이 모든 일이 시작된 규모는 숫자를 통해 명확히 알 수 있습니다. OpenAI의 데이터에 따르면, ChatGPT의 음성 및 받아쓰기 기능은 매주 1억 5천만 명 이상의 사용자가 이용하고 있습니다. 이는 ChatGPT 전체 주간 사용자 약 9억 명 중 일부입니다 (TechCrunch, 2026년 7월 8일). 회사에 있어 음성은 활성 사용자 6명 중 1명이 제품에 접속하는 채널이 되었으며, 여기에 투자하는 것은 직접적인 경제적 계산에 따른 것입니다.
"저는 항상 AI와 대화할 때 음성보다는 타이핑을 선호했습니다. 이제는 그것이 바뀔 것이라고 생각합니다."
- Sam Altman, OpenAI CEO, X, 2026년 7월 8일
앞으로 혼동을 피하기 위해 이름에 관한 중요한 세부 사항을 짚고 넘어가겠습니다. GPT-Live는 일반 사용자가 대화하는 ChatGPT 앱에 관한 것입니다. 그보다 이틀 전인 2026년 7월 6일, OpenAI는 개발자를 위한 음성 API(gpt-realtime-2.1 모델)를 별도로 업데이트했습니다. 이것은 다른 제품이며, API 섹션에서 다시 다루겠습니다. 언론과 소셜 미디어는 이 두 출시를 계속 혼동하고 있지만, 둘 사이에는 근본적인 차이가 있습니다. 이 점을 명심하세요. OpenAI의 음성 관련 놀라운 수치를 접한다면, 먼저 7월의 두 가지 출시 중 무엇에 관한 것인지 확인해야 합니다.
실제로 사용하면 어떤 느낌일까요? 어시스턴트에게 긴 생각을 말하다가 말을 더듬거나 단어를 찾으려고 해도, 어시스턴트는 당신 대신 말을 끝맺으려 들지 않고 짧게 "으응" 하고 대답한 뒤 기다려 줍니다. 더 복잡한 질문을 던지면 "잠시만요, 확인해 볼게요"라는 말이 들리고, 배경에서 GPT-5.5가 작동하는 동안 대화가 죽은 듯한 정적 속에 멈춰 있지 않습니다. 답변 중간에 말을 끊으면 어시스턴트는 멈추고 당신의 말을 듣습니다. 이러한 사소한 부분들이 모여, 전화기가 명령을 받아쓰는 자동응답기로 변하는 것이 아니라 실제 사람과 대화하고 있다는 느낌을 만들어냅니다.
음성이라는 주제는 OpenAI의 노력만으로 돌아온 것이 아닙니다. 2026년 상반기에 여러 주요 플레이어들이 전이중 (Full-duplex) 어시스턴트를 출시했으며, GPT-Live는 가장 마지막으로 그 대열에 합류했습니다. 누가 언제 출시했는지는 '어시스턴트 킬러' 섹션에서 다룹니다. 우선은 내부적으로 무엇이 바뀌었는지 분석해 보겠습니다. 이 모든 "생동감"은 단 하나의 아키텍처(Architecture) 교체에 달려 있기 때문입니다.
전이중 (Full-duplex) 방식은 기존 음성 모드와 어떻게 다른가?
핵심 요약. 전이중 (Full-duplex) 방식이란 '동시 양방향 통신'을 의미합니다. 즉, 실제 전화 통화처럼 채널이 양방향으로 동시에 작동합니다. 기존 방식은 심플렉스 (Simplex) 방식의 이어달리기와 같았습니다. 먼저 당신이 말하고, 잠시 멈춘 뒤, 상대방이 말하는 식이었죠. 자연스러운 음량의 문제가 아닙니다. 내부적으로 사운드 처리 방식 자체가 바뀌었으며, 바로 이 방식이 지연 없는 끼어들기 (Interruption)를 가능하게 합니다.
제가 접한 가장 좋은 비유는 무전기와 전화기의 차이입니다. 개발자 Vaibhav Sisinty는 출시 당일, 기존의 음성 AI는 무전기처럼 작동했다고 작성했습니다. 버튼을 누르고, 말하고, 버튼을 떼고, 답변을 기다리는 방식입니다. 반면 GPT-Live는 두 사람이 동시에 말하고 들을 수 있는 실제 전화 통화처럼 작동합니다 (Vaibhav Sisinty, X, 2026년 7월 8일). Lior Alexander의 또 다른 분석은 이 생각을 더욱 명확히 합니다. 내부의 '배관 시스템 (Plumbing)'이 이어달리기 방식에서 연속적인 방식으로 바뀌었다는 것입니다 (Lior Alexander, X, 2026년 7월 8일).
이전에는 어떠했고 지금은 어떻게 바뀌었는지 보여드리겠습니다. 기존의 파이프라인 (Pipeline)은 음성 인식 (Speech Recognition), 언어 모델 (Language Model), 음성 합성 (Speech Synthesis)이라는 세 개의 별도 조각이 순차적으로 작동하며 구성되었습니다. GPT-Live는 사운드를 하나의 스트림 (Stream)으로 처리하며, 초당 수십 번씩 무엇을 할지 결정합니다.
| 구분 | 기존 음성 모드 (이어달리기) | GPT-Live (연속 스트림) |
|---|---|---|
| 음성 처리 방식 | 순차적: 음성 → 침묵 → 인식 → 모델 → 합성 | 병렬적으로 듣고 응답, 단일 스트림 |
| ... | ||
| [Exhibit 1: 이어달리기 대 스트림 - 기존 모드와 GPT-Live가 동일한 발화를 처리하는 방식_] |
표의 마지막 줄이 핵심이며, 리뷰어들이 자주 놓치는 부분입니다. 대화형 모델이 반드시 스스로 천재일 필요는 없습니다. 모델의 임무는 생생한 대화를 이끄는 것이며, 인터넷 검색, 심도 있는 추론 또는 다단계 작업이 필요한 질문이 들어오면 이를 더 강력한 모델 (GPT-5.5)로 전달합니다. 그동안 모델은 대화를 계속 유지하다가 답변이 준비되면 다시 가져옵니다 (MarkTechPost, 2026년 7월 8일). 이 과정에서 사용자는 침묵 속에 앉아 있을 필요가 없습니다. 모델은 검색 중임을 확인해주거나 계속해서 대화를 이어갈 수 있습니다.
독립 개발자인 Simon Willison은 바로 이 점을 강조합니다. Hacker News에서 그의 GPT-Live 관련 게시물은 745점을 받았으며, 그의 댓글 또한 해당 스레드에서 최고점을 기록했습니다. 핵심은 GPT-Live에서 목소리가 더 자연스럽게 들린다는 점만이 아닙니다. 가장 중요한 점은 음성 AI가 마침내 구식 엔진에 머물러 있지 않고, 복잡한 질문을 처리하기 위해 내부적으로 최신 스마트 모델을 호출하는 법을 배웠다는 것입니다 (Simon Willison, 개인 블로그 및 Hacker News, 2026년 7월 8일).
Willison의 분석에 따르면, 이전의 음성 모드는 지식이 제한된 구식 엔진 때문에 브레인스토밍(Brainstorming)을 하기에는 너무 취약했습니다. GPT-Live는 복잡한 질문을 최신 모델로 백그라운드에서 처리함으로써 이 문제를 해결합니다.
- Simon Willison 개인 블로그 자료 기반, 2026년 7월 8일
완전한 GPT-Live-1 모델에는 Instant, Medium, High의 세 가지 작동 모드가 있습니다. Instant와 mini 모드는 백그라운드에서 빠른 GPT-5.5 Instant를 사용하며, Medium과 High 모드는 추론(Reasoning)의 정밀도가 다른 "사고하는" GPT-5.5 Thinking을 연결합니다 (Apidog, GPT-Live 리뷰, 2026년 7월; MarkTechPost, 2026년 7월 8일). 원리는 간단합니다. 요금제와 모드가 높을수록 모델은 대화 속도를 떨어뜨리지 않으면서 사용자의 질문에 더 많은 연산 자원(Brains)을 투입할 준비가 되어 있습니다.
동시에 해당 스레드에서는 첫 번째 문화적 우려도 제기되었습니다. 100ms라는 닉네임의 사용자는 목소리가 "AI 여자친구"와 같은 동반자 형태로 튜닝되는 것에 대해 두려움을 표하며, "가짜 AI 여자친구를 원하지 않는다"라고 적었습니다. 그는 이상적인 모델로 "스타트렉(Star Trek)"에 나오는 컴퓨터의 건조하고 실용적인 목소리를 제안했습니다 (Hacker News, 2026년 7월 8일). 음성 AI가 따뜻한 대화 상대가 되어야 하는지, 아니면 냉정한 도구가 되어야 하는지에 대한 논쟁은 이제 막 시작되었으며, GPT-Live가 이에 불을 지폈습니다.
GPT-Live가 정말로 Siri, Alexa, Alisa를 위협하고 있는가?
핵심 요약. 적어도 현재로서는, '아니오'에 가깝습니다. GPT-Live는 대화의 자연스러움과 답변의 깊이 측면에서는 승리하고 있지만, 당신이 휴대폰에 어시스턴트를 유지하는 가장 중요한 이유에서는 패배하고 있습니다. GPT-Live는 기기, 스마트 홈(Smart Home), 그리고 애플리케이션을 제어하지 못하며, 오프라인으로 작동하지 않고 별도의 애플리케이션 내부에서만 존재합니다. 반면 Siri와 Alisa는 시스템 자체에 내장되어 있습니다. 그리고 하이프(Hype) 측면에서 중요한 점은, OpenAI가 빅4(Big Four) 중 가장 마지막에 풀 듀플렉스(Full-duplex) 기능을 선보였다는 사실입니다.
기자들은 '어시스턴트 킬러'라는 표현을 직접적으로 거의 사용하지 않습니다. 그 프레임은 더 미묘합니다. FourWeekMBA의 분석가 Gennaro Cuofano는 현재 상황을 전장의 변화로 설명합니다. 경쟁의 초점이 '누구의 모델이 더 똑똑한가'에서 '누가 사용자와의 음성 채널을 점유하는가'로 이동하고 있다는 것입니다.
"인터페이스가 곧 제품이 되었습니다. 사용자와의 앰비언트(Ambient) 음성 관계를 점유하는 자가 사용자를 점유합니다."
- Gennaro Cuofano, FourWeekMBA 분석가, 2026년 7월
마치 왕좌를 차지하겠다는 선언처럼 들립니다. 하지만 Siri, Alexa, Alisa를 벌써 매장해도 된다는 주장에 반대하는 논거들을 정리해 보았습니다. 이는 제가 열광적인 리뷰들을 수집했던 것과 동일한 검토 자료들에서 가져온 것입니다.
- Siri, Alexa, Alisa는 기기와 현실 세계를 제어합니다. 전화 걸기, 알람, 스마트 홈(Smart Home), 조명, 음악, 애플리케이션 등이 포함됩니다. GPT-Live는 '적어도 아직은'(demandsage, 2026년 7월) 이를 수행하지 못합니다. 불을 꺼줄 수 없는 음성 AI는 일상생활에서의 어시스턴트를 아직 대체할 수 없습니다.
- 오프라인 기능 및 시스템 통합의 부재. GPT-Live는 ChatGPT 애플리케이션 내부에 존재하며 OS(운영체제)의 핵심에 내장되어 있지 않습니다. Siri는 모든 iPhone에 자리 잡고 있고, Alisa는 스피커와 생태계 애플리케이션에 존재하며, 이러한 내장된 존재감은 여전히 유효합니다.
- 초기 단계에서 비디오 및 화면 공유 불가. 새로운 모델들은 이 기능에 접근할 수 없으며, 이러한 시나리오를 위해서는 기존의 음성 모드로 돌아가야 합니다 (9to5Mac, 2026년 8월 7일; Habr의 bothub 분석, 2026년 7월).
- 구독 필요. 완전한 GPT-Live-1은 유료 요금제에서만 사용할 수 있습니다. 무료 사용자에게는 의도적으로 훨씬 약한 mini 모델이 제공됩니다.
- 비영어권 언어에서의 불균일한 품질. 번역에 대해서는 아래에서 별도로 다루겠지만, 아쉬움은 남습니다.
그리고 결정적인 한 가지는, OpenAI가 풀 듀플렉스 (Full-duplex) 시장에 가장 마지막으로 진입했다는 점입니다. 날짜를 직접 계산해 보세요.
| 어시스턴트 | 제조사 | 풀 듀플렉스 지원 시점 | 음성 외 추가 기능 |
|---|---|---|---|
| Alexa+ | Amazon | 2026년 2월 4일 (미국 내 전체 사용자 대상) | 스마트 홈, 쇼핑, Echo 기기 제어; 월 $19.99, Prime 회원은 무료 |
| ... | |||
| [Exhibit 3: 2026년 풀 듀플렉스 연표 - OpenAI가 이 시장에 가장 마지막으로 진입함] |
Google의 풀 듀플렉스 (Full-duplex) 음성 모델은 3.5개월 더 일찍 출시되었으며, 출시와 동시에 카메라, 화면 공유 및 API 액세스 기능을 제공했습니다 (MarkTechPost, 2026년 3월 26일). Apple은 2026년 6월 8일 WWDC에서 1.2조 개의 파라미터 (Parameters)를 가진 Google Gemini 커스텀 모델을 기반으로 Siri AI라는 브랜드로 Siri를 재편했습니다. 이 계약 규모는 연간 약 10억 달러로 평가됩니다 (MacRumors, WWDC 2026 가이드; TechTimes, 2026년 6월 8일). Amazon은 이미 2월에 더 자연스러운 대화형 AI (Conversational AI)에 집중하며 미국 내 모든 사용자에게 Alexa+를 공개했습니다 (TechCrunch, CNBC, 2026년 2월 4일). 여기에 더해 ElevenLabs와 같은 음성 스타트업들이 자체 에이전트(Agents)를 앞세워 양방향에서 압박해 오고 있으며, 실시간 음성 시장은 AI 분야에서 가장 경쟁이 치열한 영역 중 하나가 되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기