
OpenAI, 동일한 가격으로 Realtime API mini 버전에 추론 및 도구 호출 기능 추가: 음성 기능이 있는 ChatGPT
요약
OpenAI가 Realtime API mini 모델에 추론 및 도구 호출 기능을 추가한 gpt-realtime-2.1-mini를 출시했습니다. 가격 인상 없이 기능이 강화되었으며, 캐싱 개선을 통해 P95 지연 시간을 25% 감소시켜 음성 서비스의 안정성을 높였습니다.
핵심 포인트
- gpt-realtime-2.1-mini 모델에 추론 및 도구 호출 기능 도입
- 기능 강화에도 불구하고 기존 mini 모델과 동일한 가격 유지
- 캐싱 개선을 통해 P95 지연 시간 최소 25% 감소
- 상위 모델은 복잡한 에이전트용, mini는 빠르고 저렴한 상호작용용으로 타겟팅
만약 당신이 "음성 기능이 있는 ChatGPT"를 찾고 있었다면, 아마 다음 두 가지 중 하나를 의미했을 것이며, 이 둘은 서로 다른 것입니다. 첫 번째는 ChatGPT 앱의 음성 모드로, 전화기에 대고 말하면 답변을 듣는 방식입니다. 두 번째는 Realtime API로, 전화 봇, 자동차 어시스턴트, 제품 내 음성 입력 등 당신이 직접 음성 애플리케이션을 구축할 때 사용하는 프로그래밍 인터페이스 (API)입니다. 2026년 7월 6일의 사건은 두 번째에 관한 것입니다. 여기서 ChatGPT 앱은 관련이 없습니다.
2026년 7월 6일자 MarkTechPost의 분석과 같은 날 OpenAI 개발자 포럼의 스레드에 따르면, OpenAI는 gpt-realtime-2.1 및 gpt-realtime-2.1-mini라는 두 가지 모델을 출시했습니다. 이번 출시의 핵심은 최상위 모델이 아니라 바로 mini 모델입니다. 음성 API의 mini 라인업에 처음으로 추론 (reasoning) 및 도구 호출 (tool calling) 기능이 도입되었습니다. 이전에는 상위 모델인 gpt-realtime-2에만 이 기능이 있었습니다. 그리고 동일한 소식통에 따르면, mini의 가격은 이전과 동일하게 유지되었습니다.
이제 무엇이 구체적으로 변했는지, 이것이 실제로 누구에게 필요한지, 어떻게 연결하는지, 세부 사항에 주의를 기울이는 데 비용이 얼마나 드는지, 그리고 이번 출시가 해결하지 못하는 것이 무엇인지 분석해 보겠습니다. 과장 없이 말씀드리자면, 일부 수치는 2차 분석과 포럼을 통해서만 확인되었으며, OpenAI의 공식 페이지를 직접 확인하지는 못했습니다. 필요한 부분에서 이 점을 솔직하게 말씀드리겠습니다.
2026년 7월 6일에 정확히 무엇이 변했나
핵심: 저렴한 음성 모델이 최상위 등급의 두 가지 능력을 갖추게 되었음에도 가격이 인상되지 않았습니다.
출처의 사실 관계를 정리하면 다음과 같습니다:
- 두 가지 새로운 모델. gpt-realtime-2.1 및 gpt-realtime-2.1-mini가 2026년 7월 6일에 출시되었습니다 (MarkTechPost, OpenAI 개발자 포럼).
- mini 모델의 추론 (Reasoning) 및 도구 호출 (Tool calling). gpt-realtime-2.1-mini는 해당 라인업 최초로 추론 및 도구 호출 기능을 갖추게 되었습니다. 이전까지 이러한 기능은 상위 모델에서만 가능했습니다 (MarkTechPost).
- 가격 동결. 새로운 mini 모델은 추가된 기능에도 불구하고 기존 gpt-realtime-mini와 동일한 가격을 유지합니다 (MarkTechPost).
- 꼬리 부분의 지연 시간 (Latency). 개선된 캐싱 (Caching) 덕분에 모든 Realtime 모델의 P95 지연 시간이 최소 25% 감소했습니다 (MarkTechPost, OpenAI 개발자 포럼).
- 모델의 타겟팅. 상위 모델인 gpt-realtime-2.1은 더 복잡한 음성 에이전트 워크플로 (Agentic workflow)를 대상으로 하며, mini 모델은 빠르고 저렴한 음성 상호작용을 대상으로 합니다 (MarkTechPost).
지연 시간에 관한 항목을 주목하십시오. 이는 평균 응답 시간이 아니라, 가장 느린 5%의 응답을 의미하는 P95에 관한 것입니다. 바로 이 분포의 꼬리 부분이 시스템이 "버벅거리거나" "멈춘다"는 느낌을 형성합니다. 캐싱 개선은 바로 이 꼬리 부분을 공략합니다. 음성 봇을 구축해 본 적이 있다면 잘 알 것입니다. 사용자는 안정적인 700ms는 용서하지만, 문장 중간에 발생하는 갑작스러운 3초간의 정지는 용서하지 않습니다.
개발 과정에서 이 음성 모델의 동작을 다른 모델 제품군과 비교해야 한다면, provod.ai를 통해 하나의 채팅과 하나의 API로 Claude, GPT, Gemini, DeepSeek, Qwen에 모두 접근할 수 있습니다. 다섯 개의 별도 구독을 생성하지 않고도 어떤 시나리오에서 가장 잘 응답하는지 확인하고 싶을 때 매우 편리합니다.
저가형 라인업에서 추론 (Reasoning)이 단순한 대화가 아닌 에이전트를 위한 이유
핵심은 이것입니다: mini 모델에 추론 기능이 필요한 이유는 봇이 더 아름답게 대화하기 위해서가 아니라, 단계별 작업을 수행할 수 있도록 하기 위해서입니다.
여기서 편집자적인 관점은 간단합니다. 대화형 챗봇(Chatbots)이 있습니다. 이들은 대화를 유지하고, 질문에 답하며, 사람처럼 들립니다. 그리고 음성 에이전트(Voice Agents)가 있습니다. 이들은 일을 처리합니다. 주문 상태를 확인하고, 예약을 잡고, 주소를 확인하며, 외부 시스템을 호출(pull)하고 그 결과를 가져옵니다. 이 두 세계의 차이는 정확히 추론 (Reasoning)과 도구 호출 (Tool calling)입니다.
도구 호출 없이는 음성 모델이 말만 할 수 있습니다. 도구 호출이 있으면 대화 도중에 "지금 get_order_status 함수를 호출해야겠다"라고 결정하고, 백엔드(Backend)로부터 응답을 받은 뒤 음성으로 대화를 이어갈 수 있습니다. 추론 (Reasoning) 없이는 모델이 어떤 순서로 언제 이 작업을 수행할지 계획하는 능력이 떨어집니다. OpenAI는 가격 인상 없이 mini 모델에 이 두 가지를 모두 추가함으로써 사실상 임계값을 옮겼습니다. 이전에는 비싼 상위 모델이 필요했던 시나리오들이 이제 저렴한 모델에서도 작동할 수 있게 되었습니다.
이것은 OpenAI의 공식 발표가 아니라 저의 포지셔닝 해석입니다. 출처는 단 하나만을 직접적으로 말하고 있습니다: mini는 빠르고 저렴한 상호작용을 위한 것이고, 상위 모델은 복잡한 워크플로우 (Workflow)를 위한 것이라는 점입니다. "챗봇이 아닌 비즈니스 에이전트에 베팅한다"라는 결론은 편집자적인 견해이므로, 이 점을 염두에 두시기 바랍니다.

아키텍처 수준에서의 작동 방식
Realtime API 기반의 음성 에이전트는 "텍스트를 보내고 텍스트를 받는" 방식이 아닙니다. 이는 일반적으로 WebSocket 또는 WebRTC를 통한 지속적인 연결이며, 이를 통해 오디오와 이벤트가 양방향으로 흐릅니다.
흐름은 다음과 같습니다:
- 사용자의 마이크가 오디오를 녹음하면, 이를 연결(Connection)로 스트리밍(Streaming)합니다.
- 모델이 음성을 인식하고, 생각하며, 동시에 음성으로 응답하기 시작합니다.
- 모델이 도구를 호출하기로 결정하면, 함수 이름과 인자(Arguments)가 포함된 이벤트를 보냅니다.
- 귀하의 코드에서 함수를 실행하고(데이터베이스 요청, 외부 API 호출 등), 결과를 반환합니다.
- 모델은 그 결과를 응답에 포함시켜 대화를 계속합니다.
추론 (Reasoning)은 3단계, 즉 '언제 무엇을 호출할지'에 영향을 미칩니다. 도구 호출 (Tool calling)은 3단계와 4단계를 수행하는 메커니즘입니다. 단계 2와 5 사이의 지연 시간 (Latency)이 무엇보다 중요합니다. 모델이 "생각"하거나 도구를 기다리는 동안 발생하는 일시 정지 시간이 바로 OpenAI가 MarkTechPost의 데이터에 따르면 P95 기준 25% 단축시킨 그 '꼬리 (tail)' 부분입니다.
"음성 기능이 있는 ChatGPT"라는 요청에 대해 별도로 설명하자면, 사람들은 흔히 세 가지 수준을 혼동합니다. 첫째, 앱에 있는 음성 모드(Voice Mode)가 있습니다. 이는 완성된 제품이며 사용자는 이를 단순히 사용하기만 하면 됩니다. 둘째, Realtime API가 있습니다. 이는 개발자를 위한 빌더(constructor)이며, 이 글의 주제입니다. 셋째, "음성 인식 (Speech Recognition) + 일반 텍스트 모델 + 음성 합성 (Speech Synthesis)"의 조합입니다. 이는 세 가지 서비스를 직접 결합해야 하는 더 저렴하고 느린 방식입니다. Realtime API는 이 모든 과정이 하나의 모델과 하나의 스트림 (Stream) 내에서 일어나기 때문에 훨씬 더 자연스럽게 들리고 응답 속도가 빠르다는 점이 다릅니다.
연결 방법: 최소한의 코드
가장 중요한 것은 기본 연결을 위해 WebSocket, API 키, 그리고 올바른 모델 이름이 필요하다는 점입니다.
아래는 Python으로 작성한 간략한 초안입니다. 이는 구조를 보여주기 위한 예시이며, 바로 프로덕션(production)에 사용할 수 있는 서비스는 아닙니다. 오디오 처리, 중단 (interruption), 재연결 기능 등은 생략되었습니다.
import os
import json
import websockets # pip install websockets
...
핵심적인 모델 이름은 gpt-realtime-2.1-mini입니다. 복잡한 시나리오에 대한 추론이 필요하고 가격이 중요하지 않다면 gpt-realtime-2.1을 사용하면 됩니다. 모델 이름은 변경될 수 있으므로 본인의 콘솔에서 최신 식별자(identifier)를 확인하세요. 저는 2026년 7월 6일자 개발자 포럼과 MarkTechPost의 정보를 바탕으로 작성했습니다.

접근성에 대하여. OpenAI의 Realtime API를 사용하려면 OpenAI 키와 해당 서버로의 안정적인 연결이 필요합니다. 러시아에서는 이것이 종종 VPN과 해외 결제 카드를 의미합니다. 만약 오디오 스트림 (audio stream) 자체 없이, 텍스트 수준에서 다양한 모델이 귀하의 음성 시나리오 논리를 어떻게 처리하는지 비교하는 것만이 목적이라면, OpenAI, Claude 및 기타 모델로의 라우팅 (routing)을 하나의 OpenAI 호환 API를 통해 수행할 수 있습니다. provod.ai에서는 다음과 같이 작동합니다: OpenAI 또는 Anthropic SDK에서 api_key와 base_url을 변경하고, VPN이나 해외 카드 없이 러시아 카드, SBP 또는 계좌 이체로 결제할 수 있으며, 법인의 경우 계약서, 송장 및 증빙 서류가 제공됩니다. 솔직하게 말씀드리자면, 이것은 텍스트 및 멀티모달 (multimodal) 모델에 대한 접근이지, 음성 Realtime 스트림 자체를 호스팅하거나 Realtime API 자체를 대체하는 것이 아닙니다. 실시간 오디오를 위해서는 여전히 모델 제공업체의 음성 엔드포인트 (voice endpoint)가 필요합니다.
# OpenAI 호환 API를 통한 모델 접근 (텍스트 시나리오)
from openai import OpenAI
...
비용 및 모델 선택 가이드
핵심은 mini 모델의 가격이 인상되지 않았다는 점입니다. 따라서 이제 티어 (tier) 간의 선택은 기본적으로 예산 문제가 아니라 시나리오의 복잡성에 따라 결정됩니다.
출처에서는 루블이나 달러 기준의 정확한 가격을 제시하지 않으며, 단지 새로운 mini 모델의 가격이 이전 mini 모델과 동일하다고 주장할 뿐입니다 (MarkTechPost). 따라서 구체적인 금액을 언급하지 않겠습니다. 금액을 임의로 말하는 것은 허구일 뿐이기 때문입니다. 구매 당일 귀하의 OpenAI 계정에서 Realtime API 요금제를 확인하시기 바랍니다.
사실에 기반하여 말할 수 있는 것은, 이것이 모델을 선택하는 방식과 같다는 점입니다.
| 사용 시나리오 | 모델 | 이유 |
|---|---|---|
| 짧은 음성 응답, FAQ, 단순 라우팅 (Routing) | gpt-realtime-2.1-mini | 빠르고 저렴하며, 이제 기본적인 추론 (Reasoning) 및 도구 호출 (Tool Calling) 기능 포함 |
| ... | ||
| 이번 출시의 실질적인 결론: 이전에는 예산이 선택을 좌우하는 경우가 많았습니다. 저렴하기 때문에 mini를 선택하고 도구 기능이 없는 점을 감수해야 했습니다. 이제 mini가 도구 기능을 사용할 수 있게 됨에 따라, 많은 음성 봇의 기본 설정이 mini로 이동할 것이며, 상위 모델은 "혹시 몰라서"가 아니라 복잡도에 따라 의도적으로 선택하게 될 것입니다. |

단계별 가이드: 음성 에이전트 프로토타입 만들기
- Realtime API 액세스 권한 확보. Realtime 기능이 활성화된 OpenAI API 키가 필요합니다. 러시아에서 접속하는 경우, VPN과 결제 방법을 미리 고려하십시오.
- 모델 선택.
gpt-realtime-2.1-mini로 시작하십시오. 더 저렴하며 이제 도구 기능도 지원합니다. - WebSocket 연결 설정. 위 예시와 동일하게 진행합니다.
OpenAI-Beta헤더가 문서의 현재 버전과 일치하는지 확인하십시오. - 도구 (Tools) 정의. 각 함수는 이름, 설명, 파라미터의 JSON 스키마를 가져야 합니다. 설명은 짧고 명확하게 작성하십시오. 모델은 이 설명을 바탕으로 언제 호출할지 결정합니다.
- 호출 핸들러 구현. 함수 호출 이벤트가 발생하면 해당 함수를 실행하고, 결과를 세션에 반환하여 모델이 대화를 이어갈 수 있도록 합니다.
- 오디오 처리. 마이크 입력을 연결에 스트리밍하고, 응답 오디오를 재생합니다. 중단 (Interruption) 처리를 구현하십시오. 사용자가 말을 가로채면 현재 응답을 중단해야 합니다.
- 꼬리 지연 시간 (Tail Latency) 측정. 사용자의 말이 끝난 시점부터 응답이 시작되는 시점까지의 시간을 기록하십시오. 평균값이 아닌 P95 값을 확인하십시오. 이번 출시에서 개선을 약속한 부분이 바로 이 지점이므로, 실제 데이터를 통해 확인해 보십시오.
- 예외 경로 (Fallback) 추가. 연결 끊김, 도구 타임아웃, 모델의 함수 호출 실패 등 각 상황에 대해 침묵이 아닌 명확한 음성 응답이 필요합니다.
흔한 실수와 이를 해석하는 방법
핵심: 음성 에이전트(Voice Agents)에서 발생하는 대부분의 문제는 "나쁜 모델" 때문이 아니라, 선언되지 않은 도구(Tools), 잘못된 스키마(Schemas), 그리고 처리되지 않은 단절(Disruptions) 때문입니다.
- 모델이 도구를 호출하지 않음. 가장 흔한 원인은 함수 설명(Function description)이 모호하거나,
session.update에서 도구가 선언되지 않은 경우입니다.description을 명확히 하고, 대화가 시작되기 전에 세션 업데이트(Session update) 이벤트가 실제로 전송되었는지 확인하세요. - 함수는 호출되었으나 인자(Arguments)가 엉망임. JSON 스키마(JSON schema)가 너무 자유롭기 때문입니다.
required를 설정하고, 타입을 제한하며, 파라미터 설명에 예시를 추가하세요. - 긴 일시 정지(Pauses). 정확히 어디에서 지연이 발생하는지 확인하세요: 모델 자체인지, 아니면 사용자의 도구 핸들러(Tool handler)인지 구분해야 합니다. 만약 백엔드(Backend)에서 느려지는 것이라면, OpenAI의 캐싱(Caching) 개선은 도움이 되지 않습니다. 그것은 귀하의 지연 시간(Latency) 문제입니다.
- 문장 중간의 끊김. WebSocket은 영원히 유지되지 않습니다. 재연결(Reconnection) 및 세션 컨텍스트(Session context) 복구 기능이 필요합니다.
- 버전 혼동.
gpt-realtime-mini(구버전)와gpt-realtime-2.1-mini(7월 6일 출시)의 이름을 혼동하지 마세요. 도구(Tools)와 추론(Reasoning) 기능은 오직 새 모델에만 있습니다.
n8n 및 로우코드(Low-code) 연동에 대하여
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기