
«OpenAI fm»: gpt-realtime-translate의 조용한 출시 - 70개 이상의 언어로 실시간 음성 번역
요약
OpenAI가 별도의 발표 없이 gpt-realtime-translate를 포함한 실시간 오디오 모델들을 조용히 출시했습니다. openai.fm은 단순 TTS 데모이며, 실제 핵심은 실시간 통역과 전사가 가능한 Realtime API의 업데이트입니다.
핵심 포인트
- gpt-realtime-translate 모델의 조용한 출시
- openai.fm은 번역 기능이 없는 TTS 쇼케이스임
- Realtime API가 베타에서 GA 버전으로 전환됨
- 오디오 1분당 $0.034의 비용 발생
사람들이 검색창에 «OpenAI fm»을 입력하는 이유는 OpenAI에서 목소리를 번역해 주는 듯한 어떤 오디오 관련 기능이 출시되었다는 소식을 들었기 때문입니다. 하지만 진실은 두 가지 측면으로 나뉩니다. 첫 번째: openai.fm은 실제로 존재하지만, 이는 음성 합성 (Speech Synthesis) 쇼케이스이며 텍스트를 목소리로 읽어줄 뿐 아무것도 번역하지 않습니다. 두 번째: OpenAI에 실시간 번역 기능이 실제로 존재합니다. gpt-realtime-translate 모델은 2026년 5월 7일, 별도의 발표 없이 개발자 포스트 하나만으로 조용히 출시되었습니다.
비용 문제는 우스울 정도입니다: 공식 발표에 따르면 오디오 1분당 $0.034이며, 2026년 5월 8일 러시아 중앙은행 환율 기준으로 약 2.54 ₽입니다. 진짜 비용이 많이 드는 부분은 모델의 약점이 어디인지, 그리고 러시아에서 자신의 제품에 어떻게 연결할지를 파악하는 것입니다. 직접 연결하기 전에 귀하의 계정에서 사용 가능한 결제 (Billing) 수단을 미리 확인하십시오. 작동 가능한 방법은 세 가지입니다: 해외 카드, 수수료가 붙는 중개인, 그리고 provod.ai와 같은 애그리게이터(Aggregator)를 통해 동일한 모델을 공식 요금제의 루블화로 이용하는 것입니다. 이제 2026년 7월 가격과 함께 순서대로 살펴보겠습니다.
«OpenAI fm»이란 도대체 무엇인가?
요약하자면: 이것은 gpt-4o-mini-tts TTS (Text-to-Speech) 모델의 공식 인터랙티브 데모입니다. OpenAI는 2025년 3월 20일경 gpt-4o-transcribe 및 gpt-4o-mini-transcribe 전사 (Transcription) 모델과 함께 이를 출시했습니다. 이 데모는 텍스트를 음성으로 변환할 뿐입니다.
내부에는 alloy부터 marin, cedar(OpenAI가 마지막 두 가지를 권장함)까지 13개의 내장된 목소리가 있으며, 말하기 방식은 “~처럼 말해줘...”와 같은 텍스트 지침으로 설정됩니다. 데모 코드는 오픈 소스이며 GitHub의 openai/openai-fm 리포지토리에 있습니다. 의미상 이것은 합성 쇼케이스입니다: 텍스트를 입력하면 음성이 출력될 뿐, 번역은 전혀 없습니다.
'fm'이라는 글자가 사람들을 혼란스럽게 합니다: 이 단어는 라디오처럼 들리기 때문에 검색 결과에 음악 서비스들이 섞여 나옵니다. 이 소음 문제는 마지막에 별도 항목으로 다루겠습니다. 그동안, 당신이 이곳에 온 이유인 진짜 뉴스를 살펴보겠습니다.
OpenAI가 2026년 5월 7일에 조용히 출시한 것은 무엇인가?
요약: 세 가지의 실시간 오디오 모델(realtime-audio models)과 베타 버전에서 공개 버전(GA)으로 전환된 Realtime API. GPT-Realtime-2는 GPT-5 수준의 추론 능력을 갖춘 음성 모델, GPT-Realtime-Translate는 실시간 통역, GPT-Realtime-Whisper는 스트리밍 전사(streaming transcription) 모델입니다.
'조용히'라는 말은 비유가 아닙니다. 이벤트도, 프레젠테이션도 없었습니다. OpenAI의 개발자 블로그 포스트 하나가 전부였습니다. 당시 vc.ru는 출시 시점에 번역기 언어 목록조차 포함되어 있지 않았으며, 나중에 OpenAI Cookbook에서 확인되었다고 언급했습니다. 5월에 이 소식은 거의 주목받지 못했으나, OpenAI가 일반 ChatGPT 사용자들에게 번역 기능을 제공한 7월에 다시 관심이 집중되었습니다. 이에 대한 자세한 내용은 아래에서 다룹니다.
gpt-realtime-translate 세션은 어떻게 구성되어 있는가?
요약: 이것은 스트리밍 방식의 음성 대 음성(speech-to-speech) 모델입니다. 문장이 끝날 때까지 기다리지 않고, 70개 이상의 입력 언어를 13개의 출력 언어로 '말하는 속도에 맞춰' 실시간으로 번역합니다. 전체 세션은 spoken 루프(spoken loop) 내에서 작동합니다: 마이크는 입력(in), 스피커는 출력(out) 역할을 합니다.
번역기를 위한 별도의 엔드포인트(endpoint) /v1/realtime/translations (WebSocket wss://api.openai.com/v1/realtime/translations)와 전용 세션 유형인 translation이 존재합니다. 모델이 소스 언어(source language)를 스스로 결정하며, 대상 언어(target language)는 파라미터로 지정합니다. 오디오는 가공되지 않은 PCM(24 kHz PCM16) 청크(chunks) 단위로 전송됩니다. 출력 시에는 번역된 오디오, 원문의 전사(transcript), 번역문의 전사라는 세 가지 스트림이 음성과 동기화되어 동시에 제공됩니다.
모드는 의도적으로 제한되어 있습니다: 텍스트 입력은 비활성화되어 있으며, 시스템 지침(system instructions) 및 도구 호출(tool calling)은 작동하지 않습니다. OpenAI의 데이터에 따르면, 이 모델은 수천 시간의 전문 동시통역사 녹음 데이터를 바탕으로 학습되었으며, RLHF(Reinforcement Learning from Human Feedback) 방식의 사후 학습(post-training)을 거쳤으나 엄격한 통역사 역할에 집중하도록 설계되었습니다. 기계 번역(Machine Translation)은 LSTM 기반 시스템에서 하나의 모델이 모든 것을 한 번에 처리하는 이러한 엔드투엔드(end-to-end) 루프 방식으로 진화해 왔습니다.
출시 시 발표된 활용 시나리오는 고객 지원, 국경 간 판매(cross-border sales), 교육, 이벤트, 미디어 및 크리에이터 분야입니다. '인식, 번역, 음성 출력'의 단계가 말하는 속도를 따라가지 못하는 공항 안내 방송 번역 상황을 상상해 보십시오. 문서화된 사용자 중에는 Deutsche Telekom, Vimeo, BolnaAI 등이 포함되어 있습니다.
분당 비용은 얼마이며 어떤 언어들이 목록에 있나요?
요약하자면: 오디오 분당 $0.034이며, 토큰(token)이 아닌 지속 시간 기준으로 과금됩니다. 2026년 5월 8일 러시아 중앙은행 환율인 달러당 74.6209 ₽를 기준으로 하면 분당 약 2.54 ₽입니다. 양방향 대화 1시간에는 $2.04, 즉 약 152 ₽가 소요됩니다. 가격은 7월 업데이트에서도 변경되지 않았으며, 2026년 7월 기준으로 유효합니다.
| 계산 항목 | OpenAI 공식 발표 가격 | 2026년 5월 8일 중앙은행 환율 기준 루블(₽) |
|---|---|---|
| 클래식 Whisper (전사할 파일) | $0.006/분 | ≈0.45 ₽ |
| ... | ... | ... |
| 언어 수학에서 중요한 점은 비대칭성입니다. 입력(input)은 자동 감지가 가능한 70개 이상의 언어이지만, 출력(output)은 13개뿐입니다. 문서화된 출력 목록은 영어, 스페인어, 포르투갈어, 프랑스어, 독일어, 이탈리아어, 러시아어, 중국어, 일본어, 한국어, 힌디어, 인도네시아어, 베트남어입니다. 러시아어가 목록에 포함되어 있습니다. |
모델 카드(model card)의 기술적 프레임워크: 컨텍스트 윈도우(context window) 16,000 토큰, 출력 최대 2,000 토큰, 지식 컷오프(knowledge cutoff) 2024년 9월 30일입니다. API 무료 티어(free tier)는 없습니다. Tier 1은 분당 50분의 오디오를 제공하며, Tier 4는 650분을 제공합니다. 모델은 Azure AI Foundry에도 GA(General Availability, 2026년 6월) 상태로 배포되었으나, Azure의 리스팅 사양은 OpenAI의 모델 카드와 차이가 있으므로 OpenAI의 수치를 기준으로 삼으십시오.
성능은 어느 정도인가: 독립적 측정
요약하자면: 기록적인 속도, 평범한 의미 전달입니다. LiveLingo Research 벤치마크(2026년 6월 10일 측정; 120개 발화, 영어→스페인어/중국어/일본어/독일어 쌍, VOA 클립 3개)에서 gpt-realtime-translate는 첫 번역된 음성을 가장 빠르게 출력했습니다. 중앙값(median) 기준 711ms였습니다. 그러나 번역의 명확성(understandability) 측면에서는 6개 시스템 중 최하위를 기록했습니다 - 5점 만점에 4.53점을 받았습니다.
| 시스템 | 번역 명확성 (0-5) |
|---|---|
| LiveLingo | 4.96 |
| ... | ... |
| 보고서에 나타난 전형적인 오류: 불필요한 삽입, 의미 역전, 고유 명사 교체 등입니다. 밀도 높은 연속적인 발화에서는 번역이 뒤처지는 현상도 나타납니다. 지연 시간(latency) 중앙값은 3.8초이며, 드리프트(drift)는 최대 20.3초까지 발생합니다. Gemini 3.5 Live Translate의 경우 첫 음성 출력까지 약 2,947ms가 소요되어 4배 더 느리지만, 의미 전달은 더 안정적으로 유지합니다. |
OpenAI는 자체적인 통계를 보유하고 있습니다. BolnaAI의 공동 창립자이자 CTO인 Pratik Sachan에 따르면, 힌디어, 타밀어, 텔루구어에서 이 모델은 테스트된 다른 어떤 모델보다 단어 오류율 (Word Error Rate, WER)이 12.5% 더 낮았습니다. 이는 벤더와 그 파트너의 데이터이므로, 하나의 주장으로 간주해야 합니다. 독립적인 측정 결과는 다른 이야기를 합니다. 첫 소리의 속도와 의미의 정확성은 서로 상충하는 관계에 있습니다.
2026년 7월에는 무엇이 바뀌었나?
요약하자면: OpenAI는 일반 ChatGPT 사용자들에게 번역 기능을 제공했으며, 이를 통해 API 모델에 대한 관심을 강화했습니다. 7월 8일 GPT-Live (GPT-Live-1 및 GPT-Live-1 mini 모델)가 출시되었습니다. 이는 동시에 듣고 말하며 "프롬프트에 따라" 번역하는 전이중 (full-duplex) 음성 모드입니다. "내가 말하는 모든 것을 스페인어로 번역해줘"라고 말하면 그대로 수행합니다.
GPT-Live는 API가 없으며 언어 목록도 공개되지 않았습니다. TechCrunch는 프레스 데모에서 힌디어 번역 시 강한 미국식 억양과 문어체적인 어조가 나타난다고 언급했습니다. 그 전날인 7월 7일에는 Realtime API에 GPT-Realtime-2.1-mini가 추가되었습니다. 이는 100만 토큰당 $0.60/$2.40의 비용으로 미니 급에서 추론 (reasoning) 및 도구 사용 (tool use)을 지원하며, 개선된 캐싱 (caching)을 통해 모든 실시간 (realtime) 모델의 p95 지연 시간 (latency)을 최소 25% 감소시켰습니다. 이번 주의 결론: 소비자에게는 채팅 내 번역 기능이 제공되었지만, 개발자에게는 여전히 gpt-realtime-translate가 필요합니다.
gpt-realtime-translate가 해결하지 못하는 것은?
요약하자면: 이것은 엄격한 틀을 가진 좁은 용도의 도구입니다. 입력은 오디오만 가능하며, 출력은 13개 언어만 지원하고, 동작 설정도 불가능합니다. 이 틀을 벗어나는 모든 것은 이 도구의 범위를 벗어납니다.
- 출력 언어는 13개입니다. 우즈베크어, 카자흐어 또는 아르메니아어 출력이 필요하다면 불가능합니다. 비록 입력 시 모델이 70개 이상의 언어를 이해할 수는 있지만 말입니다.
- 텍스트 입력, 시스템 프롬프트(System Prompts) 및 도구 호출(Tool Calling)은 비활성화되어 있습니다. 함수 호출(Function Calling)과 미세 조정(Fine-tuning)은 지원되지 않습니다. 사용자의 도메인에 맞춘 어떠한 추가 학습도 불가능합니다. 전체 미세 조정은 물론, QLoRA와 같은 효율적인 방식도 지원하지 않습니다. 따라서 전사(Transcription) 결과물에 대한 후처리(Post-processing) 등을 통해 용어를 관리해야 합니다.
- 음성 복제(Voice Cloning)는 별개의 문제입니다. 특정 화자의 목소리로 번역하는 것은 SoVITS 급의 도구가 필요한 영역입니다. 번역 세션 내에서의 음성 선택은 완전한 기능으로 문서화되어 있지 않으며, 2차 자료들 사이에서도 내용이 상충하여 확인이 불가능했습니다.
- 모더레이션(Moderation)은 API 자체에 내장되어 있습니다. 분류기(Classifiers)가 정책 위반을 감지하면 세션을 즉시 중단할 수 있으며, 개발자는 사용자가 AI와 대화하고 있음을 명시적으로 보여줄 의무가 있습니다. 민감한 협상 상황에서는 이는 단순한 형식이 아닌 제약 사항이 됩니다.
- 이 모델은 로컬(Local) 환경에서 구동할 수 없습니다. 공개된 가중치(Weights)가 없기 때문입니다. 만약 당신이 OpenVINO, Vulkan, LMCache, NCmoe, MTMD, Params 및 llama.cpp 주변의 기타 플래그와 같은 로컬 추론(Local Inference) 환경에 익숙한 사용자라면, 여기서는 이들이 무용지물임을 알아야 합니다.
- 2차 리뷰에서 언급된 "0.5~1초의 지연 시간" 수치는 확인되지 않았습니다. 측정 결과, 말이 밀집된 구간에서의 지연 시간 중앙값은 3.8초로 나타났습니다.
러시아에서 실시간 번역을 연결하는 방법은?
요약하자면: 호환성은 특정 제공업체를 통해 확인해야 합니다. gpt-realtime-translate는 별도의 WebSocket 엔드포인트와 translation 세션을 사용하므로, 연결 방식과 코드의 수정이 필요할 수 있습니다. 러시아 법인을 위한 OpenAI의 직접 결제(Billing)는 차단되어 있으므로, 애그리게이터(Aggregator)를 통한 우회 방식이 작동하는 схема입니다.
- OpenAI 호환 액세스와 루블화 결제를 지원하는 제공업체로부터 API 키를 발급받습니다.
- 클라이언트 설정에서 키(Key)와 base_url을 포함한 두 줄의 코드를 변경합니다:
from openai import OpenAI
client = OpenAI(
...
- 번역 세션을 시작하고 오디오를 청크 (chunk) 단위로 전송하세요. 오디오와 두 개의 전사 (transcript)를 모두 수신합니다.
- 프로덕션 (production)에 적용하기 전에 사용 중인 언어 쌍과 배경 소음을 테스트하세요. 위의 벤치마크 (benchmark) 결과는 의미 전달 품질이 가변적임을 보여줍니다.
클라이언트 측은 특정 벤더 (vendor)에 종속되지 않습니다. Open WebUI (검색어: openwebui), 호환 가능한 IDE, 봇 및 자동화 도구들은 코드 재작성 없이도 이러한 엔드포인트 (endpoint)를 지원합니다. 러시아 서비스 중에서는 Yandex SpeechKit이 유사한 맥락에 있으나, 이는 음성 인식 및 합성 (speech recognition and synthesis) 기술이며 실시간 음성 대 음성 (speech-to-speech) 번역은 아닙니다. '인식 - 번역 - 음성 출력'으로 이어지는 캐스케이드 (cascade) 구조를 수동으로 구축해야 하며, 이로 인해 전체적인 지연 시간 (latency)이 발생합니다.
여기서 provod.ai (러시아의 OpenRouter)가 강점을 발휘합니다. OpenAI 및 Anthropic SDK와 호환되는 단일 API, 팀을 위한 통합 루블 잔액, 러시아 카드 결제, SBP(빠른 결제 시스템) 또는 증빙 서류가 포함된 계좌 이체 지원, 그리고 공식 요금에 마진을 붙이지 않은 가격을 제공합니다. 수요가 높은 새로운 모델들은 카탈로그에 매우 빠르게 추가됩니다. gpt-realtime-translate가 여기에 추가되면, 연결 방식은 바로 위의 리스팅과 동일할 것입니다.
provod.ai가 적합하지 않은 경우
요약하자면: 애그리게이터 (aggregator)가 불필요한 시나리오가 있습니다. 솔직한 목록은 다음과 같습니다.
- ChatGPT 내부의 번역만으로 충분한 경우: GPT-Live는 앱 내에서 프롬프트에 따라 음성으로 직접 번역합니다. API, 코드, 또는 외부 서비스가 필요하지 않습니다.
- 폐쇄망 (closed circuit)이 필요한 경우: 애그리게이터는 클라우드 API 기반입니다. 보안 정책상 온프레미스 (on-prem) 및 자체 GPU가 필요하다면, 여기에는 해당하지 않으므로 셀프 호스팅 (self-hosted) 솔루션을 찾아야 합니다.
- OpenAI와 직접 엔터프라이즈 계약 (Enterprise contract)을 맺어야 하는 경우: 자체 SLA 및 개인별 조건은 벤더로부터 직접 계약해야만 가능합니다.
- 모델 출시 당일에 즉시 사용해야 하는 경우: 새로운 모델이 카탈로그에 빠르게 추가되기는 하지만 즉각적이지는 않습니다. 기다릴 여유가 없다면 해외 카드를 사용하여 직접 이용해야 합니다.
클러스터 검색어 사전: 사람들이 "open ai fm"과 함께 검색하는 것들
요약하자면: 이 주제 주변에는 검색어의 '동물원(다양한 혼란스러운 검색어들)'이 형성되어 있습니다. 사용자가 무엇을 의도했을지 그룹별로 분석해 보겠습니다.
오타, 키보드 배열 및 "다운로드 방법"
- "hpt" - "open ai chat hpt": ChatGPT의 오타.
- "kompyuter" - "chatgpt skachat kompyuter": 다운로드할 것은 없으며, 모든 것은 브라우저와 API를 통해 이루어집니다.
- "qilish" - 우즈베크어로 동일하게 "다운로드"를 의미.
- "уеуоа" 및 "роиеа" - 무료 생성기를 검색하는 과정에서 잘못된 키보드 배열로 입력된 의미 없는 문자열.
- "мирджони" - 의미 없는 음차(translit); 무료 신경망(neural network)을 검색하려던 시도.
- "ojol" - "open ojol ai": 오타이며, 해당 제품은 존재하지 않음.
- "хей" - "헤이 브로, 신경망(neural network)": 호칭일 뿐, 제품명이 아님.
- "ыр" - 카자흐어 음악 검색어의 파편.
서드파티 (Third-party) 서비스 및 파일
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기