Show HN: Inworld TTS – 고품질, 저렴하고 낮은 지연 시간의 TTS
요약
Inworld TTS는 고품질의 음성 합성(TTS) 솔루션을 제공하며, 100ms 미만의 낮은 지연 시간으로 실시간 스트리밍이 가능합니다. 사용자 지정 음성을 여러 언어로 현지화하고, 자연어 설명만으로 즉시 프로덕션 레디 음성을 렌더링할 수 있습니다.
핵심 포인트
- 100ms 미만의 TTFB로 대화형 경험에 최적화된 실시간 스트리밍 제공
- 자연어 지침을 통해 악센트, 나이, 톤 등 다양한 요소 제어가 가능
- 크로스링구얼 클로닝으로 다국어에서 원어민 수준의 품질 보장
- 대규모 사용 시 매우 저렴한 비용 구조와 지속적인 가격 인하 정책 제시
모델이 생성하는 대로 오디오 청크를 스트리밍합니다. 100ms 미만의 TTFB(Time To First Byte)로 대화가 자연스럽게 느껴지도록 합니다.
모델이 생성하는 대로 오디오 청크를 스트리밍합니다. 100ms 미만의 TTFB(Time To First Byte)로 대화가 자연스럽게 느껴지도록 합니다.
5초에서 15초 분량의 오디오로 사용자 지정 음성을 만든 다음, 이를 200개 이상의 언어로 원어민처럼 현지화합니다: 동일한 정체성 유지, 악센트 유입 없음. Playground 또는 API를 통해 사용할 수 있는 프로덕션 레디(Production-ready) 음성입니다.
5초에서 15초 분량의 오디오로 사용자 지정 음성을 만든 다음, 이를 200개 이상의 언어로 원어민처럼 현지화합니다: 동일한 정체성 유지, 악센트 유입 없음. Playground 또는 API를 통해 사용할 수 있는 프로덕션 레디(Production-ready) 음성입니다.
녹음 과정을 완전히 건너뛸 수 있습니다. 자연어로 악센트, 나이, 톤, 에너지를 설명하면 Inworld가 즉석에서 프로덕션 레디 음성을 렌더링합니다. 카드에 있는 프리셋을 선택하여 단일 문장이 어떻게 완성된 음성이 되는지 들어보세요.
녹음 과정을 완전히 건너뛸 수 있습니다. 자연어로 악센트, 나이, 톤, 에너지를 설명하면 Inworld가 즉석에서 프로덕션 레디 음성을 렌더링합니다. 카드에 있는 프리셋을 선택하여 단일 문장이 어떻게 완성된 음성이 되는지 들어보세요.
처음부터 실시간(realtime) 사용에 최적화되었습니다: 오디오는 WebSocket을 통해 합성되는 즉시 생성됩니다. 버퍼링 지연이 없습니다. 경쟁사 대비 비슷한 수준의 낮은 지연 시간을 훨씬 저렴한 비용으로 제공합니다.
처음부터 실시간(realtime) 사용에 최적화되었습니다: 오디오는 WebSocket을 통해 합성되는 즉시 생성됩니다. 버퍼링 지연이 없습니다. 경쟁사 대비 비슷한 수준의 낮은 지연 시간을 훨씬 저렴한 비용으로 제공합니다.
텍스트 어느 곳에든 대괄호로 된 지침을 추가하면 Realtime TTS-2가 발화를 조정합니다. 다양한 비언어적 요소(non-verbals) 및 조절 가능한 일시 정지(adjustable pauses)와 결합하여 단순히 단어가 아닌 순간에 맞는 전달력을 구현할 수 있습니다.
텍스트 어느 곳에든 대괄호로 된 지침을 추가하면 Realtime TTS-2가 발화를 조정합니다. 다양한 비언어적 요소(non-verbals) 및 조절 가능한 일시 정지(adjustable pauses)와 결합하여 단순히 단어가 아닌 순간에 맞는 전달력을 구현할 수 있습니다.
영어, 스페인어, 프랑스어, 한국어, 중국어, 힌디어, 일본어, 독일어 등 다양한 언어를 지원합니다. 크로스링구얼 클로닝(cross-lingual cloning)을 통해 모든 언어에서 원어민 수준의 품질을 제공합니다. 별도의 파이프라인 없이 전 세계적으로 배포할 수 있습니다.
지원 언어 테스트: 영어, 스페인어, 프랑스어, 한국어, 중국어, 힌디어, 일본어, 독일어 등 다양한 언어를 지원합니다. 크로스링구얼 클로닝을 통해 모든 언어에서 원어민 수준의 품질을 제공합니다. 별도의 파이프라인 없이 전 세계적으로 배포할 수 있습니다.
실시간 TTS-2: 대규모로 사용 시 백만 문자당 $5부터 가능하며, 오디오 분당 약 반 센트 수준입니다. 대부분의 개발자에게 가격을 절반 이상 인하하여 실시간 음성 기능을 소비자 규모에서 항상 켜둘 수 있도록 했으며, 사용자 증가에 따라 요금은 계속 하락합니다. 오늘 제시된 가격은 상한선일 뿐, 마지노선이 아닙니다.
실시간 TTS-2: 대규모로 사용 시 백만 문자당 $5부터 가능하며, 오디오 분당 약 반 센트 수준입니다. 대부분의 개발자에게 가격을 절반 이상 인하하여 실시간 음성 기능을 소비자 규모에서 항상 켜둘 수 있도록 했으며, 사용자 증가에 따라 요금은 계속 하락합니다. 오늘 제시된 가격은 상한선일 뿐, 마지노선이 아닙니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN OpenAI Codex의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기