AI Gateway에서 이제 스트리밍 전사 (Streaming Transcription)를 지원합니다
요약
AI Gateway가 실시간 스트리밍 전사(Streaming Transcription) 기능을 지원하기 시작했습니다. 오디오 캡처와 동시에 전사 업데이트를 받을 수 있어 실시간 자막이나 음성 입력 서비스의 지연 시간을 크게 낮출 수 있습니다.
핵심 포인트
- 오디오 파일 전체가 아닌 스트리밍 방식으로 실시간 전사 가능
- 실시간 자막 및 저지연 음성 입력 구현에 최적화
- Edge Function 및 AI SDK의 streamTranscribe 함수 지원
- 기존 텍스트 기반 에이전트에 음성 모드 쉽게 통합 가능
AI Gateway에서 이제 스트리밍 전사 (streaming transcription)를 지원합니다. 이전에는 전사 (transcription)를 위해 전체 오디오 파일이 필요했으며, 단일 응답으로 전체 전사 내용을 반환했습니다. 이제 오디오가 캡처되는 대로 스트리밍할 수 있으며, 모델이 생성하는 대로 전사 업데이트를 받을 수 있어 실시간 자막 (live captioning)이나 음성 입력 (voice input)과 같은 용도에서 지연 시간 (latency)을 낮게 유지할 수 있습니다. streaming transcription
스트리밍 전사 (Streaming transcription)는 베타 버전이며, 스트리밍이 가능한 모든 전사 모델과 함께 Edge Function을 통해 사용할 수 있습니다. AI SDK streamTranscribe
아래 예제는 원시 PCM 오디오를 스트리밍하고 각 전사 델타 (transcript delta)가 도착할 때마다 출력합니다. 결과 스트림에는 부분 전사 (partial transcripts)와 최종 전사 (final transcripts)가 모두 포함됩니다: openai/gpt-realtime-whisper
동일한 코드는 제공업체 전반에서 작동합니다: 사용하려는 모델 문자열을 다른 streaming-capable transcription model로 교체하기만 하면 됩니다. xai/grok-stt
스트리밍 전사 (Streaming transcription)를 사용하면 에이전트 (agent)에 음성 모드 (voice mode)를 쉽게 추가할 수 있습니다. 사용자의 음성을 전사 모델로 스트리밍하고 실시간 텍스트를 에이전트에 전달하세요. 에이전트 자체는 변경되지 않습니다. 에이전트는 여전히 텍스트를 받으므로, 모든 텍스트 기반 에이전트와 함께 작동합니다. 말을 하는 에이전트의 경우, 이를 음성 생성 (speech generation)과 결합하거나 완전한 양방향 대화를 위해 실시간 음성 (realtime voice)을 사용하세요.
AI Gateway의 스트리밍 전사 (streaming transcription)에 대한 자세한 내용은 documentation을 참조하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Vercel AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기