OpenAI Whisper API를 활용한 오픈 소스 음성-텍스트 변환 솔루션
요약
OpenAI의 강력한 Whisper 기능을 활용하는 오픈 소스 음성-텍스트 변환 마이크로서비스가 소개되었습니다. Node.js, Bun.sh, Typescript로 구축되었으며 Docker 환경에서 쉽게 배포할 수 있습니다. 이 서비스는 다국어 인식과 배경 소음 처리 능력을 갖추고 있어 다양한 애플리케이션에 활용 가능합니다.
핵심 포인트
- Node.js/Bun.sh 기반의 오픈 소스 ASR 솔루션 제공
- Docker를 통해 의존성 없이 쉽게 배포 및 사용 가능
- 다국어 인식, 배경 소음 처리 등 강력한 전사 기능 지원
- MIT 라이선스로 상업적 프로젝트에 활용 용이
음성-텍스트 및 기타 기능을 위한 오픈 소스 솔루션
OpenAI의 whisper api의 강력함을 활용하는 오픈 소스 AI 모델 마이크로서비스인 OpenAI Whisper API에 오신 것을 환영합니다. 이 서비스는 최첨단 자동 음성 인식(ASR) 시스템을 대규모 언어 모델로 사용합니다. Node.js, Bun.sh, 그리고 Typescript로 구축된 이 서비스는 Docker에서 의존성 없이 실행되도록 설계되어, 다양한 음성 및 언어 관련 애플리케이션 개발자들에게 다재다능한 도구가 됩니다.
Whisper API는 방대한 양의 다국어 및 멀티태스크 훈련 데이터(광범위한 오디오 파일 및 녹음 포함)로 훈련된 음성-텍스트 모델입니다. 이는 언어 식별, 음성 번역과 같은 작업을 처리할 수 있는 단일 모델이며, 물론 말하는 단어를 글로 변환하는 기능도 수행합니다.
이 모델은 토큰 시퀀스를 처리할 수 있으며 자연어와 작동할 수 있어 머신러닝 애플리케이션에 강력한 도구입니다. 다국어 음성 인식을 처리하도록 설계되었으며, 배경 소음까지 관리할 수 있어 비디오 통화, Zoom 통화, YouTube 영상 또는 영어 언어로 된 채팅 외 사용 사례를 완벽하게 전사하는 데 유용합니다.
이 API는 간단하며 모든 숙련도의 개발자가 쉬운 개발자 접근성을 통해 사용하도록 설계되었습니다. 오픈 소스 프로젝트이며 MIT 라이선스로 라이선스가 부여되어 있어, 몇 가지 제한만으로 자체 프로젝트에 사용할 수 있습니다. 음성 메시지를 전사하거나, 일련의 시스템 전체 최적화를 통해 시스템 성능을 개선하거나, OpenAI Whisper API의 기능을 탐색하려는 경우, 이곳에서 시작할 수 있습니다. 다음 코드를 살펴보며 이 강력한 도구를 사용하는 방법을 첫 단계로 학습하고 새로운 api 키를 받아 OpenAI 계정을 확보하세요.
이것은 Docker에서 실행될 수 있는 Node.js / Bun.sh / Typescript를 사용한 OpenAI Whisper API 마이크로서비스입니다. 의존성이 없습니다.
/transcribe에 리스닝합니다.
MP3 파일에 대한 라우트(route)를 제공하고 텍스트 전사본을 반환합니다.
먼저 bun.sh를 설치한 후, 이 디렉토리를 클론하고 다음 명령어를 실행하세요:
bun install
bun run dev
이제 http://localhost:3000 또는 제공된 PORT로 이동하여 아래 사용법(Usage) 섹션을 확인하실 수 있습니다.
이 디렉토리를 클론하고 다음 명령어를 실행하세요:
(PROJECT_ID를 본인의 Google Cloud 프로젝트 ID로 교체하세요)
docker build --platform linux/amd64 -t gcr.io/PROJECT_ID/whisper-docker .
docker push gcr.io/PROJECT_ID/whisper-docker
gcloud run deploy whisper-docker \
...
서비스 URL을 받게 되며, 아래 사용법(Usage) 섹션을 확인하세요.
URL의 /ping 엔드포인트에 접속하여 일반 HTTP를 테스트할 수 있습니다.
/transcribe에 연결하고 다음 본문(body)으로 POST 요청을 보내세요:
{
"audio": "BASE64_ENCODED_AUDIO"
}
OpenAI API Key를 헤더(HEADER)로 전달해야 합니다:
Authorization: Bearer OPENAI_KEY
또는 OPENAI_KEY를 환경 변수(env)에 넣어 docker 이미지를 실행하거나 서버를 시작할 수 있습니다:
OPENAI_KEY=YOUR_KEY_HERE bun run dev
# 또는
docker run -p 3000:3000 -e OPENAI_KEY=YOUR_KEY_HERE gcr.io/magicbuddy-chat/whisper-docker
...
저희는 이 Whisper API를 Telegram ChatGPT 봇인 MagicBuddy와 함께 사용하고 있습니다.
여기에 OpenAI Whisper Docker를 라이브 예시로 사용할 수 있습니다:
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub AI Coding Assistants의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기