Hugging Face가 음성 대화 AI의 기반을 통째로 공개했습니다. ★8,267, Apache-2.0
요약
Hugging Face가 음성 대화 AI를 위한 모듈형 프레임워크를 공개했습니다. OpenAI의 Realtime 인터페이스와 호환되며, 음성 인식부터 TTS까지 모든 단계를 교체 가능한 구조로 설계했습니다.
핵심 포인트
- OpenAI Realtime 호환 인터페이스 지원
- 음성 인식 및 TTS의 로컬 작동 지원
- llama.cpp를 통한 AI 모델 연결 가능
- pip 설치 한 줄로 간편한 서버 실행
【공식】
Hugging Face가 음성으로 대화하는 AI의 기반을 통째로 공개했습니다. ★8,267, Apache-2.0.
듣기 → 받아쓰기 (Transcription) → AI → 읽어주기 (TTS)의 4단계가 전부 교체 가능한 부품으로 구성되어 있습니다.
・OpenAI의 Realtime 호환 인터페이스이므로, 기존 클라이언트의 접속 대상만 변경하면 바로 연결됩니다.
・받아쓰기와 읽어주기는 로컬에서 작동하며, AI 부분도 llama.cpp로 연결할 수 있습니다.
・pip install speech-to-speech 한 줄로 서버가 실행됩니다.
소형 로봇 Reachy Mini 수천 대의 대화 부분이 이것으로 실제 가동 중입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @opensourcelab9 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기