
Microsoft의 오픈 소스 VibeVoice 프로젝트, 음성 AI의 기준을 높이다
요약
Microsoft가 오픈 소스 음성 AI 프로젝트인 VibeVoice를 공개했습니다. 이 프로젝트는 긴 대화 생성, 다중 화자 유지, 감정 표현 및 실시간 TTS/ASR 기능을 제공합니다.
핵심 포인트
- 최대 90분 분량의 자연스러운 대화 생성 가능
- 하나의 출력에서 4명의 서로 다른 화자 유지
- 감정이 담긴 유창한 대화 및 실시간 TTS 지원
- 누가, 언제, 무엇을 말했는지 추출하는 고성능 ASR 제공
- MIT 라이선스로 공개된 강력한 오픈 소스 프로젝트
Microsoft의 오픈 소스 (Open Source) VibeVoice 프로젝트가 음성 AI (Voice AI) 분야의 기준을 높이고 있습니다.
단순히 텍스트를 음성으로 변환하는 것에 그치지 않습니다:
✅ 최대 90분까지 한 번에 자연스러운 대화를 생성할 수 있습니다.
✅ 하나의 음성 출력에서 4명의 서로 다른 화자를 유지할 수 있습니다.
✅ 감정이 담긴 유창한 대화를 생성할 수 있습니다.
✅ 실시간 (Realtime) TTS 모델도 제공합니다.
✅ ASR 모델은 60분 분량의 음성을 단 한 번의 과정으로 텍스트로 변환하며, "누가, 언제, 무엇을 말했는지"에 대한 정보도 함께 추출할 수 있습니다.
팟캐스트, 교육, AI 어시스턴트, 콜 센터 및 비디오 콘텐츠를 개발하는 이들에게 매우 강력한 레퍼런스 (Reference) 프로젝트입니다.
MIT 라이선스로 오픈 소스화되었으며, GitHub에서 47K+ 이상의 스타 (Star)를 기록했습니다.
다음 AI 음성 프로젝트를 위해 저장해 두세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @aladagberk (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기