ESP32-S3에서 구동되는 실시간 음성 인식 'Oído'
요약
NVIDIA의 Conformer-CTC Small 모델을 ESP32-S3 같은 저가 마이크로컨트롤러에서 구동하는 오픈소스 구현체 'Oído'가 공개되었습니다. 이 시스템은 클라우드나 GPU 없이도 높은 정확도로 로컬 오프라인 음성 인식이 가능하며, 제한된 리소스에서도 고속 추론을 달성했습니다.
핵심 포인트
- ESP32-S3에서 Conformer 모델 구동이 가능합니다.
- 클라우드/GPU 없이 완벽한 로컬 오프라인 처리가 가능합니다.
- Whisper-tiny를 능가하는 높은 인식 정확도를 구현했습니다.
- 커스텀 C 엔진으로 리소스 효율성을 극대화했습니다.
NVIDIA의 음성 인식 모델인 'Conformer-CTC Small'을 int8 양자화하여, 5달러급 초저가 마이크로컨트롤러인 'ESP32-S3' 위에서 구동 가능한 오픈소스 구현체가 등장했습니다!
클라우드나 GPU, NPU를 사용하지 않고도 완벽하게 로컬 및 오프라인으로 처리가 가능하다는 점이 놀랍습니다. 심지어 Whisper-tiny를 능가하는 높은 인식 정확도(낮은 WER)와 실제 환경 노이즈에 대한 내성까지 구현했다고 합니다! 노이즈가 많은 환경에서도 확실하게 들을 수 있다는 것이 믿음직스럽네요.
커스텀 C 엔진을 이용한 효율적인 플래시 메모리 직접 읽기나, 프레임 단위의 활성화 양자화를 통해 제한된 리소스(PSRAM 2.4MB)에서도 고속 추론을 달성했습니다. 스마트 디바이스 개발의 선택지가 크게 넓어질 것 같은 설레는 기술이네요!
#에지AI
#음성인식
Oído의 GitHub 레포지토리 (소스 코드 및 구현 상세)
https://github.com/lokutor-ai/oido
Reddit 토론 스레드 (개발 관련 상세 정보 교환 및 Q&A)
https://reddit.com/r/LocalLLaMA/comments/1wu2jjy/o%C3%ADdo_speech_recognition_that_beats_whispertiny/
…
【Efficient PEFT Tuning of Yandex AliceAI-80B-A3B】
A method has emerged that allows efficient tuning of large-scale LLMs with limited resources! By keeping the base model's parameters intact and updating only the attention mechanisms and shared experts, it reportedly completes
AI 자동 생성 콘텐츠
본 콘텐츠는 X GPU/AI 하드웨어의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기