Whistle: 16.9MB 파일 크기의 음성 인식(ASR) 모델 소개
요약
Cactus Compute가 초소형 장치용 ASR 모델인 Cactus Whistle을 공개했습니다. 이 모델은 Whisper base 대비 파일 크기가 9배 작고 속도가 6배 빠르며, 다양한 유럽 언어를 지원합니다. 지능 압축을 통해 저전력/저사양 기기(웨어러블, 마이크로컨트롤러)에 AI를 적용하는 것을 목표로 합니다.
핵심 포인트
- Whisper base 대비 파일 크기가 9배 작고 속도가 6배 빠름.
- 55M 파라미터 (36M 활성), CQ2bit 양자화로 16.9MB의 초소형 모델 구현.
- 웨어러블, 마이크로컨트롤러 등 저전력/저사양 장치에 AI를 적용하는 데 중점.
- Keyword biasing 기능을 통해 특정 키워드 검색 정확도를 높임.
안녕하세요, 저희는 초소형 장치용 ASR (Automatic Speech Recognition) 모델인 Cactus Whistle을 설계했습니다. 완벽하지는 않지만, 파일 크기는 Whisper base보다 9배 작고 속도는 6배 빠른 성능을 보여줍니다. Whistle은 영어(English), 독일어(German), 프랑스어(French), 스페인어(Spanish), 이탈리아어(Italian), 네덜란드어(Dutch), 폴란드어(Polish)를 지원합니다.
기억해 주세요. Cactus Compute의 목표는 규모로 SOTA (State-of-the-Art)를 달성하는 것이 아니라, 지능을 압축하여 예산형 휴대폰, 웨어러블 기기, 스마트 홈, 마이크로컨트롤러와 같은 작고 간과된 장치에 가져다주는 것입니다.
Whistle은 55M 파라미터(36M 활성)이며 CQ2bit 양자화되어 총 16.9MB의 파일 크기를 가지며, LibriSpeech test-clean에서 4.31 WER (Word Error Rate), test-other에서 10.49를 기록했습니다. 이는 Whisper base가 145.3MB일 때 각각 4.9와 11.0을 기록한 수치에 비해 우수한 성능입니다. FLEURS 평균에서는 21.4로, 대비되는 24.5보다 낮습니다. SPGISpeech에서는 7.65, Earnings-22에서는 19.01을 기록했습니다.
아키텍처의 경우, log-mel 프런트 엔드와 컨볼루션 스템이 오디오 인코더에 피드를 제공하고, Simple Attention + Hadamard MLP 디코더가 모든 레이어에서 게이티드 크로스 어텐션(gated cross attention)을 통해 이를 읽습니다. 이 디코더는 Needle의 방식처럼 계단식으로 구성되어 있어 2개 레이어부터 깊이별 배포가 가능합니다.
키워드 바이어싱(Keyword biasing)은 사용자가 실제로 말하는 이름을 가져와 비어 검색(beam search) 중에 해당 이름에 가중치를 부여하여, 모델이 존재한다고 학습하지 못한
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기