pi를 위한 간단한 로컬 음성 입력 확장 프로그램을 만들었습니다 (nemotron 3.5 0.6B ASR)
요약
이 글은 Raspberry Pi 환경에서 작동하는 간단한 로컬 음성 입력 확장 프로그램을 소개합니다. NVIDIA Nemotron 3.5 ASR 0.6B 모델을 활용하여 별도의 서버 없이도 STT 기능을 구현했으며, 사용자가 키보드 단축키로 쉽게 접근할 수 있도록 설계되었습니다.
핵심 포인트
- NVIDIA Nemotron 3.5 ASR 0.6B를 사용하여 로컬에서 STT 서버 실행 가능
- 별도 서버 구축 없이 Pi 코딩 터미널에 통합된 간편한 확장 프로그램
- STT 결과는 일반 프롬프트 입력창에서 편집 및 수락 가능하며, LLM 단계 생략으로 단순화
이미 음성 입력을 위한 다양한 확장 프로그램들이 많이 존재하지만, 제가 찾은 것들은 모두 별도의 서버를 실행해야 했습니다. 저는 매우 단순한 것을 원했습니다. 제 pi 코딩 터미널만을 위해 로컬 STT (Speech-to-Text) 서버를 실행하는 것이죠. NVIDIA Nemotron 3.5 ASR 0.6B가 저에게는 명백한 선택지였습니다. 매우 작고, 다국어를 지원하며, 스트리밍 (streaming)을 지원하고, CPU에서도 실시간으로 충분히 빠르게 실행되기 때문입니다. 원래는 parakeet.cpp를 묶어서 만들려고 했으나, NVIDIA가 자체적인 GGML 기반 런타임(runtime)을 조용히 공개했다는 것을 발견했습니다: https://github.com/NVIDIA/NeMo-Speech.cpp 바로 어제 huggingface의 NVIDIA 공식 레포지토리에 업로드된 기존 Q8 GGUF 모델이 포함되어 있었기 때문에 이를 사용했습니다: https://huggingface.co/nvidia/nemotron-3.5-asr-streaming-0.6b 이 확장 프로그램 자체는 의도적으로 매우 기본적입니다. 키보드 단축키를 눌러 팝업이 열리면 STT 서버를 실행하고 huggingface에서 약 700MB의 모델을 다운로드합니다. 말을 하는 동안 텍스트가 나타나며, 해당 텍스트를 수락하거나 버릴 수 있습니다. 수락하면 일반 프롬프트 입력창에 들어가 편집할 수 있습니다. 설정에서는 사용자 정의 단축키와 언어를 허용하며, 기본 언어는 자동 감지됩니다. 원래는 정리를 위해 두 번째 LLM (Large Language Model) 단계를 추가할까 생각했지만, 그렇게 하면 더 복잡해질 것이라 판단했습니다. 또한 코딩 에이전트(coding agents) 자체만으로도 잘못된 전사(transcription) 내용을 이해하기에 충분히 훌륭하다고 생각합니다. Linux와 Windows에서 테스트를 마쳤습니다. MacOS용 빌드도 존재하지만 제가 테스트할 수는 없으므로, 만약 작동하지 않는다면 피드백을 주시면 감사하겠습니다. https://github.com/Danmoreng/talk-to-pi /u/Danmoreng에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기