음성을 서버에 업로드하지 않는 macOS용 오픈 소스 음성 입력기 제작
요약
Cadenza는 음성을 서버에 업로드하지 않고 macOS 기기 내에서 작동하는 오픈 소스 음성 입력기입니다. 사용자의 프라이버시 보호를 최우선으로 하며, 로컬 우선 아키텍처를 채택했습니다. SenseVoice 등 다양한 모델을 sherpa-onnx로 구동하여 네트워크 연결 없이도 높은 정확도의 텍스트 변환이 가능합니다.
핵심 포인트
- 음성 데이터를 서버에 전송하지 않는 프라이버시 중심의 음성 입력기입니다.
- macOS 14+ 환경에서 작동하며, Apple Silicon 및 Intel을 지원하는 오픈 소스 프로젝트입니다.
- SenseVoice, FireRedASR2 등 다양한 ASR 모델을 로컬에서 실행하여 네트워크 연결 없이 사용 가능합니다.
음성을 서버에 업로드하지 않는 macOS용 오픈 소스 음성 입력기를 만들었습니다.
대부분의 음성 입력 도구는 모든 녹음을 누군가의 서버에 업로드합니다. 저는 더 간단한 것이 필요했습니다. 단축키를 누르고, 말하고, 놓으면 — 텍스트가 커서 위치에 나타나고, 제 목소리는 Mac을 떠나지 않습니다.
그래서 Cadenza (随言)를 만들었습니다. MIT 오픈 소스이며, macOS 14+, Apple Silicon 및 Intel을 지원합니다.
- Repo: https://github.com/DragonKingIO/Cadenza-voice
- Site & docs: https://dragonkingio.github.io/cadenza-site/
로컬 우선(local-first) 방식이 필요한 이유
이 분야는 신뢰성 문제가 있습니다. 우리는 인기 있는 받아쓰기 앱들이 업데이트 후 정확도가 떨어지고, 스크린샷 스캔들에 휘말리며, 평생 가격이 $249에서 $849로 치솟는 것을 지켜보았습니다. 이들 모두 사용자의 음성을 자신들의 서버를 통해 전송합니다.
Cadenza의 해답은 아키텍처에 있습니다: 인식 과정이 사용자 기기에서 이루어집니다. 끝입니다. 침해할 서버도, 소환할 녹음 파일도, 인상할 구독료도 없습니다.
작동 방식
1. 말하기 위해 누르기(Hold to talk). 단축키를 길게 누릅니다 (설정 가능; 탭하여 토글하는 것도 가능합니다). 작은 녹음 바가 현재 상황을 보여줍니다 — 녹음 중, 인식 중, 완료.
2. 기기 내 인식(Recognize on-device). 선택 가능한 5가지 모델이 있습니다 — SenseVoice (제가 추천하는 모델), FireRedASR2, Paraformer, Parakeet, Qwen3-ASR — sherpa-onnx를 통해 로컬에서 실행됩니다. 모델은 앱 내부에서 체크섬 검증과 함께 다운로드되며, 추론(inference) 과정에 네트워크 연결이 전혀 필요하지 않습니다. 목록에는 각 모델의 속도, 메모리 사용량, 구두점 지원 여부가 표시되어 있어 트레이드오프를 선택할 수 있습니다.
3. 텍스트가 커서에 표시됩니다(Text lands at your cursor). 키를 놓으면 받아쓰기가 커서가 있는 곳 어디든 타이핑됩니다. 채움말(
클라우드 제공업체를 사용하고 싶다면, 직접 API 키를 가져와야 하며, 각 제공업체는 개별적으로 승인한 경우에만 오디오를 받습니다. 지원되는 서비스: OpenAI, Groq, Google, Azure, AssemblyAI, ElevenLabs 외에도 모든 OpenAI 호환 엔드포인트가 지원됩니다. 이 기능들은 선택적 음성 번역 단축키(별도의 단축키로 직접 번역문을 입력)와 AI 다듬기 단계에서도 사용됩니다.
솔직하게 말씀드리자면: 저는 아직 실제 유료 계정으로 클라우드 제공업체를 테스트해 보지 못했습니다. 만약 사용해보신다면, 어떤 결과였는지 정말 듣고 싶습니다.
실용 어휘어 (Made for real vocabularies)
고유명사, 프로젝트 이름, 전문 용어를 위한 어휘 관리자가 있으며 가져올 수 있는 공유 팩도 있습니다. 이 기능은 필기(dictation)가 업무에 실제로 사용 가능한지 결정하는, 화려하지 않지만 가장 중요한 기능입니다.
현재 테스트 중인 기능: 스크린샷 OCR (영역을 선택하여 온디바이스 Apple Vision 또는 PP-OCR로 텍스트를 읽기).
상태: 초기 미리 보기, 일일 업데이트
저희는 매일 사용하고 있지만, 아직 많은 환경에서 테스트되지는 않았습니다. 실질적인 두 가지 참고 사항이 있습니다:
- 아직 Apple의 공증(notarized)을 받지 못했기 때문에, 첫 실행 시 시스템 설정(System Settings) → 개인 정보 보호 및 보안(Privacy & Security) →
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기



