
사용을 통해 성장하는 메모리를 갖춘 LLM 에이전트용 오디오 인지 레이어
요약
지속적인 오디오 입력과 이벤트 기반 인식을 통해 LLM 에이전트의 청각 능력을 확장하는 오픈 소스 프레임워크를 소개합니다. CLAP, Whisper, sqlite-vec 등을 활용하여 로컬에서 실행되며, 사용을 통해 새로운 개념을 학습하고 메모리를 확장하는 구조를 가집니다.
핵심 포인트
- 지속적인 오디오 스트림을 처리하는 이벤트 기반 인지 스택 구축
- CLAP 임베딩과 sqlite-vec을 활용한 개념 메모리 및 유사도 검색
- 새로운 소리를 에이전트가 학습하여 서버 측 패스트 패스로 전환하는 메커니즘
- 로컬 실행 중심의 프레임워크로 다양한 LLM 제공업체와 연동 가능
LLM은 음성-텍스트 변환(Speech-to-Text)을 거치고 나면 음성을 잘 처리합니다. 하지만 그 외의 것들은 듣지 못합니다: 밖에서 들리는 새소리, 두 방 너머에서 유리가 깨지는 소리, 두 층 아래에서 울리는 화재 경보음 같은 것들 말이죠. 저는 이 간극을 메우는 것을 목표로 하는 실험적인 오픈 소스 프레임워크를 작업해 왔습니다: 지속적인 오디오 입력(Continuous audio in), 이벤트 기반 인식 출력(Event-gated recognition out), 그리고 사용을 통해 성장하는 개념 메모리(Concept memory)를 갖춘 프레임워크입니다. 전체 인지 스택은 로컬에서 실행됩니다: CLAP, Whisper, Silero VAD, sqlite-vec을 사용합니다. 분류기(Classifier)는 fast-agent를 거치므로, 어떤 LLM 제공업체(Ollama-local 포함)와도 연동이 가능합니다. https://i.redd.it/6rv9qvv0cfdh1.gif 이 루프는 청각이 대략적으로 작동하는 방식을 모방합니다: 게이트(Gate) — 에너지/참신함/Silero-VAD가 지속적인 스트림을 후보 영역으로 다듬습니다. 대부분의 오디오는 시스템의 나머지 부분에 도달하지 않습니다. 지문(Fingerprint) — CLAP 임베딩(Embedding) + 약 20여 개의 상징적 특징(Spectral shape, Harmonics, Peaks, Temporal drift). 인식(Recognize) — 학습된 개념에 대해 sqlite-vec의 top-k 코사인 유사도(Cosine similarity)를 계산합니다. 보정된 개념과 강력하게 일치하면 서버 측에서 실행되며, LLM 호출은 발생하지 않습니다. 약하거나 일치하지 않는 경우 에이전트에게 노출됩니다. 처리되지 않음(Unhandled) — 에이전트가 인식할 수 없는 모든 것은 지문 및 전문가의 추측과 함께 큐(Queue)에 들어가 교사(Teacher)가 라벨을 붙여주기를 기다립니다. 라벨링(Label) → 새로운 개념 생성. 에이전트는 가공되지 않은 오디오가 아닌 세 가지 상징적 레이어를 통해 추론합니다: JSON 형태의 신호 특징(Signal features), 메모리에 대한 임베딩 유사도 점수, 그리고 전문가 라벨입니다. 충분한 예시가 쌓이면, 개념은 임계값(Threshold)을 자동 보정하고 서버 측 패스트 패스(Fast path)로 이동합니다; 이후의 일치 항목에 대해서는 LLM 호출이 필요 없습니다. 별도의 학습은 필요하지 않습니다; 사전 학습된(Pretrained) CLAP 임베딩이 그 역할을 수행합니다. 현재 이 시스템은 세 가지 전문가(Whisper, BirdNET, AST)와 함께 배포됩니다; 레지스트리(Registry)는 더 많은 분류기로 확장 가능합니다. 각 분류기는 평이한 영어 계약(Plain-English contract)을 선언하므로, LLM은 이를 어떻게 그리고 언제 사용할지 알 수 있습니다. 잠재적인 응용 분야: 예상치 못한 충돌에 반응하는 로봇, 오븐이 여전히 비프음을 내고 있는 것을 듣는 비서, 베어링 고장이 발생하기 전에 이를 포착하는 산업용 모니터 등입니다. 재미있는 연구 프로젝트에 더 가깝습니다; 제 개인 녹음본으로 가볍게 평가했을 뿐이며, 아직 공식적인 벤치마크는 없습니다.
피드백을 환영합니다! - 저장소 (Repo): https://github.com/es617/audient - 다이어그램 및 데모가 포함된 설명글: https://es617.dev/2026/07/07/audient-ears/ /u/es617_dev 에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기