
로컬 추론이 핵심일 때만 가능한 오픈소스(OSS) 활용 사례: 온디바이스 LLM이 당신의 삶 전체를 이해하고, Computer Use를 통해
요약
개인정보 보호를 위해 온디바이스 LLM을 활용하여 사용자의 데이터를 분석하고 선제적으로 작업을 수행하는 Sentient OS 프로젝트를 소개합니다. Gemma 4 모델과 Computer Use 기술을 결합하여 로컬 환경에서 지식 베이스를 구축하고 자동화된 업무 처리를 지원합니다.
핵심 포인트
- 온디바이스 추론을 통한 개인정보 보호 및 비용 절감
- Gemma 4 기반의 멀티모달 데이터 분석 및 지식 베이스 구축
- Computer Use 기술을 활용한 선제적 업무 자동화 및 제안
- LiteRT-LM 커스텀 포크 및 MTP, Flash Attention 등 최적화 기술 적용
안녕하세요 r/LocalLLaMA 여러분! :D 제가 로컬 모델로만 가능한 정말 멋진 완전 오픈소스(OSS) 프로젝트를 구축하고 있어 공유하고자 합니다. 바로 진정으로 선제적인(proactive) AI입니다! 기존의 모든 LLM 시스템은 프롬프트를 기다립니다. 하지만 진정으로 선제적인 AI는 지식 베이스(knowledge base)를 구축할 뿐만 아니라, 당신을 선제적으로 도울 수 있는 부분을 식별하기 위해 매일 당신의 삶 전체(모든 파일, 스크린샷, 채팅, 이메일...)를 읽어야 합니다. 클라우드 환경에서는 이는 프라이버시 재앙이자 너무나도 비싼 비용이 듭니다. 하지만 당신의 자체 실리콘(silicon) 위에서는 프라이버시가 보장되고, 무료이며, 무제한입니다. 온디바이스 추론(on-device inference)으로 가능한 영역을 확장하는 것이 Sentient OS의 핵심입니다 :D
매일 밤 새벽 3시, 시스템이 당신의 Mac을 깨우면 우리의 온디바이스 LLM(LiteRT LM의 커스텀 포크에서 실행되는 Gemma 4 E4B; 자세한 내용은 아래 참조!)이 당신의 삶에서 새로 생긴 것들을 읽습니다: 파일, 스크린샷(멀티모달 (multimodal)!), WhatsApp, iMessage, 그리고 로컬 데이터베이스에서 직접 디코딩된 Apple Notes와 이메일 등입니다. 시스템은 쓰레기 데이터나 민감한 정보를 분류(triage)하고 각 항목을 요약합니다. 그리고 Sentient는 마침내 당신의 삶 전체에 대한 지식 베이스(기본적으로 폴더와 MD 파일이 있는 Obsidian vault 형태)를 생성하며, 우리가 선제적으로 당신을 도울 수 있다고 생각하는 정보들도 함께 정리합니다.
따라서 아침이 되면, 시스템은 선제적으로 당신의 잡무를 찾아내고, 조사하고, Computer Use를 통해 대신 처리해주겠다고 제안합니다! 답장하는 것을 잊었던 메시지는 당신의 개인적 맥락(context)을 바탕으로 초안이 작성되어 있고, 내일 갱신될 구독 서비스도 포착됩니다. 그리고 Sidekick 기능: Mac의 노치(notch)를 클릭하고 "이것 좀 끝내줘"라고 말하면, Computer Use가 당신의 앱과 브라우저에서 작업을 수행합니다 (심지어 당신이 컴퓨터를 사용하는 동안 백그라운드에서 앱을 클릭하며 작업할 수도 있습니다!). 이 Computer Use 또한 당신의 지식 베이스, 즉 로컬 스택(local stack)에 기반합니다! :D
Gemma 4 E4B는 시각 기능이 포함된 멀티모달(multimodal) 모델이며, 커스텀 LiteRT-LM 포크 위에서 작동합니다. 우리는 MTP/투기적 디코딩(speculative decoding), Flash Attention, 그리고 스마트 KV 캐시 재사용(smart KV cache reuse) 기술을 사용합니다! 또한 로컬 모델로 Computer Use가 작동하도록 Codex CLI를 역공학(reverse engineered)했습니다! :) 그리고 새벽 3시에 추론을 위해 덮개가 닫힌 Mac을 안정적으로 깨우기 위해 macOS 전원 관리 시스템을 역공학해야 했답니다 ㅎㅎ!
Sentient의 커스텀 Gemma 4 E3B가 연산(compute)의 90%를 수행하며, 나머지 10%는 "프런티어 (frontier)" 모델이 필요합니다. 그 부분은 여러분이 제공합니다! 저는 Qwen 3.7 35B A3B를 사용하여 컴퓨터 사용(computer use)을 구동하는 과정에서 큰 재미를 느꼈고, 최고의 성능을 위해서는 Kimi K3가 믿기지 않을 정도로 잘 작동합니다! 또한, 그 10%의 프런티어 연산을 위해 본인의 ChatGPT/Codex 구독을 사용하거나, OpenRouter 또는 본인의 엔드포인트(endpoint)를 사용할 수도 있습니다. 심지어 LM Studio를 위한 자체적인 퍼스트 파티(first-party) 지원도 내장되어 있습니다! :) 아키텍처에 의해 강제되는 개인정보 보호! 여러분의 가공되지 않은 데이터(raw data)는 절대 기기를 떠나지 않습니다. 만약 클라우드 엔드포인트를 사용하기로 선택하더라도, "프런티어" 모델은 개인정보(PII)가 제거된 요약본만을 보게 됩니다. 어디에도 계정은 존재하지 않으며, 전체 스택(앱 + 인프라)은 완전히 오픈소스(OSS)입니다 :D (저는 오픈소스를 사랑합니다 -- 여러분 중 일부는 제가 Apple Intelligence Writing Tools를 Windows로 포팅한 오픈소스 프로젝트인 https://github.com/theJayTea/WritingTools 의 개발자로 저를 알고 계실지도 모르겠네요)! https://sentient-os.ai brew install --cask sentient-os-labs/tap/sentient-os 소스 코드 (자유롭게 스타를 눌러주세요! :D): https://github.com/Sentient-OS-Labs/sentient-os Apple Silicon (M1 이상), macOS 15 이상, 8GB RAM이면 충분합니다. 일반 사용자에게는 영구적으로 무료입니다! :D 저의 로컬 LLM 컴퓨터 사용 평가(evals)에 대해 더 많은 내용을 공유하고 싶습니다! 저는 Kimi K3가 미친 듯이 잘 작동하는 반면, Qwen 3.7 35B A3B는 매우 단순한 작업만 수행할 수 있다는 것을 발견했습니다. 그리고 여러분이 컴퓨터 사용과 함께 시도해 볼 만한 멋진 모델 추천이 있다면 알려주세요! :D /u/TechExpert2910 님이 r/LocalLLaMA 에 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기