[연구 제안] 인지 샤딩(Cognitive Sharding): 소비자 하드웨어에서 컴퓨터 사용을 위한 시스템 아키텍처
요약
Cognitive Sharding은 거대한 단일 모델 대신 전문화된 여러 소형 모델들로 에이전트를 분할하고, 이를 제어 평면(control plane)으로 조정하는 시스템 아키텍처를 제안합니다. 이 방식은 각 모델을 트랜잭션적으로 로드/언로드하여 16GB 소비자 하드웨어 메모리 한계 내에서 완전한 로컬 컴퓨터 사용 스택 구동을 가능하게 합니다.
핵심 포인트
- 에이전트를 전문화된 여러 소형 모델로 분할합니다.
- 제어 평면(control plane)이 실행 상태와 모델 관리를 담당합니다.
- MoE가 아닌 시스템 수준의 독립적인 모델 조합입니다.
- 소비자 하드웨어 메모리 제약 내에서 로컬 구동을 목표로 합니다.
컴퓨터 사용 에이전트는 모든 인지 기능을 수행하기 위해 하나의 거대한 모델을 필요로 하지 않습니다. Cognitive Sharding은 에이전트를 전문화된 여러 모델로 분할하고, 이를 코드 소유의 제어 평면(control plane)을 통해 조정합니다. 현재 구현에는 다음이 사용됩니다:
- 추론 및 계획을 위한 Bonsai 2 27B
- 빠른 액션 선택을 위한 Qwen3.5 4B 기반 Kev 4B
- 시각적 접지(visual grounding)를 위한 UI-Mate 9B
제어 평면은 실행 상태, 모델 상주 여부(model residency), 검증, 재시도 및 복구를 담당합니다. 모델들은 에이전트 루프에 대한 무제한적인 제어 대신 제한된 결정만을 받습니다. 이러한 분리는 하드웨어 요구 사항을 변경합니다. 모델들은 현재의 실행 단계에 따라 트랜잭션적으로 로드되고 언로드될 수 있습니다. 따라서 이 시스템은 16 GB 소비자 컴퓨터의 메모리 한계 내에서 완전한 로컬 컴퓨터 사용 스택을 구동할 수 있습니다.
이는 Mixture-of-Experts (MoE) 모델과는 다릅니다. 샤드(shards)들은 서로 다른 입력, 학습 목표, 실행 시간 및 권한을 가진 독립적인 모델입니다. 이들의 조합은 단일 신경망 내부가 아닌 시스템 수준에서 이루어집니다. 접근 방식 문서에는 플래너–셀렉터–그라운더 아키텍처, 후보 구성(candidate construction), 제한된 실행(bounded execution), 환경 검증 복구(environment-verified recovery), 그리고 메모리 인식 모델 상주성(memory-aware model residency)이 설명되어 있습니다.
자세한 내용은 다음 링크에서 확인할 수 있습니다: https://github.com/off-grid-ai/cognitive-sharding#cognitive-sharding-a-systems-architecture-for-computer-use-on-consumer-hardware
추가 벤치마크를 통해 테스트하고 결과를 곧 발표할 예정입니다.
submitted by /u/alichherawalla
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기