로컬 LLM을 위한 네이티브 메모리
요약
Aimee 프로젝트가 LLM의 자가 학습 네이티브 메모리 구현을 완료하고 관련 플러그인을 출시했습니다. 이 기술은 모델 재학습 없이도 외부 지식 저장소에 접근하게 하여, 소형 모델의 지식 기반 한계를 확장합니다. 이는 트랜스포머 및 Mamba 아키텍처 전반에 적용 가능하며, 기존 메모리 방식보다 훨씬 빠르고 효율적입니다.
핵심 포인트
- 모델 재학습 없이 외부 지식 저장소에 접근 가능
- 트랜스포머와 Mamba 등 다양한 아키텍처에 적용 가능
- 기존 컨텍스트 창 페널티가 없는 네이티브 메모리 소비 방식
- 작은 모델의 지식 기반 한계를 확장하는 혁신적인 방법
요약하자면: 컨텍스트 없이 LLM 수준에서 직접 메모리를 소비하는 방식입니다. 이는 트랜스포머 기반 모델뿐만 아니라 Mamba 및 유사 아키텍처에도 일반적으로 적용 가능합니다. 이제 소형 모델도 자체 가중치에 포함된 내용을 훨씬 뛰어넘는 지식 저장소에 접근할 수 있게 되었으며, 새로운 지식을 습득하기 위해 더 이상 모델을 재학습할 필요가 없습니다. aimee 프로젝트는 세 가지 목표 중 첫 번째인 자가 학습 네이티브 모델 메모리 구현을 완료했다고 발표하며 관련 사전 논문(및 정식 출판 진행 중)을 게재하고, 일반적으로 사용 가능한 플러그인을 출시했습니다. https://github.com/RakuenSoftware/aimee 현재 Qwen 3.8 27B, Gemma4 E2B, E4B, 12B 및 26B에 대해 Aimee 메모리를 네이티브로 소비할 수 있도록 하는 다섯 개의 vLLM 플러그인을 출시하고 있습니다. 이것은 컨텍스트가 아니며, 전통적인 메모리가 가지는 것과 같은 컨텍스트 창 페널티도 없습니다. 이는 모델 자체가 Aimee의 자가 학습 기능을 갖춘 상태로 Aimee 메모리를 네이티브하게 소비하는 것입니다. 이 접근 방식은 트랜스포머 기반 모델, 파생된 트랜스포머 아키텍처, Mamba 및 유사 아키텍처 전반에 걸쳐 일반적으로 적용 가능합니다. 저희가 테스트한 대용량 메모리 워크로드에서, 이는 동일한 메모리를 텍스트로 제공하는 것보다 극적으로 빠릅니다. 이 접근 방식은 일반적으로 확장 가능하고 사용 가능합니다. 현재는 더 광범위한 상업화를 진행하고 있으며 논문 출판을 준비 중입니다. DeepSeek이 다음이며, 저희가 관심을 갖거나 사람들이 요청하는 다른 모델들이 뒤따를 것입니다. 코드는 오픈 소스로 공개될 예정입니다. 지금은 모델 패밀리 전반에 걸쳐 이러한 통합을 구조화하는 방법에 대한 일관된 아키텍처를 구축하는 데 주력하고 있습니다. 모든 관련 실험 데이터와 소스 코드는 논문이 출판될 때 공개될 계획입니다. https://zenodo.org/records/23077865는 저희가 어떻게 했는지 설명하는 초기 사전 논문입니다. 마지막 발표(모든 모델에서 소비 가능한 자가 학습 메모리)가 상당히 컸다는 것을 이해하지만, 이번 내용은 그 이상을 넘어섭니다.
이를 통해 모델의 학습된 파라미터에 존재해야 할 지식을 외부화하고 업데이트할 수 있으며, 동시에 다양한 모델이 그 지식을 네이티브하게 소비하도록 합니다. 네, 저희는 이 기술이 모델 자체의 가중치(weights)에 합리적으로 담길 수 있는 것보다 훨씬 더 많은 기억된 지식에 접근할 수 있게 해준다고 주장합니다. 이것이 작은 모델을 추론 능력 면에서 훨씬 큰 모델과 동등하게 만든다는 의미는 아니지만, 기억된 지식에 대한 하드 리미트(hard limit)로서 파라미터 개수를 제거한다는 의미입니다. 이는 Aimee 프로젝트의 핵심 믿음으로 돌아갑니다: 추론은 모델 안에 있어야 하고, 메모리는 하네스(harness) 안에 있어야 합니다. 저희가 AI 발견을 일반인도 소비할 수 있게 만드는 것이 핵심 목표 중 하나라는 Aimee 프로젝트의 오랜 입장에 따라, https://rakuensoftware.com/blog/native-memory-without-retraining 에서 공개된 기사를 보시면 이 개념이 비학술적인 형식으로 무엇인지 설명하고 있을 것입니다. 궁금한 점이 있다면 기꺼이 답변드리겠습니다. 또한 Aimee 프로젝트의 2단계에서 초기 성공을 발표합니다: 모델에 일반적으로 적용 가능한 추론 개선입니다. 저희는 이미 Gemma4 26B와 같은 기존 모델들이 수행하는 작업을 기반으로 추론 능력을 향상시킬 수 있는 역량을 핵심 POC(Proof of Concept) 수준에서 시연했습니다. 이것이 1단계가 매우 중요했던 이유입니다: 1단계 없이는 2단계를 시작할 수 없었습니다. 근본적인 모델의 지식 기반을 지속적으로 업데이트하고 그 지식 기반을 모델로부터 분리하는 능력이 없다면, 저희는 추론 개선이 안전하거나 일반적으로 유지 가능한 방식으로 불가능하다는 것을 알았습니다. 현재 일반적인 아키텍처에서는 더 큰 모델들이 작은 모델들보다 가중치에 훨씬 더 많은 지식을 담고 있습니다. Aimee는 이 부분을 하드 제약 조건으로 제거합니다. 이 주제에 대해 Aimee 프로젝트는 매우 확고한 입장을 가지고 있습니다: 현재 LLM의 방향은 잘못된 곳으로 향하고 있습니다.
우리는 수십 년 동안 이 분야에 종사해 왔으며, 기본 방향이 계속해서 더 많은 자원을 소비하는 기술은 거의 본 적이 없습니다. 건강한 기술은 일반적으로 시간이 지남에 따라 더 적은 자원을 사용하는 것을 목표로 하며, 이것이 바로 프로덕셔널라이제이션(productionalization)의 핵심입니다. LLM 산업이 저희가 개발한 것을 살펴보고 방향을 명확하게 전환할 수 있기를 진심으로 바랍니다. 모델을 재학습해야 하는 경우는 주로 깊은 아키텍처 변경, 추론 능력, 학습된 행동 또는 이와 유사한 변화에 필요해야 합니다. 단순히 새로운 정보를 추가하기 위해 완전히 새로운 모델을 구축하는 것은 낭비입니다. 모든 지속적인 지식을 모델 가중치(model weights)에 집어넣는 것 또한 낭비입니다. 저희가 함께 작업하길 원하는 LLM이나 파인튜닝된 모델이 있으신가요? 연락 주시면 기꺼이 도와드리겠습니다. Aimee와 통합하고 싶은 메모리 시스템이 있나요? 연락 주세요. Aimee는 권한 부여(authorization), 출처(provenance), 수명 주기(lifecycle), 거버넌스(governance)에 대한 주변 보증을 유지하는 동안, 저희의 핵심 메모리 계약(core memory contract)을 지원하는 모든 메모리 시스템을 지원합니다. P.S. 이것과 관련하여, 엔그램(engrams)은 제외합니다. 저희는 올해 초에 이를 탐구했지만, 일반적인 엔그램 개념은 이 애플리케이션에 적합한 기술이 아닙니다. 하지만 이는 절대적으로 환상적인 기술이며, 더 많은 LLM들이 이를 충분히 활용해야 합니다. 이 때문에 Qwen을 감사의 글에 포함시켰으며, 저희는 이것과 자매 격인 아이디어이기 때문에 엔그램의 발전이 기대됩니다. submitted by /u/One-Arugula1163 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기