
gemma4를 위한 Vienna "Patchwerk" 소시지 아키텍처
요약
Gemma4-12B 모델을 업사이클링하여 구축한 22.5B 파라미터 규모의 Solon-MoE 모델 아키텍처를 소개합니다. 중간 15개 레이어에만 MoE 구조를 적용한 '소시지' 형태의 독특한 설계를 통해 효율적인 전문가 배치를 구현했습니다.
핵심 포인트
- Gemma4-12B를 기반으로 한 22.5B 파라미터 MoE 모델
- 중간 레이어(L18–L34)에만 MoE를 적용한 소시지형 아키텍처
- 기존 지식을 보존하기 위한 공유 전문가(Shared Expert) 설계
- SVD 스펙트럼 섭동을 이용한 전문가 생성 방식
https://preview.redd.it/sc4e7grs6heh1.png?width=2752&format=png&auto=webp&s=69e8e0e06e71cd92920f978902740f6844f13986 https://preview.redd.it/9j4c08ss6heh1.jpg?width=250&format=pjpg&auto=webp&s=c705cd196ef8b5f0cd9000aa0cc6637dc06f2cd9 지난 포스트 이후, Fable이 Claude Max 구독에 공식적으로 추가되었으며, 이는 제가 마침내 이 프로젝트로 돌아와 작업을 재개할 수 있게 되었음을 의미합니다. 진행 상황을 살펴보기 전에, 몇 가지 짧은 생각을 공유하고자 합니다: 경고!!! AI가 생성한 기사입니다!!!
- 기대치 설정: 이것은 매우 개인적인 취미 프로젝트이며, AI 생성 지원을 통해 조각조각 맞춰진 것임을 솔직하게 말씀드리고 싶습니다. 최종 버전이 완성되더라도, 몇몇 특정 영역을 제외하고는 원래의 베이스 모델 (base model)보다 성능이 뛰어날 가능성은 매우 낮습니다.
- 대단한 감사 인사: 저는 대규모 언어 모델 (Large Language Models, LLM)에 대한 이론적 배경이 전혀 없는 상태에서 이 프로젝트를 시작했습니다. 그동안 동료 Redditor들로부터 받은 모든 조언과 지도에 진심으로 감사드립니다.
- 디자인 영감: 제가 만든 MoE (Mixture-of-Experts) 밴드 구조를 볼 때, 솔직히 비엔나 소시지 한 줄이 떠올랐습니다. 하지만 제 친구들은 World of Warcraft의 Patchwerk처럼 보인다고 말하더군요. 사실, 이 모델은 여전히 Patchwerk만큼이나 투박하고 무식한 (brute-force) 방식입니다.
모델이 어떻게 구축되었는지에 대한 분석은 다음과 같습니다.
저의 새로운 장난감인 Solon-MoE는 처음부터 학습시키는 방식(크고 느린 방식) 대신, 12B 밀집 모델 (dense model, Gemma4-12B)을 업사이클링 (upcycling)하여 구축한 22.5B 파라미터 규모의 MoE (Mixture-of-Experts) 모델입니다.
모든 레이어(또는 매 레이어마다)가 MoE인 일반적인 MoE 모델과 달리, Solon-MoE는 48개 레이어 중 중간의 15개 레이어(L18–L34)만을 MoE로 변환하며, 심지어 그 밴드 안에도 두 개의 밀집 레이어 (dense layers)가 남아 있습니다. 이것이 제가 이 모델을 소시지라고 부르는 이유입니다.
단순한 밀집 레이어 (dense layers)가 먼저 나오고, 중간에 통통한 MoE 세그먼트들이 모여 있으며, 다시 밀집 레이어가 나타납니다. 이 형태는 증거를 따릅니다. 중간 레이어들은 도메인 정보가 가장 명확하게 분리되는 지점이며, 따라서 그곳에 전문가 (experts)들이 거주합니다. 토큰당 활성화되는 파라미터는 17.1B에 불과합니다. 세 가지 주요 설계 선택이 이 아키텍처를 정의합니다:
안전망으로서의 공유 전문가 (shared expert): 각 MoE 레이어는 모든 토큰을 처리하는 기존의 밀집 FFN을 "공유 전문가"로 유지합니다. 그 옆에 4개의 추가 전문가가 배치되지만, 토큰당 상위 2개(top-2)만 실행되며, 이들의 출력은 작은 계수 λ (학습 시 0.15, 추론 시 0.10)에 의해 스케일링됩니다. 이 모델은 본질적으로 "기존 네트워크에 작은 특화된 보정치를 더한 것"입니다. 즉, 이미 알고 있는 것을 잊을 수 없습니다.
노이즈가 아닌 스펙트럼 섭동 (spectral perturbation)에서 탄생한 전문가: 각 전문가는 SVD 스펙트럼의 서로 다른 대역을 부드럽게 증폭(±7.5%)하여 기존 FFN을 복제합니다. 이는 전문가의 대칭성—전형적인 업사이클링 (upcycling)의 함정—을 깨뜨리는 동시에 기존 가중치의 92% 이상을 유지하므로, 각 전문가는 동일한 헤드(heads)의 서로 다른 "성격"으로 시작됩니다.
첫날부터 도메인을 아는 라우터 (router): 라우터 가중치는 도메인 구조를 숨기는 지배적인 공유 방향을 제거한 후, 법률, STEM, 일반 한국어 텍스트의 활성화 클러스터 중심점 (activation-cluster centroids)으로 초기화됩니다. 이 덕분에 라우팅은 학습이 시작되기도 전부터 도메인을 인식합니다.
읽어주셔서 감사합니다. 가능하다면 진행 상황을 계속해서 알려드리겠습니다!! submitted by /u/Desperate-Sir-5088 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기