![초곡면 제약 동적 가중치 업데이트 실험 [P] 대표 이미지](https://preview.redd.it/7mc0xz50jiqh1.png?width=140&height=88&auto=webp&s=2cc1034dfbe80d0c44538f76dc04c14bed8cfdad)
초곡면 제약 동적 가중치 업데이트 실험 [P]
요약
본 글은 VRAM 제약을 극복하기 위해 모델의 훈련 파라미터 수를 줄이는 새로운 언어 모델 아키텍처 실험 결과를 공유합니다. 핵심 아이디어는 초곡면(hypersurfaces)을 사용하여 베이스 레이어 가중치를 동적으로 업데이트하는 것입니다. 이 접근 방식은 기존 트랜스포머 대비 현저히 적은 파라미터로도 성능 향상을 보여주었습니다.
핵심 포인트
- 초곡면 기반의 동적 가중치 업데이트를 통해 모델 파라미터를 줄임.
- 삼각형 파형과 Context Modulation을 결합한 아키텍처가 효과적임.
- 표준 24-레이어 트랜스포머 대비 약 1/6 수준의 파라미터로 성능 향상 입증.
여러분 안녕하세요! 사이드 프로젝트로 진행하고 있는 작은 언어 모델 아키텍처 실험 결과를 공유하고자 합니다. 궁극적인 목표는 훈련의 주요 병목 지점인 VRAM 때문에, 모델의 훈련 파라미터 수를 줄이는 접근 방식을 테스트하는 것입니다. 핵심 아이디어는 Universal Transformer와 매우 유사합니다. 단일 디코더 블록을 가져와 입력을 반복적으로 L번 루프를 통해 통과시킵니다. 하지만 입력에 루프 반복 깊이 정보를 업데이트하는 대신, 제 모델은 베이스 레이어의 가중치를 동적으로 업데이트합니다. 어떻게 구현되었나요? 이 모델은 학습된 초곡면(hypersurfaces) 세트를 사용하여 초곡면의 단면적으로부터 가중치 델타($ ext{𝛥W}_l$)를 생성합니다. 따라서 $l$ 레이어의 주어진 가중치 행렬은 $ ext{W}_l = ext{W}_0 + ext{𝛥W}_l$로 구성됩니다. 이 초곡면들은 일련의 주기 함수들로 정의됩니다. 현재까지 얻은 최고의 결과는 삼각형 파형(triangular wave)을 사용했을 때입니다. 모델은 좌표 차원 전반에 걸쳐 이러한 파동들의 진폭, 주파수 및 위상을 학습합니다. 이 세트 E의 크기를 고려할 때, 총 $3 imes E imes ext{dim}$ 개의 파라미터가 생성됩니다. 처음에는 초곡면만으로 전체 가중치를 생성하려고 했지만, 너무 제한적이어서 수렴하지 못했습니다. 그래서 모델이 업데이트되는 베이스 디코더 레이어를 갖는 현재의 접근 방식으로 변경했습니다. 또한 Gated Linear Attention을 사용하여 입력 시퀀스로부터 계산된 상태 벡터(state vector)를 추가했습니다. 이는 순전파 과정 중 초곡면 기하학을 조절하는 데 사용되어, 생성된 가중치 델타 $ ext{𝛥W}_l$가 시퀀스 인식적(sequence-aware)이 되도록 만듭니다. 사전 훈련 결과는 FineWeb-Edu 데이터셋의 10B 토큰 샘플로 실행했습니다. 훈련 파라미터 수를 최소한으로 유지하고 싶었기 때문에, GPT-2에서 미리 훈련된 고정 임베딩 레이어를 사용했습니다. 또한 NoPE 접근 방식을 따라 위치 인코딩(positional encoding)을 사용하지 않습니다. 시퀀스 길이는 1024 토큰이었고, 배치 크기는 16이었으며, 10,000 스텝 동안 훈련을 실행했습니다.
저는 세 가지 기준 모델(baselines)을 사용했습니다: 1. 단순한 1-레이어 디코더 전용 트랜스포머 (A simple 1-layer decoder-only transformer), 2. 24번의 루프 반복에 걸쳐 펼친 단일 레이어 트랜스포머 (A single-layer transformer unrolled across 24 loop iterations), 3. 표준적인 24-레이어 디코더 전용 트랜스포머 (A standard 24-layer decoder-only transformer). 실험 모델은 다음과 같습니다: 사인파 표면 델타를 사용하는 단일 루프 블록으로, 컨텍스트 변조(context modulation)는 사용하지 않음; 컨텍스트 변조와 함께 삼각형 파형 표면 델타를 사용하는 단일 루프 블록; 삼각형 파형 표면 델타와 컨텍스트 변조를 각각 활용하는 세 개의 스택된 루프 블록을 사용하는 모델. 여기 훈련 손실 차트가 있습니다: 훈련 결과 | 모델 매개변수 수 | 표준적인 24-레이어 디코더 전용 트랜스포머: 169,906,944 | 3개의 루프 블록 + 삼각형 파형 + 컨텍스트 변조: 27,162,624 (기준 모델 크기의 약 16%). 핵심 요약: 고전적인 디코더 전용 아키텍처가 여전히 가장 낮은 절대 손실을 생성하지만, Triangular Surface + Context 모델은 표준 펼침 기준 모델 대비 실제 성능 향상을 보여줍니다. 이 모델은 완전히 새로운 매개변수와 하이퍼파라미터를 도입합니다. 현재 저는 삼각형 파형 함수 세트의 크기와 컨텍스트 벡터의 크기에 대해 실험하고 있습니다. 또한 초곡면(hypersurface) 매개변수에 대한 다양한 초기화 전략도 시도하고 있습니다. (매우 모호한) 목표는 반드시 완전한 매개변수 모델을 능가하는 것이 아니라, 하드웨어 자원을 획기적으로 줄이면서 손실 측면에서 '충분히 좋은' 구성을 찾는 것입니다. 또 다른 가능성은 초곡면 표현(hypersurface representations)이 서로 다른 수렴 역학을 가지고 있어 수렴에 더 많은 단계와 토큰을 필요로 한다는 것입니다. 따라서 다음 단계는 FineWeb-Edu 데이터셋의 전체 10B 토큰 샘플에서 3개의 루프 블록과 더 큰 컨텍스트 벡터, 그리고 확장된 기능적 기저(functional basis)를 가진 모델을 훈련하는 것입니다. GitHub 저장소: https://github.com/morgengramlich/LoopSLM /u/manila_danimals님이 제출함 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/MachineLearning (hot)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기