오픈 소스 거대 언어 모델(Open LLM)의 최대 활성화 값 측정
요약
현대 오픈 소스 LLM의 활성화(activation) 값의 동적 범위를 분석하여, 모델의 제품군, 세대, 학습 단계에 따른 최댓값 변화를 조사한 연구입니다. 연구 결과, 활성화 값의 크기는 단순히 모델 파라미터 수에 비례하지 않으며 아키텍처와 학습 단계에 따라 매우 큰 차이를 보인다는 점을 밝혀냈습니다.
핵심 포인트
- 활성화 값의 전역 최댓값은 모델 제품군에 따라 최대 4자릿수(four orders of magnitude)의 차이를 보임
- Gemma3-27B-it는 약 $7 \times 10^5$의 높은 값을 보이는 반면, Qwen3.5와 MoE 모델은 상대적으로 낮은 범위를 유지함
- MoE 모델은 동일 규모의 밀집(dense) 모델보다 피크 값이 14.0~23.4배 낮게 나타남
- 최대 활성화 크기는 모델 크기의 부산물이 아닌 아키텍처 및 학습 단계와 결부된 고유 특성임
- 저비트 양자화 시 활성화 스케일 선택과 재구성 오차 사이의 밀접한 상관관계 확인
활성화(activations)의 동적 범위(dynamic range)는 저비트 양자화(low-bit quantization), 활성화 스케일링(activation scaling), 그리고 안정적인 LLM 추론(inference)을 위한 1차적 제약 조건입니다. 기존 연구들은 2024년 이전의 LLaMA 스타일 모델에서 이상치 특징(outlier features)과 거대한 활성화 값을 규명하였으나, 이후 LLaMA 이후의 오픈 모델 붐이 일어난 시점에서 이를 재검토하지 않은 채 하위 활성화-양자화 스택(activation-quantization stack)이 기존의 양상을 그대로 계승해 왔습니다. 우리는 배포 지향적인 질문을 던집니다: 현대의 오픈 LLM에서 활성화 값은 얼마나 커질 수 있으며, 이러한 크기가 모델 제품군(families), 세대(generations), 그리고 학습 단계(training stages)에 따라 어떻게 변하는가? 통합된 파이프라인(5,000개 샘플의 멀티 도메인 코퍼스, 제품군별 토큰화(tokenization), 임베딩(embeddings), 은닉 상태(hidden states), 어텐션(attention), MLP/MoE, SwiGLU 게이트(gates), 그리고 최종 정규화(final norm) 전반에 걸친 동일한 훅(hooks))을 통해, 우리는 밀집(dense), MoE, 시각-언어(vision-language), 중간 학습(intermediate-training), 그리고 지시어 미세 조정(instruction-tuned) 변형을 아우르는 8개의 오픈 제품군에서 추출한 27개의 체크포인트(checkpoints)에 대해 전역 및 레이어별 최댓값을 측정했습니다. 연구 결과, (i) 유사한 파라미터 수에서 전역 최댓값은 거의 4자릿수(four orders of magnitude)에 걸쳐 나타나며, Qwen3.5와 MoE 체크포인트는 $10^2$에서 $10^3$ 범위에 있는 반면 Gemma3-27B-it는 약 $7 imes 10^5$에 달합니다; (ii) 제품군 간 및 세대 간 비교는 단순한 단조 스케일링(monotonic scaling) 법칙을 깨뜨립니다; (iii) MoE 체크포인트는 동일한 규모의 밀집 모델 대응군보다 14.0~23.4배 낮은 피크(peaks)를 보이는 반면, 잔차 스트림(residual stream)이 24개 중 22개 체크포인트에서 전역 최댓값을 보유하고 있습니다. 경량화된 INT-8 무결성 검사(sanity check) 결과, 측정된 최댓값은 활성화 스케일 선택을 통한 저비트 재구성 오차(low-bit reconstruction error)와 공변(co-vary)함을 보여줍니다. 우리는 최대 활성화 크기가 단순히 모델 크기의 부산물이 아니라 제품군, 아키텍처(architecture), 그리고 학습 단계와 결부된 모델 고유의 특성이라고 결론지으며, 저비트 배포 전에 모든 오픈 웨이트(open-weight) 출시 시 이 값을 함께 측정하고 보고해야 한다고 제언합니다. 코드는 이 HTTPS URL에서 공개적으로 사용할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기