6GB RTX 4050 노트북에서 1.56TB MoE 모델을 실행해 보았습니다: 그 결과
요약
저사양 RTX 4050 노트북 환경에서 1.56TB 규모의 거대 MoE 모델을 실행하기 위한 벤치마크 결과입니다. 메모리 부족 문제를 해결하기 위해 밀집 가중치를 SSD에서 직접 스트리밍하는 패치된 엔진을 사용하였으며, 극심한 디스크 I/O 병목 현상을 확인했습니다.
핵심 포인트
- 6GB VRAM 및 16GB RAM 환경에서 1.56TB MoE 모델 실행 시도
- 표준 엔진은 메모리 부족(OOM)으로 실행 불가
- 패치된 엔진을 통해 SSD에서 가중치를 직접 스트리밍하여 실행 성공
- 토큰당 약 33GB의 디스크 I/O 발생 및 초당 0.106 토큰의 매우 느린 속도 기록
- NVMe SSD의 읽기 대역폭이 전체 성능의 핵심 병목 지점으로 작용
테스트 벤치 설정
저예산 게이밍 노트북에서 거대한 1.56TB Mixture-of-Experts (MoE) 체크포인트 (96개 샤드, 93개 레이어, 레이어당 896개 전문가, ~4.46 bits/param MXFP4)를 실행하는 테스트를 진행했습니다.
노트북: HP Victus 15
GPU: NVIDIA RTX 4050 Laptop (6GB GDDR6, 96-bit 인터페이스 @ 192 GB/s 대역폭, Ada Lovelace AD107)
시스템 RAM: 16GB DDR4 (듀얼 채널)
스토리지: 기본 PCIe 4.0 NVMe SSD (벤치마크 기준 순차 읽기 ~3,500 MB/s)
사용 가능한 빠른 메모리 예산: 총 ~19GB (~13.5GB 가용 RAM + OS 오버헤드 제외 후 5.5GB 가용 VRAM)
하드웨어 컨텍스트: RTX 4050은 4세대 Tensor Core를 사용합니다. 50 시리즈/Blackwell과 함께 도입된 네이티브 MXFP4 하드웨어 가속 기능이 없기 때문에, 엔진은 Tensor Core 실행 전에 메모리 내에서 MXFP4 가중치를 FP16/INT8로 역양자화 (Dequantize) 합니다.
실행 1: 표준 엔진 아키텍처 (기본 설정 시도)
결과: 첫 번째 토큰 생성 전 하드 크래시 / OOM 발생
기본 엔진 설정 하에서는 밀집 어텐션 가중치 (Dense attention weights)와 공유 파라미터가 RAM에 영구적으로 상주하는 반면, 희소 전문가 가중치 (Sparse expert weights)는 NVMe에서 스트리밍됩니다.
필요 상주 메모리: 4비트 정밀도 기준 ~40GB.
사용 가능한 메모리: ~19GB.
엔진은 초기 메모리 맵 (Memory-map) 단계에서 즉시 메모리 부족 (Out-Of-Memory, OOM) 할당 오류를 일으켰으며, 단 하나의 프롬프트 토큰을 처리하기도 전에 종료되었습니다.
실행 2: 패치된 엔진 (SSD에서 밀집 가중치를 스트리밍)
모델을 16GB RAM에서 강제로 실행하기 위해, 런타임을 패치하여 RAM을 순수하게 얇은 LRU 캐시로 취급하도록 했습니다. 이를 통해 엔진이 캐싱되지 않은 밀집 가중치 (Dense weights)와 어텐션 레이어를 활성 전문가 (Active experts)와 함께 NVMe에서 직접 스트리밍하도록 강제했습니다.
실제 벤치마크 수치:
초기 로드 및 Mmap 시간: 5분 42초 (96개 샤드 파일 전체에 걸친 mmap 오버헤드 및 헤더 파싱이 지배적임).
프리필 (7개 토큰 프롬프트): 11.8초 (모든 위치에 대해 각 레이어의 가중치를 한 번씩 로드함).
디코딩 속도: 토큰당 9.4초 (~0.106 tok/s).
병목 현상이 발생한 지점: 93개 레이어 전체에 걸쳐 레이어당 8개의 활성 전문가 (active experts)를 사용할 때, 각 토큰마다 다음과 같은 스래싱 (thrashing)이 발생했습니다:
활성 전문가 (Active Experts): 8 × 93 × ~18MB ≈ 13.4GB
캐시되지 않은 밀집/어텐션 가중치 (Uncached Dense/Attention Weights): ≈ 19.6GB
토큰당 총 디스크 I/O (Total Disk I/O per token): ~33GB / 토큰
순정 NVMe의 지속적인 3.5 GB/s 읽기 제한 상황에서, 드라이브는 전체 생성 과정 동안 100% 활성 상태로 고정되었습니다.
영어가 모국어가 아니어서 포맷팅을 위해 Grammarly를 사용했습니다.
submitted by /u/UsedMorning9886 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기