아날로그 훈련 스케일링 구현: 매핑, 최적화기 및 변환기 공동 설계
요약
본 논문은 인메모리 컴퓨팅(AIMC)의 하드웨어적 비이상성 문제를 해결하고 딥 모델 훈련을 확장하기 위한 시스템-알고리즘 공동 설계를 제안합니다. 혼합 정밀도 패러다임을 채택하여 순전파는 아날로그에서, 가중치 기울기는 디지털에서 계산하며, 매핑, 최적화기, 변환기를 함께 최적화했습니다.
핵심 포인트
- AIMC의 하드웨어 비이상성(유한 범위, 노이즈) 문제를 해결하는 시스템 설계 제시
- 순전파는 아날로그, 가중치 기울기는 디지털로 계산하는 혼합 정밀도 훈련 패러다임 채택
- 가중치 매핑, 최적화기, 변환기의 공동 설계를 통해 트랜스포머 훈련을 대규모로 확장 가능
- 제안된 프레임워크는 최대 123M 파라미터까지의 훈련 확장이 가능함을 입증함
인메모리 컴퓨팅(AIMC)은 가중치가 저장된 곳에서 행렬 연산을 직접 실행함으로써 모델 훈련을 위한 대안을 제공합니다. 하지만 물리적인 유한 동적 범위와 쓰기 세분성(write granularity)을 가진 가중치, 유한 해상도의 아날로그-디지털 변환기(ADC), 노이즈가 많고 비대칭적인 업데이트 등 심각한 하드웨어의 비이상성(non-idealities) 때문에 AIMC를 현대 딥 모델 훈련에 확장하는 것은 여전히 해결해야 할 과제입니다. 기울기 누적(gradient accumulation)이 정밀도 및 반올림 오차에 민감하다는 통찰을 바탕으로, 우리는 혼합 정밀도 훈련 패러다임을 채택합니다: 순전파 및 역전파 행렬 곱셈은 아날로그 영역에서 실행하고 가중치 기울기는 디지털 영역에서 계산합니다. 확장 가능한 훈련을 가능하게 하기 위해, 우리는 다음 세 가지를 공동 최적화하는 전체적인 시스템-알고리즘 공동 설계를 제시합니다. 첫째, 물리적 및 논리적 가중치 프로파일이 잘 조건화(well-conditioned)되도록 가중치 매핑을 공동 최적화하고, 둘째, 훈련 궤적을 안정화하기 위해 사전 조건화된 최적화기(preconditioned optimizer)와 임계값 트리거 기반 개방 루프 펄싱(threshold-triggered open-loop pulsing)을 결합하며, 셋째, 양자화 오차를 억제하기 위해 변환기의 동적 범위를 정렬합니다. 전기화학 RAM 측정으로 보정된 하드웨어 교정 아키텍처 시뮬레이션을 통해 평가한 결과, 우리의 프레임워크는 트랜스포머(Transformer) 훈련을 최대 $123 ext{M}$ 파라미터까지 확장할 수 있었으며, 검증 손실은 $N$이 파라미터 개수일 때 $L ext{ } ext{ extasciicircum} ext{-0.231}$로 스케일링되어 디지털 훈련의 $L ext{ } ext{ extasciicircum} ext{-0.238}$과 비교할 만한 수준을 보였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기