동적 텐서 재물질화(DTR)에서의 결정론적 레짐 스위칭 및 실현 가능성 반전
요약
본 논문은 메모리 제약 DNN 학습을 위한 온라인 제거 정책인 동적 텐서 재물질화(DTR)의 결정론적 불안정성을 보고합니다. 특히, LSTM 및 ResNet-32 추적에서 미세한 메모리 예산 변화에 따라 실행 레짐이 급격히 바뀌거나 실현 가능성이 반전되는 현상을 관찰했습니다. 이는 제거 가능한 텐서가 완전히 제거된 후에도 발생하는 재귀적 재물질화 프론티어의 문제로 분석되었습니다.
핵심 포인트
- DTR 정책에서 미세한 메모리 예산 변화에 따른 결정론적 불안정성 발견
- LSTM 추적은 작은 메모리 차이에도 실행 레짐이 크게 달라지는 현상 관찰
- ResNet-32 추적에서는 특정 범위의 메모리 예산에서 실현 가능성이 반전되는 'feasibility inversion' 확인
우리는 메모리 제약 DNN 학습을 위한 온라인 제거 정책인 동적 텐서 재물질화(Dynamic Tensor Rematerialization, DTR)에서 미세한 수준의 결정론적 불안정성을 보고하며, 이는 공개 실행 추적을 사용하여 참조 DTR 시뮬레이터(simrd)에서 측정되었습니다. LSTM 추적의 경우, 무제약 최대 메모리의 0.10% 차이가 나는 메모리 예산은 오버헤드가 최대 7.3배까지 차이 나는 빠르고 느린 실행 레짐을 선택합니다. 이 느린 레짐은 동일한 저장소에 대한 광범위하게 반복되는 재제거(evictions per storage가 1.33에서 8.27로 증가하는 동안, 고유하게 제거된 저장소 집합은 본질적으로 변하지 않습니다: 5,233 대 5,236이며, 두 집합의 Jaccard 유사도는 0.999입니다)에 의해 발생합니다. ResNet-32 추적의 경우, 미세한 예산 스윕을 통해 결정론적 실현 가능성 반전(feasibility inversion)이 밝혀졌습니다: 해당 실행은 비율 0.101에서 실현 가능하고, 0.102부터 0.106까지는 비실현 가능(OOM)하며, 다시 0.107부터 실현 가능합니다. 우리는 OOM의 즉각적인 원인을 모든 제거 가능한 텐서가 제거된 후에도 예산을 초과하는 완전히 고정된 재귀적 재물질화 프론티어에서 찾았습니다. DTR 저자들이 제시한 변형을 사용한 제거(Ablations)는 관찰된 LSTM 불안정성에 공동 크기-오래됨 점수 항(joint size-staleness scoring term)이 관련 있음을 시사합니다. 우리는 이것들이 단일 메커니즘이라기보다는 적어도 두 가지의 별개의 예산 민감성 병리 현상이라고 주장하며, 입증된 것과 가설로 남아있는 것을 분리했습니다. 모든 결과는 참조 시뮬레이터에 관한 것이며, 실제 구동 환경에서의 재현은 향후 연구 과제입니다. 코드, 계측(instrumentation), 그리고 원시 결과가 이 사전 인쇄물과 함께 제공됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기