동적 엔트로피 최적 운송 (Dynamic Entropic Optimal Transport)을 위한 인증된 병렬 시간 Sinkhorn 알고리즘
요약
동적 엔트로피 최적 운송 문제를 해결하기 위해 병렬 시간 실행기인 TemporalSinkhorn을 제안합니다. 기존의 순차적 Sinkhorn 방식과 달리 배치 처리를 통해 정확도를 유지하면서도 계산 속도를 획기적으로 향상시켰습니다.
핵심 포인트
- TemporalSinkhorn을 통한 병렬 시간 Sinkhorn 알고리즘 제시
- 정확도 손실 없이 순차적 방식 대비 최대 3.6배 속도 향상
- 행 샤딩 인증 방식과 사후 잔차 확인을 통한 결정론적 안전성 확보
- Flow Matching 및 다양한 GPU 환경에서의 성능 검증 완료
최적 운송 (Optimal-transport) Flow Matching을 포함한 동적 애플리케이션은 관련된 엔트로피 최적 운송 (Entropic Optimal Transport) 문제들을 반복적으로 해결하지만, 기존의 분산 Sinkhorn 프로세스는 프레임을 순차적으로 처리하며 매 반복 (Iteration)마다 동기화를 수행합니다. 우리는 출력 정확도를 추측에 의존하지 않으면서 미래의 후보군과 그 수정을 배치(Batch)로 처리하는 병렬 시간 (Parallel-in-time) 실행기인 TemporalSinkhorn을 제시합니다. 중심화된 행 샤딩 (Row-sharded) 인증 방식은 결정론적인 안전 접두사 (Deterministic safe prefix)만을 수용합니다. 나머지 후보들은 패킹된 Sinkhorn 업데이트를 공유하며, 온라인 투영 망각률 (Online projective forgetting rate)이 감사 이정표 (Audit milestones)를 설정하고, 사후 잔차 확인 (A posteriori residual checks)을 통해 모든 깊이의 과소평가로부터 복구합니다. 따라서 예측은 작업 배치 (Work placement)를 변경할 수는 있지만, 부정확한 출력을 허용할 수는 없습니다. 4개의 A100 GPU에서 n = 2048 조건으로 수행된 60회 실행, 5개 시드 그리드 실험 결과, 망각 가이드 이정표 (Forgetting-guided milestones)는 통계적으로 해결된 5개의 레짐 셀 (Regime cells)에서 모든 패킹된 반복을 감사할 때보다 벽 시간 (Wall time)을 1.15x-1.47x 단축함을 보여줍니다. 순차적인 소프트 c-변환 (Soft c-transform) 웜 스타트 (Warm start)와 비교했을 때, 시간적 실행 (Temporal execution)은 6개의 합성 스트림 전반에서 한계 허용 오차 위반 없이 1.42x-3.55x 더 빠릅니다. Flow Matching 미니배치 스트림에서 시간적 실행은 n = 2048일 때 순차적 캐리 (Sequential carry)보다 허용 오차 위반 없이 3.054x-3.632x 더 빠릅니다. RTX 4060 Laptop GPU에서 수행된 별도의 고정 커널 테스트는 4.315x의 기하 평균 속도 향상을 보여줍니다. 이는 통제된 하드웨어 비교라기보다는 상호 보완적인 배포 연구입니다. 엔드 투 엔드 (End-to-end) Flow Matching 통합, 최적화된 솔버 (Optimized-solver) 비교, 그리고 다중 노드 검증은 향후 과제로 남아 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기