Monte Carlo tree search를 위한 멀티 프리미티브 인메모리 컴퓨팅
요약
MCTS 알고리즘의 각 단계를 하드웨어 네이티브 IMC 프리미티브로 재구성하여 에너지 효율을 극대화하는 기술을 소개합니다. 22nm 공정 기반의 IMC-MCTS는 기존 CPU 및 H100 GPU 대비 압도적인 에너지 효율을 달성하며 에지 배포 가능성을 입증했습니다.
핵심 포인트
- MCTS의 각 단계를 CAM, RRAM, SRAM 등 하드웨어 프리미티브로 매핑
- 기존 CPU 대비 96배, H100 GPU 대비 최대 2,059배 에너지 효율 달성
- 9x9 바둑 게임에서 약 60 mW의 저전력 소비 실현
- 유럽 바둑 연맹 레이팅 수준의 성능을 저전력으로 구현
Monte Carlo tree search (MCTS)는 인공지능 (AI) 의사결정을 가능하게 하지만, 기존 프로세서에서는 55-300 W의 전력을 필요로 하여 에지 (edge) 배포를 제한합니다. 인메모리 컴퓨팅 (In-memory computing, IMC)은 일반적인 워크로드에서는 에너지 효율적이지만, 불규칙한 다단계 (multi-phase) 알고리즘과는 호환되지 않는 것으로 간주되어 왔습니다. 우리는 각 알고리즘 단계를 하드웨어 네이티브 IMC 프리미티브 (primitive)로 재구성하는 단계-프리미티브 분해 (phase-to-primitive decomposition)를 소개합니다. MCTS에 적용하면, 선택 (selection), 확장 (expansion), 롤아웃 (rollout), 역전파 (backpropagation)가 각각 내용 주소 지정 메모리 (content-addressable memory), 조합 논리 (combinational logic), 저항성 랜덤 액세스 메모리 (resistive random-access memory, RRAM) 크로스바, 그리고 정적 랜덤 액세스 메모리 (static random-access memory, SRAM)로 매핑되어 검색 과정을 칩 내부에서 유지합니다. 제작된 RRAM 어레이 파라미터를 사용한 22 nm 공정에서, IMC-MCTS는 9x9 바둑(Go)에 대해 약 60 mW를 소비하며, 이는 중앙 처리 장치 (central processing unit, CPU) 대비 96배, H100 그래픽 처리 장치 (graphics processing unit, GPU) 대비 65배에서 2,059배의 에너지 효율을 달성합니다. 이는 오픈 소스 바둑 엔진 (Pachi-UCT 및 Michi-C)의 샘플 크기 불확실성 범위 내에서 유럽 바둑 연맹 (European Go Federation) 레이팅에 도달합니다. 동일한 기판은 4개의 AI 도메인에 걸쳐 8개의 애플리케이션을 실행합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기