ActTune: 에너지 효율적인 Vision-Language-Action 추론을 위한 액션 인식 정밀도 및 GPU 동작점 적응
요약
ActTune은 로봇 제어에 사용되는 Vision-Language-Action (VLA) 정책의 에너지 효율성을 높이는 프레임워크입니다. 이 접근 방식은 액션 클래스, 모델 레이어 등에 따라 다른 양자화 민감도를 활용하고, GPU 동작점 적응을 통해 성공적인 작업당 에너지 소비를 최적화합니다. 이를 통해 기존 대비 높은 성공률과 빠른 추론 속도, 그리고 대폭 감소된 에너지를 달성했습니다.
핵심 포인트
- VLA 정책의 지속적인 추론 비용 문제를 해결하는 프레임워크입니다.
- 레이어별 정밀도 할당 및 GPU 동작점 선택을 연결하여 에너지 효율성을 높였습니다.
- LIBERO 벤치마크에서 성공률 최대 2.3% 향상, 에너지 소비 최대 76.8% 감소를 입증했습니다.
Vision-language-action (VLA) 정책은 로봇 제어를 위해 반복적으로 추론(inference)을 호출하므로, 그래픽 처리 장치(GPU) 에너지는 작업 실행의 지속적인 비용이 됩니다. 그러나 추론당 에너지 소비를 줄인다고 해서 수치적 오차로 인해 실패율이 증가하거나 느린 추론 시간이 실행 시간을 연장하여 전체 작업당 에너지가 반드시 감소하는 것은 아닙니다. 따라서 우리는 작업 성공률을 유지하고 추론 지연 시간(inference-latency) 증가를 10% 이내로 제한하면서, 성공적인 작업당 GPU 에너지 소비량을 목표로 합니다. 우리의 접근 방식은 두 가지 관찰에 기반합니다: 양자화 민감도는 액션 클래스, 모델 레이어, 가중치 대 활성화 값에 따라 다르며; 수치적 정밀도 변화는 워크로드(workload)를 변경하고 유리한 GPU 동작점(operating point)을 이동시킵니다. 우리는 ActTune이라는 액션 인식 프레임워크를 소개합니다. 이 프레임워크는 레이어별 정밀도 할당과 요청된 주파수-전력 제한 쌍(frequency--power-cap pairs)에 따른 워크로드 의존적 GPU 동작점 선택을 연결합니다. 경량 결정 트리(decision tree)가 설정 액션 오류로부터 분할(split) 및 리프 정밀도 구성을 직접 학습하고, 이후 각 정책 호출 전에 정밀도를 선택합니다. 컨트롤러는 다음 워크로드를 예측하고, 지연 시간 예산 하에 보정된 조회 테이블(lookup table)을 사용하여 선택된 GPU 동작점을 비동기적으로 적용합니다. 공유되는 상주 양자화 가중치 뱅크(resident quantized weight bank)는 가중치 재구성이나 추가 정책 평가 없이 설정 전환을 가능하게 합니다. 평생 로봇 학습의 벤치마크인 LIBERO에서 ActTune은 최신 기술 대비 평균 작업 성공률을 최대 2.3% 향상시킵니다. 원래의 BF16 구현과 비교했을 때, 최대 $2.02 imes$ 더 빠른 추론 속도를 제공하며, GPU 동작점 적응을 통해 성공적인 작업당 에너지를 최대 76.8%까지 줄입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기