FlashRT: 에이전트가 실시간 멀티모달 애플리케이션 배포를 가이드하는 에이전트 하네스
요약
FlashRT는 실시간 멀티모달 애플리케이션의 효율적인 배포를 위해 코딩 에이전트를 가이드하는 에이전트 하네스 프레임워크입니다. Chain-of-program 패러다임을 통해 참조 구현을 최적화된 멀티 GPU 배포 코드로 변환하며, NVIDIA 및 AMD GPU 환경에서 성능을 극대화합니다.
핵심 포인트
- 참조 구현을 최적화된 멀티 GPU 배포로 자동 격상
- Chain-of-program 패러다임을 통한 다단계 변환 프로세스
- NVIDIA B200에서 지연 시간 최대 70배 감소 및 처리량 2.8배 향상
- AMD MI355X에서 전문가용 구현 대비 지연 시간 65% 감소
- 데이터 의존성 포착 및 측정 기반 최적화 루프 활용
음성 에이전트 및 대화형 비디오 생성을 포함한 실시간 멀티모달 (Multimodal) 애플리케이션은 이기종 모델들을 파이프라인으로 구성하며, 이를 효율적으로 배포하기 위해서는 배치 (Placement), 스트리밍 (Streaming), 그리고 모델 내부 병렬화 (Intra-model parallelism)에 대한 애플리케이션 특화적인 결정이 필요합니다. 기존의 서빙 시스템 (Serving systems) 및 자동 병렬화 컴파일러 (Auto-parallelism compilers)는 제한된 변환과 고정된 워크로드 가정을 따르기 때문에, 새로운 애플리케이션에서 높은 성능을 달성하려면 효율적인 구현을 직접 수동으로 제작해야 합니다. 본 논문에서는 개발자가 작성한 단순한 참조 구현 (Reference implementation)을 지연 시간 (Latency) 및 처리량 (Throughput)과 같은 목표 지표를 유연하게 고려한 최적화된 멀티 GPU 배포로 격상시키도록 코딩 에이전트 (Coding agent)를 가이드하는 에이전트 하네스 (Agent harness)인 FlashRT를 제시합니다. 새로운 프로그램 체인 (Chain-of-program) 패러다임을 사용하여, FlashRT는 범용 코딩 에이전트가 다단계 변환 프로세스를 거치도록 지시합니다. 이 과정에서 에이전트는 데이터 의존성 (Data dependencies) 및 지속 상태 범위 (Persistent-state scopes)를 포착하기 위해 참조 구현을 중간 표현 (Intermediate Representation, IR)으로 변환하고, 순차적 인터프리터 (Sequential interpreter)를 통해 이 IR을 검증하며, 후보 변환을 식별하기 위해 정적 분석 (Static analyses)을 수행합니다. 그 후, 에이전트는 측정 기반 최적화 루프 (Measurement-gated optimization loop) 하에서 각 후보를 반복적으로 구현, 검증 및 벤치마킹하여 다양한 하드웨어 예산에 걸친 효과적인 배포를 생성합니다. 비디오 월드 모델 (Video world models) 및 멀티모달 LLM을 포함한 다양한 애플리케이션에 걸쳐, FlashRT는 참조 구현을 매우 효율적인 배포로 변환하여 NVIDIA B200 GPU에서 최대 ~70배의 지연 시간 감소와 2.8배의 처리량 향상을 제공합니다. AMD MI355X GPU에서 FlashRT는 최고 지연 시간 감소율을 유지하면서 최고 처리량 향상 폭을 3.6배까지 높였으며, 이는 에이전트 주도 최적화가 전문가 최적화 (Expert optimization)가 덜 성숙한 플랫폼에서 더 확장 가능할 수 있음을 입증합니다. 실제로 Qwen3-Omni 텍스트-음성 (Text-to-audio) 추론의 경우, FlashRT는 AMD MI355X에서 전문가용 vLLM-Omni 구현과 비교하여 응답 지연 시간을 65% 감소시킵니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기