오픈 소스 추론 테스트 도구 AA-AgentPerf-Local 발표: 로컬 AI 모델 성능 측정
요약
오픈 소스 추론 테스트 도구 AA-AgentPerf-Local을 발표하여 로컬 AI 모델의 에이전트 성능 측정 기준을 제시했습니다. 이 도구는 노트북 및 워크스테이션 환경에서 실제 에이전트 궤적과 복잡한 컨텍스트를 재현하며, 다양한 하드웨어와 인기 모델 조합의 추론 속도를 테스트할 수 있게 합니다.
핵심 포인트
- 로컬 AI 모델 성능 측정을 위한 오픈 소스 도구 AA-AgentPerf-Local 출시
- 노트북/워크스테이션에서 에이전트 궤적 및 컨텍스트 기반 추론 성능 측정 가능
- NVIDIA, AMD, Apple 등 다양한 하드웨어 플랫폼 초기 결과 공개
- 개인이 자체 테스트를 수행하고 로컬 AI 서비스 결정을 내릴 수 있도록 지원
AA-AgentPerf-Local, 즉 로컬 AI 모델을 위한 오픈 소스 추론 테스트 도구를 발표합니다. 사용자의 노트북이나 워크스테이션에서 에이전트형 AI(agentic AI)가 얼마나 빠르게 실행되는지 테스트해보고, 다음 에이전트 설정을 계획할 수 있도록 서비스 구성 목록도 확인해 보세요.
주요 내용:
➤ AA-AgentPerf-Local을 오픈 소스화하여 노트북 및 워크스테이션 하드웨어에서 실제 에이전트 궤적(agent trajectories)을 재현하고 추론 성능을 테스트합니다.
➤ NVIDIA DGX Spark, NVIDIA GeForce RTX 5090, AMD Ryzen AI Halo, MacBook Pro M5 Pro에 대한 초기 결과를 공개합니다.
➤ 이 도구와 리더보드는 더 많은 하드웨어, 프레임워크, 모델을 다루도록 곧 확장될 것이며, 새로운 출시가 있을 때마다 지속적으로 업데이트될 것입니다.
저희는 이미 모바일 폰과 데이터센터 규모의 하드웨어에서 추론 성능을 벤치마킹해 왔으며, 이제 노트북과 워크스테이션까지 적용 범위를 넓히고 있습니다. 인기 있는 모델 및 하드웨어 조합의 결과를 표시하는 리더보드를 호스팅하는 것 외에도, 개인이 기업이 자체 테스트를 수행하고 로컬 AI 서비스 결정을 내릴 수 있도록 AA-AgentPerf-Local을 실행하는 데 필요한 모든 코드와 데이터를 오픈 소스화합니다.
AA-AgentPerf-Local은 실제 에이전트 세션을 재현합니다. 기본 워크로드는 8개의 기록된 에이전트 작업으로, 총 168개 모델 턴(model turns)에 걸쳐 진행됩니다. 각 요청에는 마치 실제 에이전트가 하듯이 지금까지의 전체 대화 내용이 포함되므로, 컨텍스트는 약 56K 토큰까지 증가합니다. 모든 턴은 정확히 기록된 토큰 수를 생성하므로, 모든 시스템이 동일한 작업을 수행하게 됩니다. 기본적으로 추론 속도를 분리하기 위해 도구 실행(Tool execution)은 건너뛰지만, 자체 시스템을 벤치마킹할 때는 실제 기록된 도구 지연 시간(tool delays)을 재현하거나 CPU에서 도구 호출을 실시간으로 실행할 수도 있습니다.
출시 초기에는 단일 에이전트가 전체 시스템을 활용하여 달성할 수 있는 성능에 중점을 두고 있으며, 시간이 지나면서 다중 에이전트 시스템 및 에이전트가 다른 일반 프로세스와 함께 실행되어야 하는 시나리오까지 적용 범위를 확장할 계획입니다.
공식 페이지에서 다루는 초기 하드웨어 목록은 다음과 같습니다: NVIDIA DGX Spark (128 GB), AMD Ryzen AI Halo (128 GB), MacBook Pro M5 Pro (64 GB), 그리고 NVIDIA GeForce RTX 5090 (32 GB)입니다. 이 장비들은 다양한 플랫폼(CUDA, ROCm, Vulkan, Metal), 메모리 용량, 및 대역폭을 포괄하도록 선정되었습니다. 앞으로도 x86(및 기타) 노트북, RTX PRO 6000 Blackwell와 같은 AI 중심 그래픽 카드 등을 추가하여, 사용자가 다양한 하드웨어 유형에 걸친 성능을 균형 있게 파악할 수 있도록 특집 장비를 확장할 예정입니다.
출시 시점에 소개되는 모델들은 다음과 같습니다: Qwen3.5-9B, Qwen3.8-27B, Qwen3.6-35B-A3B, 그리고 Ling 3.0 Flash (124B / 5B active)입니다. 이 초기 모델들은 메모리 요구 사항과 밀집형(dense)/MoE 아키텍처의 범위를 포괄하며, 현실적인 서비스 환경을 반영하기 위해 각각 4비트 양자화(quantization)로 벤치마킹되었습니다. 저희가 특집으로 다루는 핵심 모델 세트는 새로운 오픈 가중치(open weights) 모델이 출시됨에 따라 시간이 지남에 따라 변경될 것입니다. 소개된 모델 외에도, AA-AgentPerf-Local은 사용자가 실행하는 모든 OpenAI 호환 추론 서버의 성능을 벤치마킹할 수 있으므로, 어떤 모델과 설정이라도 로컬에서 테스트가 가능합니다.
서비스 구성 선택이 중요하며, 런타임(runtime), 양자화(quantization), 그리고 투기적 디코딩(speculative decoding)은 결과에 상당한 변화를 가져옵니다. 시스템 및 모델 쌍에 대해 공식적으로 기성품(off-the-shelf) 설정이 제공되는 경우 해당 설정을 사용했습니다. 그 외의 모든 경우에는 자체 구성을 개발했습니다. 모든 구성은 투기적 디코딩(MTP, DFlash 또는 DSpark)을 사용하며, 이 14가지 설정 모두 저장소(repo)와 웹사이트의 configs 페이지에 게시되어 있습니다.
초기 결과:
➤ 완료 시간은 각 모델의 활성 파라미터 수와 가장 밀접하게 연관되었습니다: Qwen3.6-35B-A3B (3B active)는 모든 시스템에서 가장 빠른 모델이었으며, 예를 들어 밀집형(dense)인 Qwen3.8-27B보다 2.5~3.3배 더 빨랐습니다. 하지만 활성 파라미터 수가 전부는 아니어서, Ling 3.0 Flash (총 124B, 5B active)는 여전히 이를 지원할 수 있는 모든 하드웨어에서 Qwen3.5-9B(활성 파라미터 수가 거의 두 배에 달함)보다 느린 성능을 보였습니다.
➤ GeForce RTX 5090은 32GB에 맞는 모든 모델에서 가장 빠른 시스템이었으며, 다른 시스템보다 3.5배 이상 빠른 완료 시간을 달성했습니다. 단일 사용자 디코딩(Single-user decoding)은 메모리 대역폭(memory bandwidth)의 영향을 크게 받는데, GeForce RTX 5090은 1,792 GB/s를 기록한 반면 통합 메모리 시스템(unified-memory systems)들은 256–307 GB/s였습니다.
➤ DGX Spark와 Ryzen AI Halo는 전반적으로 유사한 시스템으로, 동일한 양의 통합 메모리, 비교 가능한 메모리 대역폭, 그리고 $4,000이라는 동일한 출시 MSRP를 가집니다. 기본 궤적(default trajectory) 설정에서 DGX Spark는 네 가지 모델 중 세 가지에서 1.4–1.7배 더 빨랐으며, Ryzen AI Halo와 Qwen3.5-9B 모델에서는 동등했습니다. 이 격차는 단순히 7%의 대역폭 차이보다 훨씬 크며, Spark가 Ryzen AI Halo보다 높은 저정밀도 컴퓨팅(low-precision compute)을 갖추어 더 빠르게 프리필(prefill)할 수 있게 하고, 더욱 성숙한 CUDA 소프트웨어가 더 나은 MoE 및 추측 디코딩(speculative decoding) 성능 구현에 기여하는 것으로 보입니다.
➤ MacBook Pro (M5 Pro, 64GB, 20-core GPU)는 현재까지 테스트된 유일한 노트북이며 경쟁력 있는 결과를 보여주었습니다. Qwen3.6-35B-A3B와 Qwen3.8-27B에서는 Ryzen AI Halo 대비 2–9% 차이로 마무리했으며(Qwen3.5-9B에서는 21% 느림), 세 통합 메모리 시스템 중 가장 높은 메모리 대역폭(307 GB/s)을 가지고 있으며, 현재 가격 $3,700은 지금까지 테스트된 시스템 중 가장 낮습니다. 이 결과는 소프트웨어 성숙도와 프리필에 사용 가능한 컴퓨팅 성능에 의해 제한되었을 가능성이 높습니다.
➤ 에이전트 궤적(agentic trajectories)이 프롬프트 토큰의 73–93%를 KV 캐시(KV cache)에서 처리했음에도 불구하고, 각 턴의 새로운 입력(프리필 중)을 단순히 읽는 것만으로도 종단 간 완료 시간(end-to-end completion time)의 상당한 비율을 사용했습니다. 예를 들어 Qwen3.8-27B 모델에서는 22–41%에 달했습니다. 이는 Ryzen AI Halo와 잠재적으로 MacBook Pro(MacBook FLOP/s는 발표되지 않음)처럼 메모리 대역폭 대비 컴퓨팅 FLOP/s가 낮은 시스템에서 특히 두드러졌습니다.
➤ 지금까지 가장 성공적이었던 모든 설정에 Speculative decoding이 구현되었으며, 예를 들어 Qwen3.8-27B의 디코딩 속도를 대역폭 제약 로프라인보다 약 30~120% 높였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기