수년 동안 AI 벤치마크는 하나의 질문에 답했습니다
요약
기존 AI 벤치마크가 단일 모델 성능에 초점을 맞췄다면, 이제는 임베더, 리랭커, LLM 호출 등 여러 구성 요소가 결합된 '파이프라인' 전체의 성능을 측정합니다. MLCommons가 End-to-End RAG와 Edge Agentic이라는 두 가지 새로운 테스트를 도입하며 이러한 변화를 주도하고 있습니다.
핵심 포인트
- AI 벤치마크는 단일 모델에서 파이프라인 평가로 진화 중입니다.
- MLPerf Inference v6.1은 전체 검색(RAG) 및 에이전트 작업 성능을 측정합니다.
- End-to-End RAG는 여러 모델과 벡터 DB가 결합된 질의응답 과정을 평가합니다.
- Edge Agentic 테스트는 실제 코딩 에이전트의 장기적이고 복잡한 작업을 재현합니다.
수년 동안 AI 벤치마크는 하나의 질문에 답했습니다. '이 칩은 이 모델에서 얼마나 빠른가?' 합성 프롬프트가 입력되고 토큰이 출력되며, 숫자가 기록되었습니다. 이것은 AI가 '하나의 모델, 하나의 GPU, 하나의 답변'을 의미했을 때는 괜찮았습니다.
그런 세상은 사라졌습니다. 아무도 더 이상 순수한(bare) 모델만 배포하지 않습니다. 그들은 파이프라인을 배포합니다. 임베더(embedder), 벡터 데이터베이스(vector database), 리랭커(reranker)와 질문에 대해 계주팀처럼 작동하는 세 개의 LLM 호출입니다. 또는 코드를 읽고, 명령을 실행하며, 답변하기 전에 버그를 수정하는 에이전트일 수도 있습니다. 하나의 러너(runner)만 측정하고 그것을 팀의 점수라고 부리는 것은 허구가 되어가고 있습니다.
9월 16일, MLCommons는 MLPerf Inference v6.1을 출시했으며, 마침내 계주팀 전체를 평가합니다. 두 가지 완전히 새로운 테스트가 도입되었습니다. 첫째는 전체 검색 파이프라인을 하나의 것으로 측정하는 End-to-End RAG 벤치마크이며, 둘째는 데스크톱에서 실제 코딩 에이전트의 1,007턴(turn)을 재현하는 Edge Agentic 벤치마크입니다. 기록적인 30개 조직이 120개의 시스템과 486개의 결과를 제출했으며, 이 숫자들 속에는 업계의 엔지니어링 에너지가 실제로 어디로 향하고 있는지에 대한 명확한 신호가 숨겨져 있습니다.
초등학생도 이해할 수 있게 설명: 성적표가 성장하다
AI 벤치마크를 성적표라고 생각해 보세요. 지금까지 이 성적표는 수학이라는 하나의 과목만 다루었습니다. '이 방정식을 얼마나 빨리 풀 수 있니?' 유용하지만, 여러분의 AI는 하루 종일 수학 숙제를 하는 것은 아닙니다. 그것은 문서를 검색하고, 읽고, 찾은 내용을 추론하며, 답변을 작성합니다. 이것은 그룹 프로젝트입니다.
예전 테스트는 한 학생이 수학 워크시트를 푸는 시간을 측정하고 이를 외삽(extrapolate)했습니다. 새로운 테스트는 전체 그룹 프로젝트를 측정합니다: 연구원(embedder), 사서(retriever), 편집자(reranker), 그리고 작가(LLM). 만약 작가는 천재지만 사서가 느리다면, 프로젝트 전체가 느려지며—이제 성적표가 그것을 보여줍니다.
두 번째 새로운 테스트는 더욱 공감하기 쉽습니다. AI 코딩 어시스턴트가 실제 작업을 수행하는 녹화본을 가져와요. 20개의 전체 세션 동안 코드 읽기, 명령어 실행, 버그 수정 등 총 1,007번의 턴(turn)이 진행되는데, 이를 단일 머신에서 요청 한 번씩, 개발자가 노트북으로 에이전트를 구동하는 방식 그대로 재현합니다. 그리고 각 턴에 걸리는 시간을 측정해요. 첫 제출자 Atlas Inference가 말했듯이 다음과 같습니다: "지난 몇 년 동안 진지한 에이전트 작업은 데이터센터 왕복을 의미했습니다. 이 제출물이 폐기하고자 하는 가정이 바로 그것입니다."
작동 방식, 파트 1: RAG 테스트는 네 가지 모델과 하나의 데이터베이스로 구성됩니다
End-to-End RAG 벤치마크는 여러 모델과 벡터 데이터베이스가 함께 작동하는 완전한 질의응답(question-answering) 파이프라인을 측정합니다. 참고 구현체는 네 가지 모델을 동시에 실행합니다: gpt-oss-120B는 쿼리 분해(query decomposition), 충분성 확인(sufficiency checking), 답변 생성을 처리하고; gpt-oss-20B는 검색된 문서를 채점하며; e5-base-v2는 임베딩을 생성하고; ColBERTv2는 구절(passage)의 재순위화(reranks)를 수행합니다. 코퍼스는 2,515개의 HTML 파일에서 청크된 107,484개의 구절로 구성되어 있으며; 질문은 Google의 FRAMES 데이터셋에서 가져온 824개의 다중 도약(multi-hop) 작업으로 이루어져 있고; 각 작업은 파이프라인이 충분한 증거를 확보했다고 판단하기 전까지 최대 5번의 검색 라운드를 반복할 수 있습니다.
두 가지 숫자가 나옵니다. FAISS HNSW 벡터 인덱스를 _구축_하는 속도(문서/초)와 이를 기반으로 질문에 _답변_하는 속도(작업/초)입니다. Llama 3.1-8B 심사관이 최종 답변을 97% 정확도 목표치와 비교하여 점수를 매기는데, 이 채점은 시간에 구애받지 않으므로 느린 심사관으로 정확도를 살 수 없습니다.
이것이 왜 중요할까요? 시스템 작업에서 가장 오래된 함정 때문입니다. 그리고 다이어그램 1이 그것을 보여줍니다. 답변 생성 단계만 3배 빠르게 한다고 가정해 봅시다(더 빠른 GPU, 추측 디코딩(speculative decoding) 등 무엇이든 상관없이). 그러면 전체 파이프라인은 단지 1.83배밖에 빨라지지 않습니다. 무한히 빠른 LLM조차도 약 3.1배로 제한되는데, 이는 다른 단계들(검색(retrieve), 재순위 지정(rerank), 분해(decompose), 등급 매기기(grade))이 모델의 속도가 얼마나 빠르든 신경 쓰지 않기 때문입니다. 반면, 모든 단계에 걸쳐 2~4배의 적당한 개선은 단일 단계의 3배를 능가합니다: 전체적으로는 2.12배입니다.
동반된 노트북에서는 이 모든 것을 순수 numpy로 재현했습니다: 암달(Amdahl) 분석, '3배 헤드라인, 1.83배 현실' 함정, 그리고 균형 최적화의 승자입니다. 이 벤치마크가 강조하는 교훈은 현업 팀들이 어렵게 배우는 것과 같습니다: 단계별 속도 향상은 파이프라인에 대해 거짓말을 합니다. 만약 사용자의 작업 부하가 파이프라인이라면, 공급업체의 "3배 빠른 모델"이라는 헤드라인은 사용자에게 1.8배일 수 있습니다—그리고 MLPerf는 이제 그 숫자를 보고합니다.
작동 방식 (2부): 데스크톱에서 재현된 1,007턴 에이전트
[
Edge Agentic Inference 벤치마크는 워크스테이션으로 이동한 코딩 어시스턴트 패턴을 목표로 합니다. 모델은 thinking 기능이 꺼진 Qwen3.6-27B이며, llama.cpp 환경에서 Q4_K_M GGUF 형태로 구동되고 컨텍스트 창(context window) 크기는 32K입니다. 작업 부하는 SWE-bench Verified의 에이전트 코딩 궤적 20개—총 1,007턴을 기록하여 재현한 것입니다. 이는 개발자가 노트북에서 에이전트를 실행하는 방식처럼, 단일 스트림으로 하나의 요청이 진행되는 방식으로 구동됩니다. 보고된 지표는 턴당 평균 지연 시간(mean latency per turn)이며, 여기에 첫 토큰까지 걸리는 시간(time-to-first-token) 및 출력 토큰당 시간(time-per-output-token) 분포가 함께 제시됩니다. 정확도는 별도로 제한되는데, 이 설정은 함수 호출 벤치마크인 BFCL v4에서 기준 점수의 97%를 달성해야 합니다.
Atlas Inference에서 나온 헤드라인 결과는 다음과 같습니다: NVIDIA DGX Spark가 1,007턴을 64분 이내에 20.1 tokens/s로 완료했으며 — AMD Strix Halo 데스크톱(Ryzen AI Max+ 395)은 19.63 tokens/s로 달성했습니다. 목적에 맞게 설계된 AI 박스와 데스크톱 APU 간의 근접한 성능입니다. 이 테스트가 보여주기 위해 설계된 바로 그 종류의 결과이며, 현재 모든 엔지니어링 조직이 묻고 있는 질문에 답합니다: 이 에이전트를 로컬에서 실행할 수 있을까?
Diagram 2는 왜 벤치마크가 '사고(thinking)' 기능을 끄고 실행되는지를 보여줍니다. 한 턴당 지연 시간(time-to-first-token + tokens × time-per-token)을 나타내는 장난감 모델에 따르면, 추론 과정의 5배 토큰 소모량은 평균 턴당 지연 시간을 약 4.5배 증가시킬 것입니다. 모든 턴이 사용자가 기다리는 왕복(round trip)이라면, 토큰 자체가 지연 시간입니다.
SOTA, 2026년 9월: 실제가 밝혀낸 것들
속도. 가속기당 최고의 결과: DeepSeek-R1은 1년 전보다 5.7배 빠르며 (v5.1 → v6.1), 비전-언어 모델(VLM)은 6개월 전보다 2.99배 빨라졌고 (v6.0 → v6.1), Llama2-70B의 중앙값 칩당 처리량은 2024년 초 이후 6라운드 동안 5.58배 증가했습니다. 이 중 일부는 새로운 하드웨어 덕분입니다 — R1과 VLM의 증가는 새로운 프리뷰 카테고리에서 NVIDIA의 Vera Rubin NVL72를 이용했기 때문입니다. 하지만 상당한 부분은 순수한 노력(pure grind)의 결과입니다: 일부 v6.1 제출물들은 정확도를 잃지 않으면서 FP8에서 FP4로 이동했으며, Intel의 Xeon 6980P는 소프트웨어만으로도 동일 실리콘 대비 +142% 향상을 달성했고, AMD의 ROCm v7은 동일 MI355X 하드웨어에서 GPT-OSS-120B를 +38% 끌어올렸습니다. 모든
새로운 실리콘. Vera Rubin NVL72가 MLPerf 데뷔를 했습니다 (NVIDIA는 GB300 NVL72 대비 DeepSeek-R1에서 2.5배, Qwen3-VL에서 3.7배의 처리량 주장). AMD는 표준 엔터프라이즈 섀시에 사용할 수 있는 이중 슬롯 PCIe 카드(128 CUs, 144GB HBM3E)인 MI350P를 포함한 세 가지 CDNA 4 부품을 선보였습니다. Intel의 Arc Pro B70은 Whisper부터 새로운 RAG 테스트까지 모든 것을 실행하는 4-GPU, 128GB-VRAM 노드 형태로 도착했습니다. 이전에 DeepSeek-R1에서만 허용되었던 추측 디코딩(Speculative decoding)이 이제 GPT-OSS-120B 대화형 시나리오에서 공식적으로 지원되며, VLM 테스트에는 약 1.5초 응답을 목표로 하는 새로운 대화형 시나리오가 추가되었습니다.
확장 규모 (Scale-out). Crusoe는 MLPerf 추론 역사상 가장 큰 시스템인 표준 RoCE Ethernet을 통해 64개 노드에 걸친 512개의 AMD MI355X GPU를 운영하며, 1개에서 64개 노드까지 거의 선형적인 확장으로 GPT-OSS-120B에서 575만 토큰/초를 달성했습니다. 다중 노드 제출은 2년 전의 0에 비해 기록적인 16을 기록했습니다. 그리고 이국적인 참가자들이 진짜 신호입니다: Cisco는 8개의 NVIDIA H200과 8개의 AMD MI350X를 하나의 추론 풀로 통합했으며 (이번 라운드 최초의 크로스-벤더 이종 시스템), MangoBoost와 Dell은 두 대륙에 걸친 네 개의 사이트를 태평양을 가로질러 단일 엔드포인트로 운영하며 97%의 확장 효율성을 달성했고, AMD GPU에서 최초의 프리필/디코드 분리 결과(prefill/decode-disaggregated results)를 주장했습니다.
워크로드 변화. GPT-OSS-120B가 사상 처음으로 가장 많은 제출(112개)을 기록하며 Llama2-70B의 자리를 차지했고, DeepSeek-R1과 Qwen3-VL이 그 뒤를 바짝 따랐습니다. 안정성을 무엇보다 중시하는 벤치마크 커뮤니티는 혼합 전문가 모델(mixture-of-experts)을 완전히 수용했습니다. Google은 업계가 거대한 MoE 아키텍처로 전환하고 있음을 언급하며 전체 제출을 DeepSeek-R1에 집중했습니다.
실무자의 규칙: 칩이 아닌 엔드포인트를 구매하라
모델을 배포할 때 이 라운드에서 얻어갈 세 가지 교훈:
- 모델이 아닌 파이프라인을 벤치마크하세요. E2E RAG 테스트가 존재하는 이유는 단계별 수치가 오해를 불러일으키기 때문입니다. 만약 워크로드가 임베딩(embed) → 검색(retrieve) → 재순위화(rerank) → 생성(generate)이라면, 파이프라인의 핵심 경로를 최적화하는 것이 한 단계를 세 배로 올리는 것보다 효과적입니다 (노트북의 예시 모델에서 2.12배 대 1.83배).
- 소프트웨어가 하드웨어 스토리의 절반을 차지합니다. 동일한 실리콘 위에서 +142%의 성능 향상은 공짜로 얻는 생성입니다. 새로운 가속기(accelerator)를 구매하기 전에, 서빙 스택(serving stack)이 무엇을 놓치고 있는지 물어보십시오.
- 벤치마크가 당신 쪽으로 이동하고 있습니다. 30개 제출자 중 이미 16개가 MLPerf의 새로운 API 중심 하네스(harness)를 사용했습니다. 이는 데이터센터가 실제로 추론(inference)을 제공하는 표준 API를 넘어서는 진정한 클라이언트/서버 설정입니다. MLPerf Endpoints는 2026년 10월에 공개되며 2027년에는 데이터센터의 벤치마크로서 Inference를 대체할 것입니다. 곧 모두가 인용하는 숫자는 '칩당 토큰 수'가 아니라 '지연 시간 SLA(Service Level Agreement)당 달러 대비 토큰 수'가 될 것입니다. 그것은 애초에 당신이 계산하려고 했던 숫자입니다.
요약
- MLPerf Inference v6.1 (2026년 9월 16일): 기록 제출자 30개, 시스템 120개, 결과 486건을 달성했습니다.
- AI가 실제로 사용되는 방식을 평가하는 두 가지 새로운 테스트를 도입했습니다: 엔드투엔드 RAG 파이프라인(4가지 모델 + 벡터 DB, 824개의 다단계 질문, 최대 5회 검색 라운드)과 엣지 에이전트 기반 벤치마크(1,007턴 SWE-bench 재현, 턴당 평균 지연 시간).
- 가속기별 성능 향상 속도: DeepSeek-R1은 연간 5.7배, VLM은 6개월마다 2.99배, Llama2-70B는 6라운드 동안 5.58배의 성능을 보였습니다 — 새로운 실리콘(Vera Rubin, MI350P, Arc Pro B70)과 FP4 및 소프트웨어 전용 이득(Xeon +142% 동일 칩).
- Speculative decoding이 GPT-OSS-120B에 대해 공식적으로 벤치마크 지원을 받게 되었습니다. Vera Rubin, MI350P, 그리고 Arc Pro B70이 최초의 동료 검토 수치를 게시했습니다.
- 규모가 핵심입니다: 5.75M 토큰/초의 512개 GPU, 크로스 벤더 풀(H200 + MI350X), 그리고 태평양을 가로지르는 단일 엔드포인트에서 97%의 효율성을 달성했습니다.
- MLPerf Endpoints는 2026년 10월에 공개되며, 2027년 데이터센터용 Inference를 대체할 예정입니다: 벤치마크가 타이밍 칩에서 타이밍 엔드포인트로 이동하고 있습니다.
- 노트북:
mlperf_inference_v61.ipynb— 순수 numpy로 구현된 Amdahl 공식, 단계별 트랩(trap), 그리고 에이전트 기반 지연 시간 모델.
동반 노트북: 이 게시물의 실행 가능한 튜토리얼입니다 — 여기에서 다운로드 (Colab/Jupyter에서 열기).
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
