생성형 AI 추론 컴퓨팅 평가: 엔터프라이즈 워크로드를 위한 프레임워크
요약
LLM 배포 방식이 단일 턴에서 에이전트적 궤적으로 변화함에 따라, 추론 하드웨어의 병목 현상이 가중치 읽기(weight reads) 중심에서 토큰 디코드 지연 시간(TPOT) 중심으로 이동하고 있습니다. 본 논문은 루프라인 분석과 새로운 평가 프레임워크를 제시하며, 에이전트적 워크로드에서의 결정론 및 테일 지연 시간이 핵심 성능 변수임을 입증합니다.
핵심 포인트
- LLM 배포가 에이전트 궤적으로 전환되며 TPOT가 주요 병목으로 부상함.
- 에이전트 워크로드는 단계별 신뢰성 문제로 인해 디코드 이점을 상쇄할 수 있음.
- 새로운 네 가지 계층 평가 프레임워크를 제시하여 엔터프라이즈급 측정 기준을 제공함.
- 장기 작업에서는 토큰 처리량보다 성공적인 작업당 비용이 더 중요한 성능 지표가 될 가능성이 높음.
LLM 배포는 단일 턴(single-turn) 완료 방식에서 에이전트적 궤적(agentic trajectories)으로 전환되고 있으며, 이 과정에서 모델은 테스트 시점에 계획을 세우고, 도구를 호출하며, 결과를 읽고 추론한 후 행동합니다. 이는 추론 하드웨어의 경제성을 역전시키는데, 채팅 서빙은 가중치 읽기(weight reads)를 대규모 배치(large batches)에 걸쳐 상각하는 반면, 에이전트 궤적은 순차적으로 의존하며 실질적인 배치 크기가 하나(effective batch one)로 작동하고, 토큰당 디코드 지연 시간(per-token decode latency, TPOT)이 작업 완료 시간의 지배적인 항이 됩니다. 루프라인 분석(roofline analysis)과 폐쇄형식 에피소드 지연 시간 모델(closed-form episode-latency model)을 사용하여, 이러한 체제가 가중치를 온디 SRAM에 유지하는 가속기(Cerebras WSE-3/3T, Groq/NVIDIA LPU) 또는 컴파일러 관리 계층 메모리(SambaNova SN40L/SN50)를 선호하는 이유와 2026년에 세 공급업체 생태계가 분산된 프리필/디코드 서빙(disaggregated prefill/decode serving)으로 수렴한 이유를 보여줍니다. 우리는 단계별 신뢰성(per-step reliability)이 궤적 길이에 따라 지수적으로 복합된다는 것을 보여주는데, 단계당 2%의 실패율은 20단계 에이전트에게서 2배의 디코드 이점을 상쇄합니다. 따라서 결정론(determinism)과 테일 지연 시간(tail latency)이 일차적인 성능 변수가 됩니다. 이후 우리는 네 가지 계층 평가 프레임워크(실리콘, 서빙 시스템, 에이전트 에피소드, 엔터프라이즈)를 제안하며, 이에는 에이전트적 SLO에서의 구풋(goodput) 및 성공적인 에피소드당 비용을 기반으로 한 측정 항목 세트, 여섯 가지 작업군에 걸친 6축 벤치마크 프로토콜, 쌍별 부트스트랩 통계 설계, 공급업체 실행 벤치마크를 위한 증명(attestation) 프로토콜, 그리고 명시적인 손익분기점 조건이 포함된 TCO(총 소유 비용), 가용성 및 채택 시기 모델이 포함됩니다. 모든 성능 수치는 공개적이며 근거 클래스별로 표시되어 있습니다. 우리는 검증 가능한 7가지 가설과 이를 테스트하는 실험을 제시하며, 장기적인 작업에서는 토큰 처리량 순위가 성공적인 작업당 비용 순위와 다를 가능성이 가장 높다고 주장합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기