D2K-Bench: LLM 에이전트가 전문가 디자인을 효율적인 GPU 커널로 변환할 수 있는가?
요약
D2K-Bench는 LLM 에이전트가 전문가 디자인 가이드를 효율적인 GPU 커널로 변환하는 능력을 측정하는 진단 벤치마크입니다. 이 벤치마크를 통해, 전문적인 디자인 가이드가 코드 생성의 정확도와 성능을 크게 향상시키는 것이 입증되었습니다. NVIDIA B200 GPU에서 테스트한 결과, 가이드는 모델-작업 쌍의 정확도를 높이고 전반적인 성능 점수를 증가시켰으며, 최첨단 모델들의 속도 향상을 가져왔습니다.
핵심 포인트
- 전문가 디자인 가이드가 LLM 에이전트의 코드 생성 능력을 크게 향상시킨다.
- D2K-Bench는 고수준 알고리즘부터 저수준 최적화까지 다층적인 평가를 제공한다.
- 가이드 사용 시 정확도와 성능 점수가 유의미하게 증가했다.
- 최첨단 모델들의 속도 향상이 확인되어, 가이드의 실질적 가치를 입증했다.
대규모 언어 모델(LLM) 에이전트에 의해 생성된 GPU 커널은 전문가 구현보다 비효율적일 수 있지만, 런타임만으로는 이러한 격차가 디자인 발견 및 구현과 어떻게 관련되는지 알 수 없습니다. 우리는 에이전트가 전문가의 디자인 가이드를 얼마나 효과적으로 효율적인 GPU 커널로 변환하는지를 측정하는 진단 벤치마크인 D2K-Bench를 소개합니다. 이 가이드는 L1: 고수준 알고리즘 통찰력, L2: 데이터 흐름 설계, 그리고 L3: 저수준 최적화 트릭을 다루며, 이러한 레벨 간의 의존성도 포함합니다. 가이드가 있는 경우와 없는 경우의 쌍별 실행은 작업 설명, 워크로드, 도구, 하드웨어 및 350턴 예산을 공유합니다. 보완적인 평가는 독립적으로 제안된 디자인과 생성된 코드에 구현된 디자인 속성을 검토합니다. NVIDIA B200 GPU에서 다섯 가지 모델을 대상으로 진행한 결과, 가이드는 130개 이상의 모델-작업 쌍에서 정확도를 93.1%에서 98.5%로 높였고, 모든 26개 작업에 걸쳐 성능 점수(Performance Score)를 1.46에서 1.95로 증가시켰습니다. 두 실행 모두에서 모든 26개 작업에 대해 정확한 제출을 한 세 가지 최첨단 모델(GPT-6-Astra, Claude-Opus-4.8, 및 GPT-5.6-Sol)의 경우, 기하 평균 속도 향상(geometric mean speedup)이 $1.69 imes$에서 $2.49 imes$로 증가했습니다. 모든 다섯 가지 모델에 걸쳐 평균 종합 구현 점수(mean combined implementation score)는 100점 만점에 57점에서 70점으로 증가했습니다. 이러한 결과는 전문가 디자인 가이드의 가치를 보여주는 동시에, 여전히 구현되지 않은 디자인 속성들을 식별합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기