GNN-CB: 인간 및 LLM 평가를 위한 그래프 신경망 대회 벤치마크
요약
본 논문은 LLM이 그래프 구조의 머신러닝 문제를 해결하는 능력을 평가하기 위해 GNN-CB라는 새로운 대회 기반 벤치마크를 제안합니다. 이 벤치마크는 노드, 엣지, 그래프 레벨 예측을 포함한 18개 대회를 통해 인간과 LLM 모두를 평가하며, 자동화된 파이프라인으로 결과를 측정합니다.
핵심 포인트
- GNN-CB는 GNN 코딩 과제에 대한 최초의 대회 기반 벤치마크입니다.
- 인간 참가자와 LLMs 모두를 통제된 환경에서 비교 평가할 수 있습니다.
- LLM은 일부 대회에서 우승하지만, 전반적으로 인간 최고 성능과 일치하지 않습니다.
- 자동화 인프라와 실습 리소스를 갖춘 살아있는 벤치마크로 공개됩니다.
대규모 언어 모델(LLMs)은 코딩 및 추론 벤치마크에서 강력한 성능을 보여주었습니다. 하지만, 그래프 구조의 머신러닝 문제를 해결하는 능력은 여전히 크게 탐구되지 않은 영역입니다. 특히, 현재 어떤 벤치마크도 LLMs가 현실적인 경쟁 환경에서 엔드투엔드(end-to-end) 그래프 신경망(GNN) 코딩 과제를 자율적으로 해결할 수 있는지 평가하지 못하고 있습니다. 이러한 격차를 해소하기 위해, 본 논문은 GNN-CB를 소개합니다. 이는 GNN 코딩 과제에 대해 인간과 LLMs 모두를 평가하는 최초의 대회 기반 벤치마크입니다. GNN-CB는 다양한 그래프 카테고리, 도메인 및 난이도 단계에 걸쳐 노드(node), 엣지(edge) 및 그래프 레벨 예측을 아우르는 18개의 선별된 대회를 포함합니다. 모든 제출물은 숨겨진 테스트 세트와 표준화된 채점 방식을 갖춘 통합 자동화 파이프라인을 통해 평가됩니다. 인간 참가자들은 통제된 경쟁 제약 조건 하에서 과제를 해결하며, LLMs는 계획-후-코딩(plan-then-code) 패러다임과 제한된 실행 및 복구(bounded execute-and-repair) 루프를 기반으로 고정된 제로샷 프롬프팅 프로토콜을 사용하여 평가됩니다. 이 벤치마크는 또한 동일한 프로토콜 내에서 비에이전트(non-agent) 및 자율 에이전트 기반 평가를 모두 지원합니다. 우리가 평가한 프로토콜 하에서, LLMs가 인간 최고 성능과 일치하는 경우는 드물고 대회 전반에 걸쳐 덜 안정적인 성능을 보입니다. 단일 모델이 지배적이지 않습니다: 몇몇 대회에서는 LLMs가 우승하지만, 대부분의 과제에서 인간이 여전히 최고 점수를 유지합니다. 우리는 자동 평가 인프라, 동적 리더보드 및 재현 가능한 실행 파이프라인을 갖춘 살아있는 벤치마크로 GNN-CB를 공개합니다. 벤치마킹 외에도, GNN-CB는 점진적으로 다양해지는 그래프 학습 과제 전반에 걸쳐 GNN 구현을 연구하기 위한 실습 지향적 리소스를 제공합니다. 이 벤치마크와 평가 프레임워크는 https://basiralab.github.io/GNN-CB/에서 공개적으로 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기