DatalogBench: 텍스트를 Datalog로 합성하는 대규모 언어 모델 평가
요약
DatalogBench는 텍스트 질문을 Datalog 코드로 합성하는 대규모 언어 모델(LLMs)의 성능을 체계적으로 평가하기 위해 개발된 새로운 벤치마크입니다. 이 벤치마크는 뮤테이션 분석으로 검증된 오라클에 대해 보류 입력으로 실행하여 정확도를 측정합니다. 연구 결과, 직접 프롬프팅 방식으로는 컴파일 시간 오류가 빈번하게 발생했으나, 코딩 에이전트를 사용했을 때 최대 83.8%의 높은 성능을 보여 재귀 추론 및 분해 능력이 향상될 필요성을 제시했습니다.
핵심 포인트
- DatalogBench는 텍스트-Datalog 합성 작업을 평가하는 새로운 벤치마크입니다.
- 직접 프롬프팅은 컴파일 시간 오류가 많아 어려움이 있습니다.
- 코딩 에이전트는 최대 83.8%의 성능을 보여 높은 잠재력을 입증했습니다.
- LLM과 에이전트 모두 재귀 추론 및 분해 능력이 개선될 과제입니다.
Datalog는 프로그램 분석과 같은 추론 작업을 뒷받침하지만, 그 프로그램을 작성하기는 어렵습니다. 기존의 합성기(synthesizers)들은 이 작업을 자동화하지만, 사용자에게 입력-출력 예시 형태로 의도를 명시하도록 요구합니다. 대규모 언어 모델(LLMs)은 자연어 질문으로부터 Datalog로 텍스트를 합성하는 보다 자연스러운 경로를 제시하지만, 이것을 얼마나 잘 수행하는지에 대해서는 체계적으로 평가된 바가 없습니다. 우리는 기존의 Datalog 기반 아티팩트에서 선별한 136개의 텍스트-Datalog 합성 작업을 포함하는 벤치마크인 DatalogBench를 제시합니다. 합성된 프로그램은 뮤테이션 분석을 통해 검증된 오라클(oracle)에 대해 보류 입력(held-out inputs)으로 실행하여 평가됩니다. 여섯 개의 LLM과 네 가지 프롬프팅 구성 전반에 걸쳐, 정확히 일치하는 비율(exact match)의 최고점은 68.4%였으며, 관계 설명이나 입력-출력 예시는 모델 의존적인 미미한 영향을 보였습니다. 직접 프롬프팅(direct prompting)을 사용할 경우, 대부분의 실패는 컴파일 시간(compile time)에 발생하며, 이는 일반적으로 모델이 선언하거나 일관되게 타입을 지정하지 않은 보조 술어(auxiliary predicates)를 발명하기 때문입니다. 두 코딩 에이전트(coding agents)가 최대 83.8%까지 도달하여 이러한 실패를 거의 모두 제거했으며, 주로 재귀적 작업에 집중된 의미론적 오류만을 남겼습니다. 따라서 DatalogBench는 현재의 LLM과 에이전트에게 있어 재귀 추론 및 분해(decomposition)를 열린 과제로 식별하며, 이 두 가지 모두에 대해 신뢰할 수 있는 실행 기반 측정치를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.PL (Programming Languages)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기