GameLogicBench: 틱 단위 상태 단언을 이용한 런타임 게임 로직 기반 코딩 에이전트 평가
요약
본 기사는 게임 개발 로직 구현 능력을 평가하기 위해 GameLogicBench라는 새로운 벤치마크를 소개합니다. 이 벤치마크는 Godot 프로젝트 기반의 72개 태스크와 1,451개의 테스트 케이스로 구성되어 있으며, 자동화된 평가자가 모든 시뮬레이션 틱에서 게임 규칙을 확인하여 에이전트의 정확한 동작 구현 능력을 측정합니다. 특히 필수 기능 제거(mutants)를 통한 검증 방식을 도입하여 신뢰도를 높였습니다.
핵심 포인트
- GameLogicBench는 Godot 기반의 72개 로직 태스크로 구성된 새로운 평가 벤치마크입니다.
- 자동화된 평가는 모든 시뮬레이션 틱에서 게임 규칙 위반 여부를 확인합니다.
- 필수 기능 제거(mutants) 검증을 통해 에이전트가 동작 자체를 구현하는지 측정합니다.
- 에이전트는 대규모 태스크일수록 코드 검사 및 도구 호출 빈도가 증가했습니다.
코딩 에이전트는 대규모 소프트웨어 프로젝트 전반에 걸쳐 코드를 수정하고 테스트할 수 있습니다. 게임 개발은 에이전트가 게임 플레이 규칙을 구현해야 하는 도메인입니다. 게임은 실행 중 규칙을 위반했음에도 불구하고 유효한 상태로 끝날 수 있습니다. 현재의 게임 개발 벤치마크는 고정된 예시를 재현하거나, 비디오 점수를 매기거나, 다른 모델에게 결과를 판단하도록 요청합니다. 하지만 기존에는 다양한 평가자 선택 시나리오 전반에 걸쳐 실행 중 게임 규칙을 확인하면서도 정확하게 재현 가능한 판결을 보장하는 벤치마크는 없습니다. 우리는 Godot 프로젝트로 구성된 72개의 게임 플레이 로직 태스크를 포함하는 벤치마크인 GameLogicBench를 소개합니다. 자동화된 평가자는 모든 시뮬레이션 틱에서 각 게임의 규칙을 확인합니다. 403개의 수작업으로 설계된 시나리오에 걸쳐, 시드된 매개변수 변형은 1,451개의 테스트 케이스를 생성합니다. 평가자가 구현 선택이 아닌 동작을 측정하도록 보장하기 위해, 각 태스크에 대해 다양한 올바른 구현을 허용하는 동시에 필수 기능 하나가 제거된 돌연변이(mutants) 구현은 거부해야 합니다. 이 태스크들은 고립된 메커니즘, 다중 시스템 상호작용, 그리고 레포지토리 규모의 기능을 아우릅니다. 언어 모델과 스캐폴드 20가지 조합에 걸쳐, 가장 높은 성능을 보인 실행은 52.78%의 태스크를 해결했습니다. Claude Code 하에서, 모든 열두 개의 모델이 태스크 범위가 고립된 메커니즘에서 상호작용하는 시스템으로, 그리고 레포지토리 규모의 기능으로 확장됨에 따라 더 적은 태스크를 해결했습니다. 에이전트는 레포지토리 규모 태스크에서 고립 메커니즘 태스크보다 코드를 더 자주 검사하고 더 많은 도구 호출을 수행합니다. 대부분 성공하지 못한 제출물들은 실행 가능하지만, 필수 게임 동작 중 일부를 잘못 구현합니다. 우리는 돌연변이를 사용한 유효성 검사를 포함하는 버전과 그렇지 않은 버전으로 구축된 벤치마크 평가기를 비교했습니다. 이 검증이 없었기 때문에, 부정확한 에이전트 제출물들이 통과되었습니다. 별도의 분석에 따르면 네트워크 접근이 열려 있을 때 에이전트가 공개 레포지토리에서 코드를 복사하는 것이 발견되었습니다. 따라서 신뢰할 수 있는 평가는 테스트가 무엇을 거부하는지와 외부 코드 에이전트가 무엇에 접근할 수 있는지 모두에 달려 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기