WorldSolver: LLM 에이전트가 솔버 생성을 통해 물리 역학을 시뮬레이션할 수 있을까?
요약
본 글은 LLM 에이전트가 물리 역학 시뮬레이션을 위한 솔버(solver)를 생성할 수 있는지 탐구한 WorldSolver 벤치마크를 소개합니다. 이 벤치마크는 고전 컴퓨터 그래픽스 논문 기반의 168개 태스크로 구성되어 있으며, 에이전트가 코드를 완성하도록 설계되었습니다. 평가 결과, 최첨단 에이전트도 실행 가능한 솔버 생성 자체가 어렵고, 시각적/물리적 정확성을 만족시키기는 매우 어려운 것으로 나타났습니다.
핵심 포인트
- WorldSolver는 168개 태스크로 구성된 물리 역학 시뮬레이션 벤치마크입니다.
- 에이전트가 솔버를 생성하는 것은 기술적으로 높은 난이도를 가집니다.
- GPT-5.6-Sol과 Claude-Opus-5가 비교적 우수했으나, 전반적인 점수는 약 47% 수준이었습니다.
- WorldSolver는 에이전트 기반 동적 물리 세계 시뮬레이션 연구의 초기 단계입니다.
LLM 기반 에이전트는 과학 및 공학 문제 해결 능력을 점차 향상시키고 있으며, 물리 시뮬레이션은 체화된 AI(embodied AI), 게임, 영화에 응용되어 복잡한 물리 현상을 재현하는 도전적이면서도 실질적인 테스트베드로 부상하고 있습니다. 이러한 시뮬레이션의 핵심 요소인 솔버(solver)는 동적 시스템의 상태가 시간에 따라 어떻게 진화하는지 계산합니다. 그러한 솔버를 구축하려면 적절한 모델을 식별하기 위한 물리적 이해, 근본적인 역학을 공식화하기 위한 수학적 추론, 그리고 이를 실행 가능한 코드로 구현하기 위한 소프트웨어 엔지니어링이 필요하지만, LLM 에이전트의 이러한 능력은 아직 충분히 탐구되지 않은 영역입니다. 이에 저희는 61편의 고전 컴퓨터 그래픽스 논문에서 파생된 7개의 물리 도메인을 아우르는 168개의 시뮬레이션 태스크로 구성된 벤치마크인 WorldSolver를 소개합니다. 각 태스크에는 장면을 위한 고정된 시뮬레이션 환경을 제공하는 코드 스캐폴드(code scaffold)가 포함되어 있으며, 솔버 구현은 에이전트가 완성하도록 남겨둡니다. 구체적으로, 저희는 세 가지 차원에서 평가했습니다: 성공적인 실행을 위한 실행 검사(Execution Checks), 렌더링된 시뮬레이션에서 의도된 동적 동작을 재현하는 시각적 충실도(Visual Fidelity), 그리고 생성된 역학에 대한 물리 기반 검증을 위한 물리적 타당성(Physical Plausibility)입니다. 최첨단 에이전트를 대상으로 한 실험 결과, 실행 가능한 솔버를 생성하는 것 자체가 어렵고, 시각적 및 물리적 정확성을 만족시키는 것은 훨씬 더 어려운 것으로 나타났습니다. GPT-5.6-Sol과 Claude-Opus-5가 평가된 다른 에이전트들보다 비교적 우수하게 수행했지만, 각각 48.7%와 46.7%의 전반적인 점수에 그쳤습니다. WorldSolver는 에이전트 기반 솔버 생성으로 나아가는 초기 단계이며, 저희는 이것이 동적 물리 세계를 충실히 시뮬레이션할 수 있는 에이전트를 향한 발전을 이끄는 데 도움이 되기를 바랍니다. 코드는 https://github.com/sirujiang/WorldSolver에서 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기