GS-Agent: 생성형 시뮬레이션을 통한 4D 물리 세계 구축
요약
GS-Agent는 자연어 설명을 바탕으로 물리적으로 타당한 4D 세계를 생성하는 멀티 에이전트 프레임워크입니다. 물리 엔진을 루프 내에 통합하여 엔티티 관리와 렌더링 구성을 자동화함으로써 역동적인 시뮬레이션을 구현합니다.
핵심 포인트
- 자연어 기반의 4D 물리 세계 생성 자동화
- 물리 엔진을 통합한 엔드 투 엔드 멀티 에이전트 시스템
- 엔티티 관리 및 렌더링 구성 작업의 분해 및 협업
- 액체, 변형 가능한 물체 등 복잡한 물리 상호작용 구현
자연어 설명으로부터 역동적이고 물리적으로 사실적인 4D 세계를 생성하는 것은 매혹적이면서도 도전적인 과제입니다. 전통적인 컴퓨터 그래픽스 (Computer Graphics) 방법론은 수동 제작에 의존하며, 재질 (Materials), 동작 (Motions), 시각적 충실도 (Visual Fidelity)를 미세 조정하기 위해 막대한 인간의 노력을 필요로 합니다. 최근 생성형 파운데이션 모델 (Generative Foundation Models)의 발전은 대규모 데이터로부터 이러한 4D 세계를 생성하는 학습 방식에 대한 관심을 불러일으켰으나, 기존 방법들은 여전히 물리적 타당성 (Physical Plausibility)과 제어 가능성 (Controllability)을 보장하는 데 어려움을 겪고 있습니다.
본 연구에서 우리는 파운데이션 모델을 활용하여 인간이 전통적으로 4D 세계를 만드는 방식을 모방하면서도 전체 과정을 자동화하는 에이전트 시스템 (Agentic System)을 구축하는 차별화된 경로를 택합니다. 우리는 자연어로부터 사실적이고 역동적이며 제어 가능한 4D 물리 세계를 생성하기 위해 물리 엔진 (Physics Engines)을 루프 내에 통합한 엔드 투 엔드 (End-to-end) 멀티 에이전트 프레임워크인 GS-Agent를 제시합니다. 인간이 4D 세계를 구축하는 방식에서 영감을 얻은 GS-Agent는 작업을 엔티티 관리 (Entity Management)와 렌더링 구성 (Rendering Configuration)으로 분해합니다. 엔티티 관리는 3D 에셋 큐레이션 (3D Asset Curation), 재질 조정 (Material Tuning), 배치 (Placement), 동작 제어 (Motion Control)를 포함하며, 렌더링 구성은 카메라 및 조명 조작을 포함합니다.
서로 다른 전문성을 가진 여러 에이전트들은 코드를 통해 물리 엔진과 상호작용하고, 멀티모달 피드백 (Multimodal Feedback)을 탐색하며, 주어진 설명과 일치하는 4D 세계를 반복적으로 구축하기 위해 협력합니다. 실험 결과에 따르면, GS-Agent는 자연어를 액체 (Liquids), 변형 가능한 물체 (Deformable Objects), 강체 (Rigid Bodies) 간의 풍부한 상호작용을 보여주는 다양하고 물리적으로 타당한 4D 세계로 효과적으로 변환하는 동시에, 영화 같은 카메라 및 조명 제어를 달성합니다. 우리는 GS-Agent가 4D 세계 생성의 새로운 패러다임을 위한 토대가 되어, 창의적인 콘텐츠 제작과 물리적 AI (Physical AI)를 강화할 것으로 전망합니다. 프로젝트 페이지: https://umass-embodied-agi.github.io/gs-agent/
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기