실행 전 명확화: 3D 도구 오케스트레이션의 의도 비대칭성 해결을 위한 자기 진화형 에이전트
요약
사용자의 모호한 지침과 3D 도구의 정밀한 요구 사항 사이의 '의도 비대칭성'을 해결하기 위한 자기 진화형 에이전트 CLARE를 제안합니다. CLARE는 대화를 통해 지침을 명확화하며, 시뮬레이션된 상호작용을 통해 명확화 정책을 스스로 진화시켜 3D 생성 및 편집 작업의 성공률을 높입니다.
핵심 포인트
- 의도 비대칭성 문제를 해결하기 위한 명확화 인지 에이전트 CLARE 소개
- 생성 파이프라인을 4가지 전문화된 인지 역할로 분리하여 효율성 증대
- 다중 턴 보상 최적화를 통해 명확화 정책을 스스로 진화시키는 메커니즘
- 새로운 벤치마크 3D-Clarify 구축 및 기존 모델 대비 높은 성공률 입증
현대의 3D 에셋 생성에는 근본적인 의도 비대칭성(intent asymmetry) 문제가 존재합니다. 최첨단 3D 툴체인(toolchains)은 정밀하고 실행 가능한 파라미터(parameters)를 요구하는 반면, 일반 사용자들은 대개 모호하고 불충분한 지침을 제공하기 때문입니다. 현재의 3D 에이전트들은 이러한 모호성을 노이즈(noise)로 취급하며, 단일 턴(single-turn) 가정하에 맹목적인 실행을 기본값으로 설정합니다. 이러한 한계를 해결하기 위해, 우리는 의도 비대칭성을 실행 오류가 아닌 전략적 대화의 기회로 취급하는 명확화 인지 및 진화형 3D 에이전트인 CLARE를 소개합니다. 생성 파이프라인을 네 가지 전문화된 인지 역할로 분리함으로써, CLARE는 계산 비용이 많이 드는 3D 도구를 호출하기 전에 불충분한 지침을 가로채고 해결하여 text-to-3D 생성, 단일 뷰 재구성(single-view reconstruction), 다중 뷰 재구성(multi-view reconstruction), 포인트 클라우드 편집(point cloud editing), 그리고 후처리(post-processing)라는 다섯 가지 다양한 도메인에서 작업을 원활하게 실행합니다. 결정적으로, CLARE는 경직된 수동 규칙에 의존하는 대신, 시뮬레이션된 다중 턴(multi-turn) 상호작용을 통해 명확화 정책을 스스로 진화시킵니다. 다중 턴 보상(Multi-turn Reward)을 최적화함으로써, 에이전트는 상호작용 효율성과 작업 완료 사이의 미묘한 균형을 내재화합니다. 이를 엄격하게 테스트하기 위해, 우리는 체계적으로 주입된 모호성, 누락된 정보, 잘못된 세부 사항을 포함하는 620개의 상호작용 시나리오로 구성된 종합 벤치마크인 3D-Clarify를 구축했습니다. CLARE는 단일 단계 및 다단계 작업에서 각각 60.40%와 43.34%의 성공률을 기록하며 최첨단(state-of-the-art) 성능을 달성하였으며, 이는 기존 베이스라인(baselines)보다 두 배 이상 높은 수치입니다. 정량적 및 정성적 결과 모두 능동적인 명확화(proactive clarification)가 견고한 3D 실행을 위한 핵심 요소임을 입증합니다. 코드는 https://github.com/xyzhu1225/CLARE 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기