EditHero: 장기 호라이즌 파트 레벨 3D 편집 및 바이브 모델링을 위한 벤치마크
요약
EditHero는 자연어 지침과 목표 이미지를 활용하여 장기 호라이즌, 파트 레벨 3D 편집을 위한 최초의 벤치마크입니다. 이 벤치마크는 비-에이전트 방식(Top-down)과 LLM/VLM 에이전트 방식(Bottom-up) 두 가지 접근법을 비교합니다. 연구진은 EditHero를 통해 신뢰할 수 있는 반복적 3D 편집 연구를 지원하고자 합니다.
핵심 포인트
- EditHero는 장기 호라이즌, 파트 레벨 3D 편집을 위한 새로운 벤치마크입니다.
- 비-에이전트 방식은 객체 재생성 및 유지 영역 추론에 어려움이 있습니다.
- LLM/VLM 에이전트는 지침 준수와 보존 측면에서 우위를 보이지만, 속도가 느립니다.
- 연구진은 이 엔진과 편집 시퀀스를 공개하여 연구를 지원할 계획입니다.
3D 편집 방법들은 보통 단일 편집에 대해서만 테스트되지만, 실제 에셋은 긴 일련의 수정 과정을 통해 구축되며, 각 단계마다 요청된 변경 사항을 구현하는 동시에 다른 모든 것을 그대로 유지해야 합니다. 우리는 EditHero를 소개합니다. 이는 자연어 지침과 기하학 및 텍스처 모두에 대한 목표 이미지를 갖춘 장기 호라이즌(long-horizon), 파트 레벨(part-level) 3D 편집을 위한 최초의 벤치마크입니다. 결정론적 어셈블리 엔진은 모든 편집 후에 정확한 목표를 생성하며, 모든 시퀀스는 수동으로 검토됩니다. 우리는 EditHero를 사용하여 3D 편집에 대한 두 가지 상반된 접근 방식을 비교합니다. 비-에이전트 방식(Non-agentic methods)은 탑다운(top down) 방식으로 작동하여 학습된 3D 표현으로부터 객체를 재생성하고 무엇을 유지할지 추론합니다. 반면, LLM/VLM 에이전트는 바텀업(bottom up) 방식으로 작동하며 메시를 검사하고 지침에 의해 필요한 부분만 다시 작성하는 코드를 통해 편집합니다. 비-에이전트 방식은 요청된 변경 사항을 놓치거나 고정되어야 할 영역을 방해하는 경우가 많습니다. 대부분의 LLM은 지침을 더 충실하게 따르며, 모두 수정되지 않은 부분을 더 잘 보존하지만, 각 편집 과정에 수 분이 걸립니다. 우리는 신뢰할 수 있는 반복적 3D 편집 연구를 지원하기 위해 이 엔진과 편집 시퀀스를 공개할 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기