SGA: 교육용 비디오 합성을 위한 Plug&Play 기하학적 검증
요약
교육용 애니메이션 생성 시 발생하는 기하학적 충돌 문제를 해결하기 위한 SGA 모듈을 제안합니다. LLM이 생성한 코드를 분석하여 장면 그래프를 추출하고, 공간적 무결성을 검증하는 MVQS 지표를 통해 시각적 정확도를 높입니다.
핵심 포인트
- SGA 모듈을 통한 플러그 앤 플레이 방식의 기하학적 검증
- 상징적 장면 그래프 추출 및 타겟팅된 코드 정교화 적용
- 렌더링 없이 공간적 무결성을 측정하는 MVQS 지표 도입
- 기존 베이스라인 대비 MVQS 성능 16.1% 향상 달성
최근 연구들은 Manim과 같은 라이브러리를 사용하여 교육용 애니메이션을 위한 실행 가능한 코드를 생성하기 위해 대규모 언어 모델 (LLMs)을 활용하고 있습니다. 그러나 기존 프레임워크는 교육적 콘텐츠를 강조하는 반면 기하학적 폐쇄 (geometric occlusions)를 간과하기 때문에, 공간적 정확성과 시각적 판독성을 보장하는 것은 여전히 어려운 과제로 남아 있습니다. 우리는 코드 중심의 애니메이션 파이프라인을 위한 플러그 앤 플레이 (plug-and-play) 모듈인 Symbolic Geometric Agent (SGA)를 제안합니다. 이 모듈은 LLM이 생성한 코드를 가로채어, 부분 실행을 수행하여 상징적 장면 그래프 (symbolic scene graphs)를 추출하고, 공간적 충돌이 감지될 때 타겟팅된 정교화 (refinement)를 적용합니다. 나아가 우리는 공간적 무결성을 위한 결정론적 렌더링 프리 프록시 (rendering-free proxy)인 Manim Visual Quality Score (MVQS)를 도입합니다. 4개의 LLM 백본 (backbones)과 2개의 에이전트 파이프라인 (agentic pipelines)에 대해 MMMC-Code 벤치마크에서 수행한 실험 결과, SGA는 73.11의 최고 MVQS (Code2Video + GPT-5.1)를 달성하였으며, 이는 원본 베이스라인 대비 16.1%의 상대적 향상에 해당합니다. 또한 8개의 백본 x 파이프라인 구성 중 7개에서 MVQS를 개선했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기