구조적 생성 및 편집을 위한 통합 시각 중심 벤치마크 VCG-Bench 제안
요약
기존 픽셀 기반 방식의 한계를 극복하기 위해 mxGraph XML을 활용한 '코드로서의 다이어그램(Diagram-as-Code)' 패러다임을 제안합니다. 이를 평가하기 위한 통합 벤치마크인 VCG-Bench는 생성과 편집 능력을 모두 측정하며, 현재 VLM들이 구조적 충실도와 지시 준수 측면에서 직면한 과제를 보여줍니다.
핵심 포인트
- 픽셀 기반 합성의 한계를 극복하기 위해 기호 논리 기반의 mxGraph XML 활용 제안
- 6개 도메인, 15개 하위 도메인을 포함하는 1,449개의 다이어그램 데이터셋 구축
- 생성(Vision-to-Code)과 편집(Code-to-Code)을 통합한 새로운 평가 패러다임 정의
- mxGraph 실행 성공률 및 스타일 일관성 점수(SCS)를 포함한 다차원 평가 프로토콜 도입
- 최신 VLM 모델들이 구조적 충실도 및 지시 준수에서 여전히 개선이 필요함을 입증
시각-언어 모델 (Vision-Language Models, VLMs)의 급격한 발전에도 불구하고, 전문적인 워크플로우에 필수적인 구조화되고 제어 가능한 다이어그램 작업 (diagrammatic tasks)을 처리하는 능력에는 여전히 중대한 격차가 존재합니다. 기존 방식들은 주로 픽셀 기반 합성 (pixel-based synthesis)에 의존하고 있는데, 이는 확률적 픽셀 공간 (probabilistic pixel spaces)에서 작동하므로 편집 가능성 (editability)과 충실도 (fidelity) 측면에서 본질적인 한계가 있습니다. 대신, 우리는 정밀한 다이어그램 생성 및 편집을 위해 mxGraph 확장 가능 마크업 언어 (mxGraph Extensible Markup Language, XML)를 활용하는 기호 논리 (symbolic logic) 기반의 새로운 '코드로서의 다이어그램 (Diagram-as-Code)' 패러다임을 제안합니다. 우리는 시각 중심의 mxGraph 작업을 위한 통합 벤치마크인 VCG-Bench를 선보입니다. VCG-Bench는 다음과 같이 구성됩니다: (1) 6개 도메인 및 15개 하위 도메인에 걸친 1,449개의 다양한 다이어그램으로 구성된 분류된 데이터셋, (2) 생성 (Generation, Vision-to-Code)과 편집 가능성 (Editability, Code-to-Code)을 통합하는 패러다임 정의, (3) mxGraph 실행 성공률 (mxGraph Execution Success Rate), 스타일 일관성 점수 (Style Consistency Score, SCS) 등 다차원 지표를 사용하는 맞춤형 평가 프로토콜 (Tailored Evaluation Protocol). 실험 결과는 현재의 최첨단 (State-of-the-Art, SOTA) VLMs가 구조적 충실도 (structured fidelity)와 지시 준수 (instruction compliance) 측면에서 직면한 과제들을 강조하며, 이는 모델의 시각 및 추론 능력을 반영합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기