TaoD2C-Bench: 산업용 UI 코드 생성을 위한 MLLM 벤치마킹
요약
본 논문은 MLLMs의 한계점 중 하나인 '제약 조건 인지 기반 크로스모달 추론'을 다루며, 특히 산업용 디자인-투-코드(D2C) 분야에 초점을 맞췄습니다. 이를 위해 17개 상업 플랫폼의 데이터를 활용한 새로운 벤치마크 TaoD2C-Bench를 제시했습니다. 이 벤치마크는 UI 코드 생성 능력을 평가하며, MLLMs가 실제 산업 요구사항을 만족하는 코드를 생성하는 데 격차가 있음을 입증합니다.
핵심 포인트
- TaoD2C-Bench는 산업용 D2C(디자인-투-코드) 분야의 새로운 벤치마크입니다.
- 데이터셋은 17개 상업 플랫폼의 디자인과 9만 개 이상의 전문가 주석을 포함합니다.
- MLLMs가 시각적 재구성 능력과 실제 구현 요구사항 충족 능력이 다름을 보여줍니다.
- 엔드투엔드 코드 생성, 요구사항 추론, 요구사항 실현 세 가지 작업을 정의했습니다.
멀티모달 대규모 언어 모델(MLLMs)의 주요 과제는 시각적 인식을 넘어 제약 조건 인지 기반의 크로스모달 추론으로 나아가는 것입니다. 이는 시각적 단서를 도메인별 규칙 하에서 다른 모달리티의 정보와 결합하여 요소 간의 관계를 이해하는 것을 포함합니다. 이러한 과제는 사용자 인터페이스(UI) 디자인을 코드로 변환하는 산업용 디자인-투-코드(D2C) 분야에서 특히 두드러지게 나타나며, MLLMs가 디자인 이미지와 무질서한 레이어 메타데이터를 연결하고, 컴포넌트 및 레이아웃 구현 요구사항을 추론하며, 타겟 라이브러리 제약 조건 하에 이를 코드로 실현하도록 요구합니다. 그러나 이러한 능력은 실제 산업 환경에서 충분히 평가되지 못했습니다. 이 격차를 해소하기 위해, 우리는 산업 애플리케이션에서 구현 요구사항을 만족하는 UI 코드 생성 능력을 평가하기 위한 벤치마크인 TaoD2C-Bench를 제시합니다. TaoD2C 데이터셋은 17개 상업 플랫폼의 2,861개 제작 디자인으로 구성되어 있으며, 네 가지 범주(Component, Group, Alignment, Position)에 걸쳐 97,652개의 전문가 주석을 포함하고 있습니다. 이 주석들은 필수 제약 조건과 허용되는 구현 선택을 구분합니다. TaoD2C-Bench는 세 가지 작업을 정의합니다: 엔드투엔드 UI 코드 생성, 요구사항 추론, 그리고 요구사항 실현입니다. 8개 MLLMs를 평가한 결과, 구현 요구사항을 만족하는 UI 코드를 생성하는 데 상당한 격차가 있음을 보여주었으며, 추론 및 실현에서 뚜렷한 성능 프로필을 보였습니다. 또한, 우리는 MLLMs의 시각적 재구성 능력이 반드시 이러한 요구사항을 충족하는 코드를 생성할 수 있는 능력까지 의미하지는 않음을 보여줍니다. 우리는 산업용 UI 코드 생성을 위한 연구를 지원하기 위해 TaoD2C를 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기