ScribbleEdit: 스크리블 기반 이미지 편집을 위한 벤치마크
요약
본 글은 사용자가 스크리블(scribble) 방식으로 이미지 편집 의도를 지정하는 상호작용의 어려움을 다루며, 이를 체계적으로 평가하기 위한 새로운 벤치마크인 ScribbleEdit을 소개합니다. 이 벤치마크는 모델이 스크리블 조건부로 이미지를 편집하는 능력을 측정하며, 자동화된 데이터 구축 및 의도 정렬 평가 프로토콜을 도입했습니다.
핵심 포인트
- Scribble 기반 상호작용은 직관적이지만, 기존 VLM/LLM 모델이 이를 이해하고 실행하기 어려움.
- 새로운 벤치마크 ScribbleEdit을 구축하여 스크리블 조건부 이미지 편집 능력을 평가함.
- 모델의 스크리블 의도 포착 능력 부족을 분석하고 개선 방향 제시.
- 소프트 토큰 기반의 기준선(baseline)을 제안하여 향후 연구에 기여함.
스크리블(scribble) 기반 상호작용은 사용자가 인터랙티브 편집 도구에서 이미지 편집 의도(editing intents)를 지정하는 가볍고 직관적인 방법을 제공합니다. 하지만 현재 VLM이나 LLM에 기반한 이미지 편집 모델들은 스크리블 입력만을 기반으로 편집을 이해하고 실행하는 데 어려움을 겪습니다. 이 문제를 체계적으로 연구하기 위해, 우리는 이미지 편집 모델이 스크리블 조건부(conditioned on scribbles)로 이미지 편집을 수행하는 능력을 평가하는 새로운 벤치마크인 ScribbleEdit을 구축했습니다. 이 작업은 스크리블의 의도에 대한 깊은 이해와 그 공간 정보에 대한 정확한 해석을 모두 요구합니다. ScribbleEdit에서, 우리는 자동화된 데이터 구축 파이프라인을 설계하고 의도 정렬(intention alignment)을 명시적으로 측정하는 전용 평가 프로토콜을 도입했습니다. 우리의 분석 결과는 기존 VLM/LLM 기반 편집 모델들이 스크리블의 의도를 정확하게 포착하지 못한다는 것을 보여줍니다. 스크리블 전용 이미지 편집에 대한 향후 발전을 안내하기 위해, 우리는 모델이 스크리블 의미론(scribble semantics)을 이해하도록 향상시키고 우리의 벤치마크에서 표준 이미지 편집 모델보다 성능이 우수한 간단하지만 효과적인 소프트 토큰(soft-token) 기반의 기준선(baseline)을 제안합니다. 우리의 평가와 기준선은 스크리블 구동(scribble-driven) 이미지 편집을 평가하고 개선하기 위한 구체적인 기반을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기