시각적 유사성의 다양한 의미: 텍스트 프롬프트 기반 이미지 지각 메트릭
요약
텍스트 프롬프트를 통해 이미지의 다양한 시각적 유사성을 측정할 수 있는 TPIPS 메트릭을 제안합니다. 기존 메트릭의 한계를 극복하기 위해 대규모 데이터셋을 활용하여 VLM을 미세 조정하였으며, 인간의 지각과 유사한 성능을 입증했습니다.
핵심 포인트
- 텍스트 프롬프트 기반의 이미지 지각 유사성 측정 메트릭(TPIPS) 제안
- 기존 단일 스칼라 값 방식의 한계를 극복하고 다각적 유사성 포착
- VLM 미세 조정을 통해 인간의 시각적 판단과 높은 일치도 달성
- 텍스트 가이드 검색 및 생성 모델 평가에서의 활용 가능성 확인
인간의 시각적 유사성 판단은 문맥에 따라 달라집니다. 예를 들어, 두 이미지는 형태는 유사하지만 색상은 다를 수 있습니다. 그러나 기존의 지각적 유사성 메트릭(perceptual similarity metrics)은 이러한 미묘한 차이를 단일 스칼라 값(scalar value)으로 축소하여, 특정 측면에 따라 조건을 부여할 수 있는 메커니즘을 제공하지 못합니다. 이러한 격차를 해소하기 위해, 우리는 이미지 트리플렛(triplets)에 대한 인간의 유사성 판단을 담은 대규모 데이터셋을 도입합니다. 각 트리플렛은 유사성의 여러 자유 형식(free-form) 의미론적 측면에 걸쳐 주석이 달여 있습니다. 광범위한 최첨단 시각-언어 모델(VLMs)을 벤치마킹한 결과, 인간 주석가들의 합의와 비교했을 때 상당한 성능 격차가 있음이 드러났습니다. 우리의 데이터를 활용하여, 우리는 지정된 텍스트 프롬프트에 따라 시각적 유사성의 다양한 의미를 포착하는 Text-Prompted Image Perceptual Similarity (TPIPS) 메트릭을 생성하도록 VLM을 미세 조정(fine-tune)합니다. 우리는 TPIPS가 인간의 지각과 더 밀접하게 일치하며, 훈련 분포를 넘어 안정적으로 일반화됨을 입증합니다. 마지막으로, TPIPS가 텍스트 가이드 검색(text-guided retrieval), 구성적 검색(compositional search), 그리고 생성 모델(generative models)의 세밀한 평가에서 새로운 능력을 실현함을 보여줍니다. 우리의 코드, 데이터 및 학습된 모델은 https://peterwang512.github.io/TPIPS 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기