시각-언어 모델(Vision-Language Models)의 양식 순서 일관성을 위한 테스트 시간 훈련 (Test-Time Training)
요약
시각-언어 모델(VLM)이 이미지와 질문의 제시 순서에 따라 성능 차이를 보이는 '양식 순서 실패' 문제를 분석하고, 이를 해결하기 위한 테스트 시간 훈련(TTT) 방법을 제안합니다. 이 방법은 모델의 중간 레이어에서 발생하는 표현의 불일치를 복구하여 순서 간 성능 격차를 줄이고 전체적인 성능을 향상시킵니다.
핵심 포인트
- VLM은 이미지와 질문의 입력 순서에 따라 성능이 달라지는 민감성을 보임
- 테스트 시간 훈련(TTT)을 통해 양식 순서 간의 성능 격차를 실질적으로 완화
- 활성화 패칭을 통해 순서 실패가 네트워크 중간 영역의 표현 불일치임을 확인
- 단순한 테스트 시간 적응만으로 베이스라인 대비 성능 향상 가능
우리는 시각-언어 모델(Vision-Language Models)이 특정 의미론적으로 무관한 변화, 즉 이미지와 질문이 제시되는 순서에 민감하다는 것을 발견했습니다. 세 가지 모델과 세 가지 벤치마크 전반에 걸쳐, 이미지를 먼저 제시하는 프롬프팅(image first prompting)이 질문을 먼저 제시하는 프롬프팅(question-first prompting)보다 일관되게 우수한 성능을 보였으며, 이는 반복 가능한 양식 순서 실패(modality order failure)를 드러냅니다. 우리는 이 격차를 이용하여 순서 일관성을 갖춘 테스트 시간 훈련(test-time training) 방법을 설계합니다. 우리의 방법은 평가된 모든 설정에서 양식 순서 격차를 실질적으로 줄여줍니다. 놀랍게도, 이 방법은 베이스라인(baseline) 대비 더 강력한 이미지 우선 분기(image-first branch)에서도 일관된 개선을 이끌어내어, 두 순서 모두를 상호 일관성을 향해 부트스트래핑(bootstrapping)합니다. 활성화 패칭(Activation patching)을 통해 순서 실패가 프롬프트 순서에 따라 표현(representations)이 급격히 갈라지는 좁은 네트워크 중간 영역(mid-network region)에 국한됨을 확인했습니다. 우리는 테스트 시간 훈련 방법이 여러 레이어(layers)에 걸쳐 이러한 정렬 불량(misalignment)을 복구한다는 것을 발견했습니다. 종합적으로, 우리의 결과는 양식 순서 민감성을 VLM의 회로 수준(circuit-level) 실패로 식별하며, 단순하고 비대칭적인 테스트 시간 적응(test-time adaptation)이 이를 효과적으로 완화하고 베이스라인보다 성능을 향상시킬 수 있음을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기