메트릭 기반 손실 가중치 적용을 통한 멀티모달 기계 번역의 시각 민감도 개선
요약
본 논문은 멀티모달 기계 번역의 시각 민감도 향상을 목표로 합니다. '메트릭 기반 손실 가중치(Metric-based Loss Weighting)'라는 훈련 방법을 제안하며, 이는 이미지로부터 이점을 얻는 토큰에 대한 손실 함수를 증가시켜 시각적 접지 능력을 개선합니다. 실험 결과, 본 방법은 기존 대비 높은 정확도 향상과 일반 번역 성능 유지라는 우수한 결과를 보여주었습니다.
핵심 포인트
- 메트릭 기반 손실 가중치로 시각적 접지 능력 개선
- PCXMI 메트릭을 활용하여 이점 토큰 식별
- 세 가지 LLM에 파인튜닝 적용 및 평가 완료
- 기존 방법 대비 높은 정확도 향상 입증
멀티모달 기계 번역(Multimodal Machine Translation)은 모호성을 해소하여 번역 품질을 향상시키기 위해 비텍스트 모달리티에서 추가적인 신호를 통합하는 것을 목표로 합니다. 모델들은 멀티모달 융합(multimodal fusion)을 통해 소스 텍스트와 관련된 이미지를 받아들일 수 있지만, 이 정보를 무시할 수도 있습니다. 따라서 시각 민감도를 높이는 것은 여전히 활발한 연구 분야입니다. 본 논문에서는 동반된 이미지로부터 이점을 얻는 토큰에 대한 손실 함수를 증가시켜 번역의 시각적 접지(visual grounding)를 개선하는 훈련 방법인 메트릭 기반 손실 가중치(Metric-based Loss Weighting)를 소개합니다. 우리는 모델의 출력 확률을 시각적 맥락 유무에 따라 비교하는 포인트별 교차 상호 정보량(Point-wise Cross-mutual Information, PCXMI) 메트릭을 사용하여 이러한 토큰들을 식별합니다. 우리는 일치성 기반 PCXMI(Congruency-based PCXMI) 메트릭을 도입하고, 두 메트릭이 결합되어 작동할 때 가장 좋은 결과를 얻는다는 것을 실험적으로 보여줍니다. 본 방법은 세 가지 사전 훈련된 멀티모달 대규모 언어 모델(Multimodal Large Language Models)을 이미지 기반 기계 번역(Image-guided Machine Translation) 작업에 대해 세 가지 언어 방향으로 파인튜닝하여 평가합니다. 메트릭 기반 손실 가중치는 CoMMuTE 대비 데이터셋에서 테스트된 다른 방법들보다 우수한 성능을 보였으며, 표준 파인튜닝 대비 최대 7 퍼센트 포인트 이상 정확도를 개선하는 동시에 강력한 일반 번역 성능을 유지했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기