언어가 다국어 LLM의 지시 계층 구조 준수(Instruction Hierarchy Compliance)에 미치는 영향
요약
다국어 환경에서 LLM의 지시 계층 구조(Instruction Hierarchy) 준수 능력을 평가하는 새로운 벤치마크인 XIH-Bench를 소개합니다. 연구 결과, 언어에 따른 준수 능력의 비대칭성과 언어 경계 효과가 존재함을 발견했습니다.
핵심 포인트
- 다국어 IH 평가를 위한 XIH-Bench 벤치마크 제안
- 언어에 따라 지시 준수 능력이 달라지는 비대칭성 확인
- 교차 언어 충돌이 동일 언어 충돌보다 준수율이 높은 현상 발견
- 언어 특화로 인한 낮은 우선순위 지시 무시 어려움 및 보안 리스크 지적
지시 계층 구조 (Instruction hierarchy, IH)는 모델이 출처에 따라 지시 사항의 우선순위를 정하여, 높은 우선순위의 지시가 낮은 우선순위의 지시를 무시하도록 요구합니다. 안전하고 제어 가능한 배포를 위해 매우 중요함에도 불구하고, 기존의 평가들은 거의 전적으로 영어에만 집중되어 있어 다국어 환경에서도 IH 준수 여부가 안정적으로 유지되는지는 불분명합니다. 우리는 6개 언어, 4개 도메인, 3개 IH 설정에 걸쳐 동일 언어 및 교차 언어 충돌을 모두 포함하는 다국어 IH 평가를 위한 벤치마크인 XIH-Bench를 소개합니다. 모델 전반에 걸쳐 우리는 두 가지 일관된 패턴을 발견했습니다. 첫째, IH 준수는 명확한 언어 의존적 비대칭성을 보입니다. 즉, 높은 우선순위 위치에서 준수 능력을 강화하는 언어가 낮은 우선순위 위치에서는 방해가 될 수 있습니다. 둘째, 교차 언어 충돌은 동일 언어 충돌보다 더 높은 준수율을 보이는데, 우리는 이 현상을 언어 경계 효과 (Language Boundary Effect)라고 명명합니다. 나아가 우리는 언어 특화 (language specialization)로 인해 모델이 선호하는 언어의 낮은 우선순위 지시를 무시하기가 더 어려워질 수 있으며, 이는 다국어 신뢰성 및 보안 리스크를 초래할 수 있음을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기