압박 속에서의 논리적 판단: 학습된 소프트 접두사(Soft Prefixes)를 통한 삼단논법 안정성 진단
요약
소프트 접두사(Soft Prefixes)를 활용하여 LLM의 삼단논법 추론 안정성을 진단한 연구입니다. Qwen 및 Gemma 모델을 대상으로 실험한 결과, 특정 연속 벡터가 모델의 논리적 판단을 의도적으로 오답으로 유도하며, 이는 논리적 연산보다는 광범위한 답변 선호도 편향에 기인함을 밝혀냈습니다.
핵심 포인트
- 소프트 접두사를 통해 모델의 논리적 안정성 한계 규명
- Qwen 및 Gemma 모델에서 높은 정답 반전율 확인
- 소프트 접두사의 효과는 논리 연산보다 답변 선호도 편향에 가까움
- 모델별로 논리적 안정성과 편향의 형태가 상이함
올바른 논리적 판단이 학습된 문맥(context)에 어떻게 반응하는지 테스트하기 위해, 모델을 고정시킨 상태에서 정확하게 라벨링된 삼단논법 추론 벤치마크에 소프트 접두사(soft prefix)를 앞에 붙였습니다. 소프트 접두사는 불투명한 연속 벡터(continuous vectors)이므로, 우리는 논리적 형태와 인터페이스의 통제된 변화에 따라 유도되는 동작을 통해 이를 특성화합니다. 어떤 접두사가 성공하는지, 그리고 그 효과가 어떻게 일반화되는지를 연구함으로써, 학습된 문맥적 압박(contextual pressure)이 어떻게 올바른 판단을 뒤엎고 모델의 논리적 안정성의 한계를 드러내는지 규명합니다. Qwen3.6-35B-A3B MoE, Qwen3-8B, 그리고 Gemma 4 31B에 걸쳐, 학습된 접두사는 많은 정답을 오답으로 유도하며, 보지 못한 형태와 인터페이스 변화에서도 효과적으로 유지됩니다. Qwen3.6 MoE 및 Gemma를 대상으로 한 반복 테스트에서, 이들은 16개의 모델-방향-분할(model--direction--split) 비교 전반에서 쌍을 이룬 무작위 대조군(random controls)보다 37~99%포인트 더 높은 성능을 보였습니다. Qwen3.6 MoE의 반전율(flip rates)은 문구 및 프롬프트 변경에도 불구하고 72%에서 90% 사이를 유지한 반면, Gemma의 타당성 접두사(validity prefixes)는 일치하는 무작위 접두사의 1% 미만과 비교하여 54%에서 56%의 반전율을 유지했습니다. 진단 테스트 결과, 지배적인 효과는 고정된 기호 강제(fixed-symbol forcing)나 작업 간에 안정적으로 전이되는 논리 연산이라기보다, 하나의 답변 의미에 대한 광범위한 선호도라는 것을 보여줍니다. 이러한 편향(bias)의 형태는 모델마다 다릅니다. 두 Qwen 모델 모두에서 단순 점수 모델(score models)은 어떤 판단이 뒤집힐지는 자주 예측하지만, 그 마진(margin)이 얼마나 이동할지는 예측하지 못하는 반면, Gemma의 전반적인 반응은 동일한 모델들에 의해 더 밀접하게 근사됩니다. 이러한 결과는 성공적인 소프트 접두사의 지배적인 행동 효과가 광범위한 답변 선호도임을 보여주는 동시에, 나머지 반응은 논리적 안정성에 있어 상당한 모델별 차이가 있음을 드러냅니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기