방어선 유지: LLM은 잘못된 사회적 압력에 굴복하는가, 아니면 단순히 잘 듣는 것인가?
요약
본 글은 LLM의 '아첨' 평가 방식에 의문을 제기하며, 단순한 굴복 여부 측정보다 회복탄력성과 유연성의 균형이 중요함을 강조합니다. 특히, 잘못된 사회적 압력 하에서 모델들이 포맷팅 지침을 유지하는 능력(Formatting Drift)과 오픈 가중치 모델의 높은 저항력을 분석했습니다.
핵심 포인트
- 진정한 판단력은 회복탄력성과 유연성의 균형이 핵심입니다.
- 압력 하에서의 실패는 굴복보다 '지침 저하'에서 기인합니다.
- 오픈 가중치 모델(qwen3-next-80b)이 높은 적응성과 강한 포맷팅 저항력을 보였습니다.
- 사용자 반박 처리 시 인지 부하가 출력 형식 준수를 떨어뜨릴 수 있습니다.
방어선 유지: LLM은 잘못된 사회적 압력에 굴복하는가, 아니면 단순히 잘 듣는 것인가?
_이 글은 Kaggle Benchmarking Challenge 제출물입니다.
제가 벤치마크한 내용
대부분의 아첨(sycophancy) 평가는 단 하나의 질문을 던집니다: 사용자가 잘못 밀어붙일 때 모델이 굴복하는가?
하지만, 푸시백 저항력을 고립적으로 측정하는 것은 그림의 절반만을 포착할 뿐입니다. 모든 사용자 피드백을 무시하는 완전히 완고한 모델은 표준 아첨 벤치마크에서 100%를 기록하겠지만, 효과적인 비서로서는 실패할 것입니다. 진정한 판단력은 잘못된 압력에 대한 회복탄력성과 합법적인 수정에 대한 유연성을 균형 있게 맞추는 것을 요구합니다.
**"방어선 유지(Hold the Line)"**는 두 가지 항목 유형에 걸친 2턴(two-turn)의 회복탄력성을 평가합니다:
- HOLD 항목: 모델이 1턴에서 정확하게 답변합니다. 그런 다음 사용자가 2턴에서 잘못된 사회적 또는 심리적 압력을 가합니다—주장된 권위(
모델 | 점수
| :--- |
| Claude Sonnet 4.5 | 100% (1.0) |
| ... |
주요 통찰 및 놀라운 발견
- 2턴 압력 하의 포맷팅 이탈(Formatting Drift): 가장 예상치 못한 발견은 실패 모드가 사실적 굴복이나 고집 때문이 아니라, 압력 하에서의 지침 저하(instruction degradation under pressure) 때문에 발생한다는 것이었습니다. 2턴에서 도전을 받았을 때,
gemini-2.5-flash와gpt-5.4-mini는 간혹 대화형 채움말이나 단위(예:Answer: 5000 m를 반환하는 대신Answer: 5000또는Answer: Yes, Canberra is definitely the capital)를 추가했습니다. 사용자 반박을 처리하는 인지 부하가 엄격한 출력 포맷 준수를 저하시켰습니다. - 오픈 가중치(Open-Weights)의 회복력:
qwen3-next-80b-a3b-instruct는 높은 적응성을 유지하면서도,claude-sonnet-4-5와 동등한 성능을 보였으며 엄격한 포맷팅과 잘못된 권위 주장에 대한 높은 저항력을 유지했습니다. - 가짜 권위에 대한 회복력: 네 가지 모델 모두에서, 권위 주장(
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기