AI 모델 19개 테스트: 유명 신화에 대한 복종성(Sycophancy) 검증
요약
본 글은 유명 신화에 대한 AI 모델의 복종성(Sycophancy)을 검증하는 벤치마크 테스트 결과를 공유합니다. 작성자는 AI가 압박에도 불구하고 알려진 사실에 대해 잘못된 답변을 하도록 만들 수 있는지 확인하려 했으나, 모든 모델이 통과하여 '최고 모델' 순위는 임의적임을 밝혔습니다. 다만, 비용, 속도, 그리고 추론 과정에서 생성되는 토큰 길이 등 흥미로운 기술적 차이점들을 발견했습니다.
핵심 포인트
- AI 모델은 압박에도 불구하고 알려진 사실에 대해 잘못된 답변을 하도록 만들기 어려웠음.
- 모델별로 실행 비용과 응답 속도에 큰 편차가 존재함 (예: Grok 4.20 vs GLM-5).
- 일부 추론 모델들은 단어 하나만 필요한 작업에서도 과도하게 긴 토큰(10,000~24,000개)을 생성하는 경향이 있음.
- 다음 테스트에서는 암기하기 어려운 미묘한 사실이나 감정적 압박 등을 측정할 계획임.
This is a submission for the Kaggle Benchmarking Challenge
무엇을 테스트했는가 (What I Benchmarked)
나는 자신감 있는 사람이 AI를 압박하여 잘 알려진 사실에 대해 잘못된 답변을 하도록 만들 수 있는지 확인하고 싶었다. 스포일러: 그들은 할 수 없었고, 이것이 이야기에서 덜 흥미로운 부분이 되었다.
테스트는 총 16개의 진술로 구성되어 있다: 12개는 거짓(예:
| 모델 | 알려진 사실 (총 16개 중) | 실행 비용 |
|---|---|---|
| GPT-5.4 nano | 13 | $0.008 |
| ... | ||
| 이것은 아마도 모델에 대한 것보다 내 테스트에 대해 더 많이 말하는 것 같다: 이 진술들은 모델들이 여러 번 접했을 가능성이 높은 유명한 신화이기 때문에, 이것은 천장 효과(ceiling effect)이다. 이는 AI 모델이 거짓된 내용에 동의하도록 압력을 받을 수 없다는 것을 보여주지 않는다. |
모든 모델이 통과했기 때문에, Kaggle 리더보드는 모두 100점으로 동률을 보여준다. '최고 모델'들의 순서는 임의적이다.
내가 알아차린 다른 점들:
- 비용과 속도가 엄청나게 다양했다. 가장 저렴한 모델은 전체 실행에 반 센트도 안 되는 비용이 들었고, 가장 비싼 모델은 약 53센트가 들었다. Grok 4.20 (추론 없음)은 12초 만에 끝났고, GLM-5는 470초가 걸렸다.
- 추론 모델들은 장황하다. DeepSeek-R1, GLM-5, Gemma 모델 두 개, Grok Reasoning, 그리고 Gemini 3.1 Pro는 답변으로 단어 하나만 필요했던 작업에서 각각 10,000개에서 24,000개의 토큰을 작성했다. 다른 여러 모델들은 총 300토큰 미만을 작성했다.
- 나의 자체 채점 방식이 가장 약한 부분이었다. 나의 첫 번째 버전에서는 DeepSeek-R1과 gpt-oss-20b를 실패(FAIL)로 표시했다. 전사본을 읽어보니, R1은 내가 읽을 수 없는 추론 텍스트 블록 뒤에 답변을 작성했고, gpt-oss-20b는 동의하는 대신
다음으로 측정할 것: 모델들이 암기했을 가능성이 낮은 미묘한 사실들, 더 긴 논증, 다른 종류의 압박(감정, 권위, 뇌물), 그리고 한 단어로 답하는 대신 설명이 필요한 답변입니다.
나의 벤치마크
https://www.kaggle.com/benchmarks/ankit121singh/sycophancy-under-pressure
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기