불투명한 인식론적 매개: LLM 배포 설정이 유사 과학의 검증에 미치는 영향
요약
LLM의 배포 설정이 유사 과학 검증에 미치는 영향을 분석한 연구입니다. Grok, Claude, GPT, Gemini를 대상으로 테스트한 결과, 모델 자체의 속성보다 시스템 프롬프트, 안전 계층, 인터페이스 라우팅 등 배포 설정에 따라 결과가 극명하게 달라짐을 확인했습니다.
핵심 포인트
- LLM의 답변은 모델 성능보다 배포 설정(API vs 웹)에 더 큰 영향을 받음
- Grok의 경우 웹과 API 간의 출력값이 극단적으로 다르게 나타남
- 공개되지 않은 '침묵의 패치'가 모델의 검증 태도를 급격히 변화시킴
- LLM의 인식론적 입장은 안정적인 속성이 아닌 부수적 효과임
상업용 거대 언어 모델(Large Language Models, LLM)이 지식 참조 도구로 점점 더 많이 사용되고 있지만, 논쟁적인 과학적 주장들에 대한 이들의 입장은 안정적이지도 투명하지도 않습니다. 우리는 네 가지 주요 LLM 제품군(Claude, Grok, GPT, Gemini)이 Frank Salter의 생물사회학적 프레임워크(biosocial framework)에서 파생된 민족주의적 유사 과학을 어떻게 평가하는지, API와 웹 인터페이스를 모두 통해 네 번의 시점(2025년 10월2026년 2월)에 걸쳐 테스트했습니다. X(구 트위터)의 기본 사용자 경험을 구동하는 Grok의 Fast 버전은 다른 모든 모델(15-40점 기록)보다 25배 높은 70-75점의 신뢰도 점수를 일관되게 부여했습니다. 이러한 패턴은 기본적인 진화론적 합의와 라마르크주의(Lamarckian) 주장을 반박하는 대조군 프롬프트에서는 나타나지 않았으며, 해당 테스트에서는 모든 모델이 유사한 성능을 보였습니다. 세 가지 추가적인 발견이 나타났습니다: (1) 공개적인 문서화 없이 이루어진 침묵의 패치(silent patch)가 Grok의 동작을 혼란스러운 상태에서 안정적으로 높은 검증 상태로 하룻밤 사이에 변화시켰습니다; (2) 동일한 Grok 모델 식별자가 3개월 후 API(75점)와 웹(5.5점)을 통해 극단적으로 다른 출력을 생성했습니다; (3) 가장 방어 가능한 응답으로 관찰된 유사 과학적 주장에 대한 평가 거부는 두 모델 제품군에서 서로 다른 인터페이스를 통해 나타났으나(Claude Opus 4.1은 웹을 통해 단호하게, GPT-5.1 Chat은 API를 통해 간헐적으로), 각 모델의 후속 버전에서는 이러한 경향이 약화되었습니다. 이러한 결과는 상업용 LLM의 인식론적 입장(epistemic stance)이 모델의 안정적인 속성이 아니라, 시스템 프롬프트(system prompts), 안전 계층(safety layers), 인터페이스 라우팅(interface routing), 그리고 침묵의 업데이트(silent updates)와 같은 배포 설정(deployment configuration)에 따른 부수적 효과임을 나타냅니다. 이는 사용자 및 연구자 모두에게 여전히 불투명합니다. 우리는 이것이 새로운 형태의 인식론적 책임(epistemic accountability)을 요구하는 공공의 관심사라고 주장합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기