조건문에서의 전제와 추론: 인간과 LLM에 대한 이론 기반 연구
요약
본 연구는 조건문에서의 전제 투영(Presupposition projection) 능력을 바탕으로 인간과 LLM의 추론 방식을 비교 분석합니다. 실험 결과, 인간은 확률적 및 화용적 단서를 통합하여 판단하는 반면, LLM은 화용적 역량보다는 표면적인 패턴 매칭에 의존하는 경향을 보였습니다.
핵심 포인트
- 조건문 내 전제 투영에 대한 인간과 LLM의 판단 차이 규명
- LLM은 강력한 추론 능력을 가질수록 오히려 인간의 화용적 판단 패턴과 멀어지는 경향이 있음
- LLM의 성능이 실제 화용적 역량이 아닌 표면적 패턴 매칭에 의한 것일 가능성 제시
- 언어 이론에 기반한 정교한 벤치마크 구축의 필요성 강조
조건문에서의 전제 투영 (Presupposition projection)은 의미론 (Semantics) 및 화용론 (Pragmatics) 이론의 핵심이지만, 대규모 언어 모델 (LLM)에서는 여전히 거의 평가되지 않은 상태로 남아 있습니다. 우리는 전건 (Antecedent)과 투영된 전제 (Projected presupposition) 사이의 관계를 통제하는 조건문 규준 데이터셋을 사용하여, 인간의 판단과 LLM의 예측을 비교하는 병렬적 행동 연구를 통해 이 간극을 다룹니다. 우리는 일치된 맥락 조건 하에서 120명의 참가자와 4개의 LLM으로부터 가능성 점수 (Likelihood ratings)를 수집했습니다. 결과에 따르면, 인간은 판단 과정에서 확률적 및 화용적 단서 (Probabilistic and pragmatic cues)를 통합하는 반면, LLM은 인간의 패턴과 가변적인 일치성을 보입니다. 우리는 LLM-as-a-Judge 프레임워크 내에서 언어학적 동기에 기반한 체크리스트를 사용하여 모델의 추론을 추가로 평가했습니다. 우리는 인간의 점수와 가장 잘 일치하는 모델들이 종종 일관된 화용적 추론 (Pragmatic reasoning)이 부족한 반면, 더 강력한 추론 능력을 가진 모델들은 덜 인간과 유사한 판단을 내린다는 것을 관찰했습니다. 이러한 발견은 이러한 작업에 대한 LLM의 성능이 화용적 역량 (Pragmatic competence)보다는 표면적인 패턴 매칭 (Surface pattern matching)의 결과일 수 있음을 시사합니다. 우리의 연구 결과는 인간과 모델을 비교하기 위해 언어 이론에 근거한 벤치마크 (Benchmarks)의 중요성을 강조합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기