LLM 리뷰는 인간의 동료 검토(Peer Review)와 얼마나 일치하는가?
요약
LLM이 생성한 과학적 리뷰가 인간의 동료 검토(Peer Review) 및 컨퍼런스 결정과 얼마나 일치하는지 분석한 연구입니다. OpenAI, Google, Anthropic의 모델을 ICLR 2026 제출 논문에 적용하여 비교했습니다.
핵심 포인트
- LLM은 논문 수락/거절 구분은 가능하나, Oral/Poster의 세밀한 구분은 재현하지 못함
- Gemini는 높은 등급을 부여하는 경향이 있고, OpenAI와 Claude는 Oral 논문에 더 비판적임
- LLM은 베이스라인 비교 누락을, 인간은 계산 효율성 문제를 더 자주 지적함
- 광범위한 결정 일치성이 인간의 세밀한 판단과 반드시 일치하는 것은 아님
대규모 언어 모델(LLMs)이 과학적 리뷰를 생성하는 데 점점 더 많이 사용되고 있지만, 기존의 평가 방식은 동일한 통제된 환경 내에서 서로 다른 제공업체들이 컨퍼런스 결정 및 인간의 리뷰 우선순위와 모두 일치하는지를 거의 조사하지 않습니다. 우리는 OpenAI GPT-5.4, Google Gemini 3.1 Pro Preview, Anthropic Claude Opus 4.6의 리뷰를 300개의 주제가 일치하는 ICLR 2026 제출 논문(oral, poster, rejected 논문으로 균등하게 배분됨)에 대한 인간의 리뷰 및 최종 결정과 비교합니다. 각 모델은 결정 정보가 제거된 후 동일한 지침과 평가 척도를 사용하여 모든 논문을 검토했습니다. 우리의 연구는 세 가지 상호 보완적인 차원에 대한 교차 제공업체 분석을 제공합니다: 광범위하고 세밀한 결정 범주와의 일치성, 권장 규모(recommendation-scale) 사용의 차이, 그리고 식별된 약점에서의 주제적 일치성입니다. 세 LLM 모두 수락된 논문과 거절된 논문을 구분했지만, 인간의 평가에 존재하는 oral 대 poster의 구분은 재현하지 못했습니다. 점수 패턴은 제공업체별로 달랐습니다: Gemini는 체계적으로 더 높은 등급을 부여한 반면, OpenAI와 Claude는 거절된 논문과 poster 논문에 대해서는 인간과 더 유사했으나 oral 논문에 대해서는 더 비판적이었습니다. 인간과 LLM의 리뷰는 강조점에서도 차이를 보였는데, LLM은 누락된 베이스라인 비교(baseline comparisons)를 더 빈번하게 식별한 반면, 인간은 계산 효율성(computational-efficiency) 문제를 더 자주 제기했습니다. 이러한 결과는 광범위한 결정 일치성이 인간의 더 세밀한 판단이나 리뷰 우선순위와의 일치를 의미하지는 않는다는 것을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기