물리학, 천체물리학 및 우주론 분야의 과학 연구 지원을 위한 AI의 역량 II: 프로젝트 계획 및 제안서 평가
요약
물리학, 천체물리학 분야의 연구 제안서 작성 및 평가에서 LLM의 역량을 조사한 연구입니다. LLM은 인간과 대등한 수준의 계획서를 생성할 수 있으나, AI 검토자는 AI가 작성한 제안서에 편향된 높은 점수를 주는 경향이 확인되었습니다.
핵심 포인트
- LLM은 전문적인 과학 연구 프로젝트 계획서 생성 가능
- AI 검토자는 AI 작성 제안서에 대해 체계적 선호도(편향)를 보임
- 인간 검토자는 AI 작성 제안서를 약 79% 확률로 식별 가능
- 연구 제안서 평가 과정에 LLM 도입 시 주의 필요
우리는 대규모 언어 모델 (LLMs)이 과학적 프로젝트 계획 및 제안서 평가를 얼마나 잘 지원할 수 있는지 조사합니다. 물리학, 천체물리학 및 우주론 분야에서 전문가가 구상한 8개의 연구 프로젝트에 대해 인간 연구자와 세 가지 최신 LLMs (ChatGPT, Claude, DeepSeek; 2025년 중반 모델, 기본 도구 액세스 사용)가 독립적으로 한 페이지 분량의 프로젝트 계획서를 생성했습니다. 결과적으로 도출된 32개의 제안서는 4명의 인간 검토자와 2개의 최신 프런티어 LLMs (Claude Opus 4.8 및 ChatGPT Pro 5.5)에 의해 4가지 측면의 평가 루브릭을 사용하여 블라인드 테스트 방식으로 평가되었습니다. 검토자들은 또한 각 제안서가 인간에 의해 작성되었는지 또는 AI에 의해 작성되었는지를 식별하도록 요청받았습니다. 인간 검토자들은 전반적으로 인간이 작성한 제안서와 AI가 작성한 제안서를 비슷하게 평가한 반면, 두 AI 검토자 모두 AI가 작성한 제안서에 인간이 작성한 제안서보다 약 1점(5점 척도 기준) 더 높은 점수를 부여했습니다. 인간 검토자들은 인간이 작성한 제안서와 AI가 작성한 제안서를 각각 72%와 79%의 확률로 정확하게 식별한 반면, 두 AI 검토자는 32개의 제안서 모두를 정확하게 분류(100%)했습니다. 이러한 결과는 현재의 LLMs가 인간 검토자의 관점에서 인간이 작성한 것과 대등한 프로젝트 계획을 생성할 수 있음을 시사하지만, AI 검토자는 AI가 생성한 제안서에 대해 체계적인 선호도를 보인다는 것을 나타냅니다. 우리의 연구 결과는 제안서 작성 및 평가 과정에서 LLMs를 광범위하게 도입할 때 주의가 필요함을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기