LLM은 과학적 의사소통에 어떤 영향을 미치고 있는가? 글쓰기 관행과 독서 경험의 변화 측정
요약
본 연구는 LLM의 사용 증가가 과학적 의사소통 스타일, 즉 글쓰기 관행과 독서 경험에 미치는 영향을 분석합니다. ACL Anthology 논문 데이터와 합성 데이터셋을 통해 분석한 결과, LLM은 특정 통사 구조를 빈번하게 사용하고 어휘 다양성은 낮추는 경향이 있으며, 전문가들은 LLM이 개선한 텍스트를 더 이해하기 쉽다고 느끼면서도 동시에 부정적인 태도를 보이는 등 주관적인 반응을 나타냈습니다.
핵심 포인트
- LLM 사용으로 인해 과학 논문의 어휘 빈도와 사용 맥락에서 통시적 변화가 관찰됨
- LLM이 수정한 텍스트는 특정 통사 구조를 더 많이 사용하며, 더 복잡하고 긴 단어를 사용하지만 어휘 다양성은 낮아지는 경향이 있음
- 도메인 전문가들은 LLM 기반 텍스트가 이해하기 쉽고 흥미롭다고 평가함
- AI 지원 글쓰기에 대한 독서 경험은 전문가마다 주관적이고 상충되는 태도를 보임
작성 과정에서 거대 언어 모델 (Large Language Models, LLMs)의 사용이 증가함에 따라 과학적 의사소통 (Scientific Communication)의 스타일이 변화했을까요? 우리는 직접 구축한 두 가지 데이터 리소스를 활용하여 자연어 처리 (Natural Language Processing, NLP) 분야에서 이 질문을 다룹니다. 이 리소스는 ACL Anthology (2020-2024)에서 추출한 37,000편 이상의 논문으로 구성된 자연주의적 코퍼스 (Naturalistic Corpus)와, 인간이 작성한 3,000개의 구절 및 이에 대해 LLM이 생성한 개선안으로 구성된 합성 데이터셋 (Synthetic Dataset)입니다. 먼저 우리는 일련의 통시적 어휘 분석 (Diachronic Lexical Analyses)을 실시하였으며, 단어 빈도와 사용 맥락 모두 시간이 지남에 따라 크게 변화했음을 보여줍니다. 이는 어떤 경우에는 의미론적 전문화 (Semantic Specialization)를, 다른 경우에는 일반화 (Generalization)를 나타냅니다. 관점을 넓혀, 우리는 더 복잡한 다양한 문체적 특징 (Stylistic Features)들을 모델링하였고, LLM이 수정한 텍스트가 특정 통사적 구조 (Syntactic Constructions)를 더 빈번하게 포함하며, 더 복잡하고 긴 단어들을 사용하고, 어휘 다양성 (Lexical Diversity)은 더 낮다는 것을 발견했습니다. 마지막으로, 우리는 20명의 도메인 전문가 (Domain Experts)를 대상으로 한 예비 주석 연구 (Pilot Annotation Study)를 통해 이러한 글쓰기 관행의 변화를 주관적인 독서 경험과 연결합니다. 전문가들은 전반적으로 LLM이 개선한 텍스트를 더 이해하기 쉽고 흥미롭다고 평가했지만, 동시에 LLM에 대해 부정적인 질적 태도를 보이기도 했습니다. 이는 AI 지원 글쓰기 (AI-assisted Writing)가 독서 경험에 미치는 영향이 매우 주관적임을 강조합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기