논문이 이제 인간이 아닌 기계를 위해 쓰이고 있다
요약
최근 논문들이 독자를 위해 쓰이기보다 AI를 위한 맥락으로 구성되는 경향이 나타나고 있습니다. 저자들이 정의되지 않은 전문 용어를 남발하며, 전체 문맥을 가진 AI는 이를 쉽게 이해하지만 인간은 순차적 읽기 방식 때문에 어려움을 겪습니다.
핵심 포인트
- AI가 논문 독해의 주체가 되면서 글쓰기 스타일이 변화하고 있다.
- 인간은 선형적인(순차적) 방식으로, AI는 전체 맥락을 활용하여 이해한다.
- 좋은 논문은 쉬운 언어와 간단한 개념으로 시작해야 한다.
- AI 의존도가 높아지며 전문 용어 남용의 악순환이 발생하고 있다.
요약하자면: 제가 검토하는 논문들이 정의되지 않은, 해당 논문에만 특화된 용어로 시작하는 경우가 점점 많습니다. 이 용어들은 논문 전체를 다 읽어야만 의미가 파악됩니다. 첫 페이지부터 읽는 인간은 이를 따라갈 수 없지만, 전체 논문을 맥락으로 가진 AI는 즉시 설명해 줍니다. 저는 하나의 순환 고리가 있다고 의심합니다: AI의 도움을 받는 검토 과정이 이러한 스타일을 보상하고, 승인된 논문으로 학습한 모델들이 같은 방식으로 쓰도록 배우고 있다는 것입니다. 지난주에 제가 한 논문을 검토하다가 첫 단락에서 막혔습니다. 서론에는 추가적인 맥락 없이 저자들이 '궤적 매개변수화(trajectory parameterization)'를 수행한다고 나와 있었습니다. 저는 그것을 세 번이나 읽었습니다. 무엇의 궤적인가? 어떻게 매개변수화했는가? 다음 문장들이 설명해 주기를 바라며 계속 읽었지만, 그렇지 않았습니다. 이해할 수 없는 두 가지 용어가 더 추가되었습니다. 좌절감에 PDF를 AI에게 주고 논문을 설명해 달라고 요청했습니다. 그러자 순식간에 명확하고 깔끔한 요약이 나왔습니다. '궤적(trajectory)'은 컴퓨터 사용 에이전트가 생성하는 클릭 및 키 입력의 시퀀스였습니다. '매개변수화(parameterization)'는 각 클릭 이벤트를 정규화된, 스크립트 같은 형식으로 다시 작성한다는 의미였습니다. 누군가 설명해 주면 충분히 간단한 것이었습니다. 그 순간 무언가가 이해되었습니다. 이 논문이 독자에게 나쁘게 쓰인 것은 아니었습니다. 단지 그 독자가 제가 아니었을 뿐입니다. 인간은 순서대로 읽습니다. AI는 그렇지 않아도 됩니다. 사람이 논문을 읽을 때는 순차적으로 읽습니다. 각 문장은 오직 앞선 내용만을 사용하여 의미를 가져야 합니다. 첫 페이지에 있을 때 여섯 페이지의 이해를 빌려올 수 없습니다. 좋은 논문은 이를 존중합니다. 평이한 언어와 간단한 개념으로 시작합니다. 그 후에 비로소 정확한 용어를 사용할 자격을 얻습니다. 방법론(Methods) 섹션에 도달했을 때는 이미 저자들이 무엇을 하려고 하고 왜 하는지 알고 있습니다. LLM은 이러한 한계에 직면하지 않습니다. 논문을 설명할 때, 모든 토큰이 이미 컨텍스트 안에 있기 때문입니다. 첫 페이지에서 정의되지 않은 용어가 나타나도, 여섯 페이지를 참조할 수 있습니다. 결론부터 먼저 주어도 아무 문제 없이 역추적하여 이해합니다. 저는 이제 AI를 위해 쓰인 논문에서 이 패턴을 끊임없이 발견합니다.
서론은 종종 논문 특유의 용어들로 가득 차 있으며, 이 용어들이 설명 없이 한데 쌓여 있습니다. 저자들에게는 그 작업을 속속들이 알고 있는 사람들이기에 각 용어가 복잡한 아이디어를 정확하고 효율적으로 요약하는 역할을 합니다. 전체 논문을 볼 수 있는 모델에게도 마찬가지입니다. 하지만 논문을 처음 읽는 사람에게는 이러한 용어들이 모호하며 여러 해석의 여지를 남깁니다. 서론, 그리고 종종 나머지 본문까지 따라가기가 지치거나 단순히 이해하기 어려워집니다. 그런데 어떤 AI든 몇 초 만에 이 논문들을 설명해낼 수 있다는 사실은, 제가 Methods와 Introduction 사이를 오가며 보낸 시간이 조금 우스꽝하게 느껴지게 만듭니다. 왜 이런 일이 벌어지고 있을까요? 저의 가설은 명확하지 않습니다. 글쓰기 문제는 새로운 것이 아닙니다. 연구자들은 항상 자신의 작업에 대해 모르는 상태가 어떤 것인지 기억하는 데 어려움을 겪어왔습니다. 하지만 저는 지난 몇 달 동안 이 패턴이 급격히 악화되는 것을 목격했으며, 하나의 순환 고리를 의심합니다: - 리뷰어들이 제출된 논문을 읽고 평가하기 위해 AI에 점점 더 의존하고 있습니다. - 밀도 높은 전문 용어로 가득 차 있고 세련되게 꾸며진 논문일수록, 인간이 읽기 어렵게 만들더라도 더 높은 점수를 받습니다. - 이러한 논문들이 높은 비율로 채택되고, 채택된 논문들은 좋은 글쓰기로 간주됩니다. - 새로운 모델들은 그 풀(pool)로부터 학습하여 기본적으로 같은 방식으로 글을 쓰게 됩니다. - 저자들은 그러한 모델들을 사용하여 초안을 작성하고, 이 순환 고리가 계속됩니다. 저는 이것을 증명할 수는 없습니다. 하지만 이것이 왜 문제가 가속화되는지 설명해 줄 것입니다. 과거의 실패, 즉 저자들이 독자가 무엇을 모르는지 잊어버리는 문제는 예전에는 첫 페이지부터 읽는 인간 리뷰어에게 걸렸습니다. 이제 아무도 처음부터 읽지 않는다면, 아무것도 그것을 잡아내지 못합니다. 왜 이것이 중요한가 논문은 다른 사람들이 이해하고 그 위에 구축할 수 있도록 존재합니다. 만약 독자들이 모든 논문을 번역하기 위해 AI를 필요로 한다면, 우리는 이해 자체를 아웃소싱하게 되는 것입니다. 또한 우리는 작업을 판단하는 능력도 잃게 됩니다. 오직 AI 요약본만 읽는 리뷰어는 논문 자체가 아니라 그 요약본을 평가하고 있는 것입니다. 간극(Gaps), 과장된 주장(overclaims), 그리고 약한 추론은 유창한 요약본에서 쉽게 매끄럽게 처리될 수 있습니다.
기계 독자를 위해 최적화되고 인간에게는 적대적인 연구 문헌은 내가 원하는 미래가 아닙니다. 제가 요청하고 싶은 것은 다음과 같습니다. 만약 글을 쓰고 있다면: 마치 낯선 사람이 읽는 것처럼 자신의 논문을 읽어보세요. 각 용어에 대해 독자에게 그 의미를 이미 전달했는지 물어보세요. 간단한 테스트 방법입니다: AI에게 첫 페이지만 주고 이 논문이 무엇을 하는지 물어보세요. 만약 추측해야 한다면, 인간도 할 수 없습니다. 만약 리뷰를 하고 있다면: 어떤 도구를 찾기 전에 서론을 직접 읽으세요. 서론이 정의되지 않은, 논문 특정 용어에 의존한다면, 리뷰에서 그렇게 언급하세요. 그것은 스타일적인 사소한 지적이 아닙니다. 소통의 실패입니다. 제출자 /u/Foreign_Tonight_7584 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/MachineLearning (hot)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기