AI가 수학 연구 원고 722건을 공개한 사건과, 다음 날 발생한 계산 실수로 인한 3건의 철회
요약
OpenAI가 AI 모델을 활용해 722건의 수학 연구 원고를 대량으로 공개했으나, 다음 날 부호 오류로 인해 총 3건이 철회되는 사건이 발생했습니다. 이는 하나의 작은 실수가 연결된 여러 원고에 연쇄적인 영향을 미칠 수 있음을 보여줍니다.
핵심 포인트
- AI가 방대한 양의 수학 연구 원고를 생성할 수 있게 되었음.
- 하나의 오류가 연결된 다수의 결과물에 연쇄적 실패를 초래함.
- OpenAI는 'Lean' 같은 도구로 논리 구조 검증을 시도하고 있음.
- 완벽한 정확성을 보장하기 위해서는 인간 연구자의 검토가 필수적임.
AI는 인간에게 오랜 시간이 걸리는 수학 연구 원고를 대량으로 만들 수 있게 되었습니다. 하지만 그 내용을 확인하는 일은 누가 할까요? OpenAI가 한 번에 공개한 722건의 원고와, 다음 날 발생한 3건의 철회 사례는 AI 시대의 새로운 문제를 제기했습니다.
2026년 10월 6일, ChatGPT를 개발하는 OpenAI가 수학 연구 원고를 인터넷상에 한꺼번에 공개했습니다.
그 숫자는 722건. 만든 것은 인간 연구자가 아니라, 동사가 아직 일반 공개하지 않은 AI 모델이었습니다.
그런데 다음 날, 공개 건수는 719건으로 줄어들었습니다. 1건의 원고에서 플러스와 마이너스 처리를 잘못하는 '부호 오류(符号ミス)'가 발견되었기 때문입니다.
게다가 철회된 것은 그 1건만이 아니었습니다. 내용을 이용했던 다른 2건도 함께 성립할 수 없게 되어, 총 3건이 철회되었습니다.
한 곳의 실수로 왜 3건이나 무너졌나
예를 들어, 어떤 사람의 계산 결과를 토대로 다른 2명이 이어서 계산했다고 가정해 봅시다. 첫 번째 계산이 틀렸다면, 그 위에 쌓아 올린 두 사람의 답도 정확하지 않습니다.
이번에 일어난 것은 이에 가까운 상황입니다.
첫 원고에는 매우 고도의 도형을 다루는 수학 증명이 작성되어 있었습니다. 하지만 중간에 부호 오류가 있어 중요한 설명이 성립할 수 없게 되었습니다. 그리고 다른 2건도 그 설명을 전제로 하고 있었습니다.
이는 'AI가 세 번, 각각 실수한' 이야기가 아닙니다. 하나의 실수가 연결된 원고로 연쇄된 것입니다.
OpenAI는 같은 날, 나머지 14건도 수정했습니다. 증명의 부족을 보완했거나, 성립하는 데 필요한 조건을 자세히 다시 작성한 것 등이 포함됩니다. 게다가 13건에서는 수정본을 참조하도록 정보가 업데이트되었습니다.
722건 모두가 '세기적 대발견'은 아니다
'AI가 722개의 난제를 풀었다'고 받아들이는 것도 정확하지 않습니다.
공개된 원고에는 중심이 되는 결과뿐만 아니라, 그것을 지탱하는 설명, 거기서 도출되는 다른 결과, 같은 결론에 이르는 다른 증명 등도 포함되어 있습니다. OpenAI는 관련 원고를 372세트로 나누어 정리했습니다.
책에 비유하자면, 722권의 완전히 다른 책이라기보다는, 372개의 주제에 대해 본편, 별책, 보충 자료가 나열된 이미지와 가깝습니다.
OpenAI에 따르면, AI에게 약 4,000문제의 수학 문제를 주었습니다. 그중 공개할 가치가 있다고 판단한 결과를 원고로 정리했다고 합니다. 하나의 결과를 만드는 데 사용된 계산량은 평균적으로 ChatGPT Pro를 약 3시간 동안 '생각하게' 하는 양에 해당한다고 설명했습니다.
컴퓨터로 증명을 확인하면 안심인가
OpenAI는 원고의 일부를 'Lean'이라는 소프트웨어로도 확인하고 있습니다.
Lean은 수학 증명을 컴퓨터가 읽을 수 있는 형태로 만들고, 도중 논리에 모순이나 비약이 없는지 하나하나 점검하는 도구입니다. 계산 문제에서 풀이 과정을 순서대로 채점하는 시스템을 훨씬 더 엄밀하게 만든 것이라고 생각하면 이해하기 쉽습니다.
2026년 10월 10일 확인 시점에서, 719건 중 중심 결과 300건, 약 42%가 Lean으로 확인 가능한 형태입니다.
다만, '전체 원고의 42%가 완벽하게 정확하다고 보장된다'는 의미는 아닙니다. Lean이 확인하는 것은 컴퓨터용으로 작성된 증명의 논리입니다. 그 연구가 정말 새로운지, 중요한지, 과거 연구를 올바르게 인용했는지까지는 자동으로 보장하지 않습니다.
또한, 남은 약 58%에는 같은 형식의 확인이 아직 붙지 않았습니다. OpenAI 자신도 컴퓨터 검증이 완료되지 않은 결과에는 문제가 있을 수 있다고 설명했습니다.
철회는 'AI의 실패'인가
원고가 철회되었다고 해서 곧바로 'AI에게는 수학을 할 수 없다'고 결론 내릴 수는 없습니다. 인간 연구자가 쓴 논문에도 실수는 있으며, 공개 후에 수정이나 철회가 이루어지기도 합니다.
이번에는 오류의 내용과 영향을 받은 원고가 공개되었으며, 과거 버전도 확인할 수 있는 형태로 남겨졌습니다. 오류를 숨기지 않고 바로잡은 점은, 연구를 검증하는 시스템이 작동한 사례로 볼 수도 있습니다.
반면에, 인간일 때와는 양과 속도가 다릅니다.
AI는 인간이 며칠 동안 읽어내릴 수 있는 양의 원고를 단기간에 만들 수 있습니다. 만드는 속도만 빨라지고, 확인하는 속도가 변하지 않는다면, 연구자는 AI의 원고를 읽는 것만으로도 손에 부칠 수 있습니다.
대량의 원고를 공개하는 것이 학계에 기여하는 것일까요? 아니면 '무엇이 정확한지 조사하는 일'을 외부 연구자에게 떠넘기는 것이 될까요? 이번 사건은, 그 경계가 아직 정해지지 않았음을 보여주고 있습니다.
AI 시대에 중요해지는 것은 '만드는 힘'만이 아니다
AI가 원고를 대량으로 만들 수 있게 되면서, 인간에게 요구되는 일 또한 변화합니다.
수많은 결과 중에서 정말 중요한 것을 고르는 것. 증명에 오류가 없는지 확인하는 것. 과거 연구와 비교하여 무엇이 새로운지를 설명하는 것. 그리고 다른 사람이 이해할 수 있는 형태로 남기는 것.
이러한 '선택하고, 확인하고, 의미를 설명하는' 작업은 AI가 빨라질수록 중요해집니다.
문제는 AI가 인간 수학자가 될 수 있는지 여부만은 아닙니다. AI가 만든 결과를 누가 어느 정도까지 확인해야 '확실한 연구 성과'라고 부를 수 있는가. 그 규칙을 만드는 것이 AI의 발전에 뒤처지고 있습니다.
용어 보충
- 연구 원고: 연구 결과를 정리한 문서입니다. 이번 원고는 공개되었지만, 모두 학술지의 일반적인 심사를 거친 논문을 의미하지는 않습니다. - 증명: 어떤 수학적 결론이 반드시 옳다는 것을 정해진 규칙에 따라 순서대로 보여주는 설명입니다. - 부호 오류: 플러스와 마이너스 등 수나 식의 방향을 나타내는 기호를 잘못 사용하는 것입니다. 작아 보일지라도 이후 계산 전체를 바꿀 수 있습니다. - Lean: 수학적 증명을 컴퓨터로 세밀하게 확인하기 위한 소프트웨어입니다.
출처
- OpenAI 'Sharing AI progress in mathematics' (2026년 10월 6일)
- OpenAI
math공개 리포지토리
변경 이력 - Retraction Watch 'OpenAI withdraws three preprints a day after releasing 722 manuscripts on unsolved math problems' (2026년 10월 8일)
본 기사는 생성 AI의 지원을 받아 작성되었습니다. 기재된 수치와 경위는 상기 1차 정보 및 보도를 2026년 10월 10일에 확인했습니다. 남아있는 각각의 719개 원고들의 수학적 정확성, 참신함, 중요성은 미확인입니다.
토론

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기