Terence Tao와 AI의 수학: 천재가 우리에게 보이지 않는 것을 보는 방식
요약
Anthropic의 Levent Alpöge가 Claude 모델을 사용하여 87년 된 수학 난제인 자코비 추측의 반례를 찾아냈습니다. 이에 대해 Terence Tao는 AI가 수학적 가치와 관행의 기초를 흔드는 격동의 시기가 도래했음을 경고하며 AI와 수학의 상호작용을 연구하고 있습니다.
핵심 포인트
- Claude 모델을 활용한 87년 된 수학적 추측(자코비 추측)의 반례 발견
- Terence Tao는 AI를 수학적 연구의 강력한 부조종사(co-pilot)로 정의
- AI가 수학적 가치와 관행의 기초에 위기를 가져올 수 있다는 전망
- 최첨단 AI가 엘리트 과학자의 업무 방식을 근본적으로 변화시키는 과정
원문은 The AI Prism에 게시되었습니다.
87년 된 추측이 무너진 주
2026년 7월 19일, 수학자들이 1939년부터 쫓아왔던 문제가 마침내 해결되었습니다. 종신 교수도, 필즈상(Fields Medal) 수상자도 아니었습니다. Anthropic에서 근무하는 수학자 Levent Alpöge가 회사의 Claude Fable 5 모델을 사용하여 3차원에서의 Jacobian conjecture (자코비 추측)에 대한 명시적인 반례(counterexample)를 생성함으로써 해결했습니다.
48시간 이내에 Terence Tao는 자신의 블로그에 해당 반례에 대한 “소화(digestion)”를 게시했고, 기하학적 설명을 찾기 위해 긴 ChatGPT Pro 세션을 실행했으며, 이에 대한 Hacker News 스레드가 “인간 수학자들이 반례를 당하고 있다(Human mathematicians are being outcounterexampled).”라는 제목의 동반 스레드를 포함하여 1,126 포인트와 635개의 댓글을 끌어모으는 것을 지켜보았습니다.
5일 후, Tao는 2026년 국제 수학자 대회(International Congress of Mathematicians 2026)에 서서 자신의 분야에 불편한 진실을 말했습니다: “우리는 이와 유사한 격동의 시기, 즉 수학적 가치와 관행의 기초에 대한 위기에 진입하고 있다고 믿습니다.” 이 문장은 수학이 스스로의 기초를 형식화하도록 강요했던 1900~1930년의 위기와 현재의 순간을 비교한 그의 ICM 공개 강연에서 나온 것입니다.
여기 아무도 묻지 않는 질문이 있습니다: 현존하는 세계 최고의 수학자가 우리가 보지 못하는 무엇을 보고 있는가?
현존하는 세계 최고의 수학자가 공개 실험을 진행 중이다
Tao는 단순한 AI 관찰자가 아닙니다. 현존하는 가장 뛰어난 수학자로 일상적으로 묘사되는 2006년 필즈상(Fields Medal) 수상자인 “수학계의 모차르트”는 지난 4년 동안 자신의 블로그와 Mastodon에 AI 실험 내용을 실시간으로 게시해 왔습니다. 그 공개 기록은 최첨단 AI가 엘리트 과학자의 업무를 어떻게 변화시키는지에 대해 우리가 가질 수 있는 통제된 연구에 가장 가까운 것입니다.
그 흐름은 명확합니다. 2023년 4월, Tao는 GPT-4가 처음으로 “상당한 양의 지루한 작업을 절약해 주었다”고 보고했습니다. 2024년 6월까지 그는 Scientific American에 다음과 같이 말했습니다: “3년 안에 AI가 수학자들에게 유용해질 것이라고 생각합니다. 그것은 훌륭한 부조종사(co-pilot)가 될 것입니다.”
2025년 11월에 이르러, 그는 Erdős 문제 웹사이트에서 “AI의 지원이 이제 일상이 되고 있다”는 사실을 기록하고 있었습니다.
모든 단계에는 증거가 있었습니다: 공유된 ChatGPT 대화, GitHub의 Lean 형식화(formalizations), 상세한 Mastodon 스레드 등이 그것입니다. 이것은 AI에 대한 논평이 아닙니다. 이것은 실험 노트입니다.
Tao가 보는 것: 평범하지만, 완전히 무능하지는 않은 대학원생
2024년 9월, OpenAI의 o1 추론 모델(reasoning model)을 테스트한 후, Tao는 AI 수학 분야에서 가장 많이 인용되는 판결을 내렸습니다: 그 경험은 “평범하지만, 완전히 무능하지는 않은 대학원생을 지도하려는 것과 거의 비슷했다.”
그는 나중에 그 문장에 대해 퍼진 오해를 바로잡았습니다. 그는 o1을 일반적인 대학원생과 비교한 것이 아니라, 평범한 _연구 보조원 (research assistant)_과 비교한 것이었습니다. o1은 일상적인 계산은 안정적으로 처리하지만, 기발한 단계에서는 “매우 상상력이 부족합니다”. 또한 인간 학생을 가치 있게 만드는 단 하나의 속성인 학습 (learning) 능력이 부족합니다. “이 모델들은 정적입니다,”라고 Tao는 The Atlantic에 말했습니다. “인간은 성장합니다.”
그는 또한 이 분야에 최초의 정직한 효율성 지표를 제시했습니다. 최고의 모델들을 사용하여 유용한 결과물을 만들어내는 데는 여전히 직접 작업하는 것보다 2배에서 5배 더 많은 노력이 듭니다. 그가 언급한 임계점은 그 비율이 1배 미만으로 떨어질 때이며, 그는 이를 몇 년 안에 실현될 것으로 예상합니다. 그때가 되면 도입 여부는 더 이상 논쟁의 대상이 되지 않을 것입니다.
수치가 말해주는 것
벤치마크의 궤적은 대부분의 사람들이 추적할 수 있는 속도보다 빠르게 움직입니다. 2024년 7월, DeepMind의 AlphaProof와 AlphaGeometry 2는 2024년 국제수학올림피아드(IMO) 문제 6개 중 4개를 풀어 42점 만점 중 28점을 획득했습니다 — 이는 은메달 수준입니다. 가장 어려운 문제는 609명의 인간 참가자 중 단 5명만이 풀어냈으며, 금메달은 29점부터 시작되었습니다. AlphaProof의 이면에 있는 방법론은 이후 Nature에 게재되었습니다.
그러자 목표 지점이 이동했습니다. 2024년 11월, Epoch AI는 60명 이상의 수학자들이 작성한 수백 개의 독창적인 연구 수준 문제들을 담은 FrontierMath를 공개했습니다. 선도적인 모델들은 2% 미만의 정답률을 보였습니다. Tao는 이 문제들이 “극도로 도전적”이라고 평했고, Timothy Gowers는 이 문제들이 “국제수학올림피아드 (IMO) 문제와는 차원이 다른 난이도”에 있다고 말했습니다. 2024년 12월, OpenAI의 o3는 **25.2%**로 급등했습니다. 이 도약은 이후 OpenAI가 FrontierMath의 제작을 조용히 지원했다는 사실을 드러냈으며, 이는 Epoch AI가 이후 인정한 투명성 결여 사례가 되었습니다.
2026년에는 프런티어(frontier)가 벤치마크에서 미해결 문제(open problems)로 이동했습니다. 독립적인 평가 프로젝트인 First Proof는 2026년 5월 28일, 네 가지 AI 시스템을 대상으로 10개의 새로운 연구 문제들을 테스트했습니다. 그 결과 10개 중 7개가 출판 가능한 수준의 품질로 해결되었으며, 문제당 연산 비용(compute costs)은 10달러에서 1,000달러 사이였습니다. 2026년 3월, GPT-5.4 Pro 기반의 팀은 FrontierMath 미해결 문제 중 하나인 Ramsey 이론적 구성을 최초로 해결했습니다. Epoch는 인간 전문가가 이 문제를 해결하는 데 1~3개월이 걸릴 것으로 추정했습니다. 2026년 5월, DeepMind의 AlphaProof Nexus는 353개의 미해결 Erdős 문제 중 9개를 해결했으며, 492개의 OEIS 수열 추측 중 44개를 문제당 수백 달러의 비용으로 증명해 냈습니다.
그리고 야코비 반례(Jacobian counterexample)가 등장했습니다. 이는 120개의 자유도(degrees of freedom)에 비해 야코비 소거(Jacobian cancellation)에 **1,329개의 계수(coefficients)**가 포함되는 7차 다항식으로, Tao는 이를 무차별 대입(brute force) 방식으로는 결코 찾아낼 수 없었을 “거대한 기적”이라고 불렀습니다.
조용한 일꾼: Lean과 정형화 파이프라인 (Formalization Pipeline)
생성형 모델 (Generative models)이 헤드라인을 장식하지만, Tao의 워크플로우는 더 조용한 기술인 Lean을 기반으로 작동합니다. Lean은 증명을 한 줄씩 검증하는 대화형 정리 증명기 (interactive theorem prover)입니다. 2023년 10월, 자신의 논문을 Lean으로 정형화하는 과정에서 이미 발표했던 논증의 작지만 사소하지 않은 버그를 발견했습니다. 이는 어떤 인간 심사위원도 잡아내지 못했던 오류였습니다.
Lean은 또한 최근 기억 중 가장 큰 규모의 협업 증명 프로젝트를 가능하게 했습니다. 바로 다항식 프라이만-루자 (Polynomial Freiman-Ruzsa, PFR) 추측의 정형화로, 20명 이상의 수학자들이 하나의 증명 조각들을 기여했습니다. "그들을 신뢰할 필요는 없습니다. 그들이 코드를 업로드하면 Lean 컴파일러가 이를 검증하기 때문입니다."라고 Tao는 설명했습니다. "우리가 평소에 하는 것보다 훨씬 더 큰 규모의 수학을 수행할 수 있습니다."
이것이 얼마나 일상적인 일이 되었는지 살펴보십시오. 2025년 11월, Erdős 문제 #367에서: 한 인간 기여자가 검증되지 않은 합동 항등식 (congruence identity)에 의존하는 반증을 제시했습니다; Tao는 그 항등식을 Gemini DeepThink에 전달했고, 모델은 약 10분 만에 이를 증명했습니다; Tao는 이를 초등적인 증명 (elementary proof)으로 다시 쓰는 데 30분을 보냈습니다; 그리고 또 다른 수학자가 2~3시간 만에 그 결과를 Lean으로 정형화했습니다. Tao 자신의 요약: "AI의 도움은 이제 일상이 되고 있습니다." 한 달 전에는, 확장된 AI와의 대화가 그가 MathOverflow 질문에 답하는 것을 도왔는데, 그는 도움 없이는 "시도조차 하기 매우 어려웠을" 작업이라고 말합니다.
Erdős Wiki: AI의 도움이 이제 일상이 되었다는 증거
가장 확실한 증거는 살아있는 문서인 Erdős 문제에 대한 AI의 기여 (AI contributions to Erdős problems) 위키입니다. Tao의 프로젝트가 관리하는 이 위키는 2026년 6월 30일까지의 데이터를 포함하며 **962회의 수정 (revisions)**을 거쳤습니다. 여기에는 Erdős의 미해결 문제들에 대한 수십 건의 AI 시도가 기록되어 있으며, 결과는 색상별로 구분됩니다: 완전한 해결 (full solutions), 부분적인 진전 (partial progress), 잘못된 증명 (incorrect proofs), 그리고 검증되지 않은 후보 (unverified candidates)입니다.
이 목록은 마치 최첨단 AI의 명단(who's who)처럼 읽힙니다: GPT-5.5 Pro, Claude Fable 5 및 Claude Mythos, Gemini 3 Pro, DeepMind prover agents, AlphaProof, Aristotle, Codex 등이 포함됩니다. 문제 #38, #90, #205, #457, #694, #960, #987, #990, #1014, #1091 등을 포함하여 여러 문제에 대한 완전한 해결책이 기록되어 있으며, 그중 몇몇은 Lean 언어로 작성되어 기계적 검증 (machine-checked)이 완료되었습니다.
이 위키가 신뢰를 얻는 이유는 숨기기를 거부하는 태도에 있습니다. 이 위키는 잘못된 증명 (incorrect proofs), 즉 #11, #51, #233, #616, #647, #888, #963, #1041, #1044에서 나타난 확신에 찬 실패들도 함께 기록합니다. 면책 조항은 직설적입니다: “이 페이지는 벤치마크 (benchmark)가 아니다”라고 명시하며, 성공률을 함부로 추론해서는 안 된다고 경고합니다. 그러한 정직함이 마케팅 문구와 연구 기록 (research log) 사이의 차이를 만듭니다.
기계적 추론 (Machine Reasoning)이 한계에 부딪히는 지점
이제 모든 진지한 관찰자들은 AI 수학이 어디에서 무너지는지에 대해 동의합니다: 형식적 검증 (formal verification) 없이는, AI의 증명은 그저 확신에 찬 이야기일 뿐입니다. 자연어 모델 (Natural-language models)은 그럴듯해 보이는 논증을 환각 (hallucinate)해내곤 합니다. Lean 파이프라인의 핵심은 '느낌 (vibe)'이 아니라 '검증기 (checker)'가 정확성을 결정한다는 데 있습니다.
하지만 검증(verification)만이 유일한 병목 현상은 아닙니다. Tao의 ICM 강연에서는 그가 “증명 소화불량 (proof indigestion)”이라고 명명한 문제를 지적했습니다. Erdős 문제 사이트에는 이미 “수십 개의 AI 생성 증명 제출물이 쌓여 있습니다. 상당수가 정답일 가능성이 높지만, 아직 어떤 인간 전문가도 이를 검증하고 보증하기 위해 나서지 않았습니다.”라고 합니다. 일부 제출자들은 자신의 AI가 내놓은 결과물을 검토할 자격이 없다고 선언하기도 했습니다. 만약 어떤 인간도 설명할 수 없는 주요 결과에 대해 검증된 증명을 얻게 된다면 어떻게 될까요? Tao는 이 질문이 여전히 유효하다고 생각합니다.
그다음으로는 더 완만한 한계들이 존재합니다. AI의 설명(exposition)은 “사소한 부분에 대해서는 길게 머무르는 반면, 논증에서 가장 흥미롭고 참신한 부분은 매우 짧게 지나쳐 버립니다.” 또한 AI의 지식은 학습 시점(training time)에 고정됩니다. Jacobian 반례(counterexample)가 공개된 바로 그 주에, 모델들은 그 존재를 따로 전달받아야 했습니다. 모델들의 지식 차단 시점(knowledge cut off)이 발견 이전에 끝났기 때문입니다. 그리고 지표(metrics)의 부패 문제도 있습니다. Tao는 굿하트의 법칙 (Goodhart’s law) — 즉, 어떤 측정치가 목표가 되는 순간, 그것은 더 이상 유효한 측정치가 아니게 된다는 법칙 — 을 인용했습니다. FrontierMath 펀딩 에피소드는 벤치마크 점수가 평가를 받는 기업들에 의해 어떻게 조작될 수 있는지를 보여주었습니다. 모델의 학습 데이터(training data)조차 별도의 격전지이며, 이는 우리가 AI 기업들이 학습 데이터를 위해 희귀 서적을 파쇄하고 있다는 기사에서 탐구했던 바와 같습니다.
이것이 과학에 의미하는 바
수학은 카나리아(canary, 경고 신호) 역할을 하지만, 이 패턴은 일반화될 수 있습니다. Tao의 프레임워크는 현재 이용 가능한 것 중 가장 명쾌합니다. 수 세기 동안 수학은 증명의 희소성 (proof scarcity) 위에서 운영되었습니다. 즉, 결과를 만들어내는 것이 어려운 부분이었습니다. AI는 이러한 경제 구조를 뒤집습니다. 이제 어려운 부분은 검증(verification), 설명(exposition), 커뮤니티의 수용, 그리고 Tao가 말하는 _정형화 (canonicalization)_가 됩니다. 정형화란 어떤 결과가 소화되고, 교육되며, 다른 모든 이들이 의존하는 이론의 일부로 구축되었을 때 비로소 의미를 갖게 되는 것을 말합니다. 그는 “우리는 증명의 희소성 시대에서 증명의 풍요(proof abundance) 시대로 전환하게 될 것”이라고 경고했습니다.
그가 제안한 가드레일은 아름답게 단순합니다. 만약 저자들이 자신의 결과에 대해 명확하고 전문가 수준의 발표를 설득력 있게 할 수 없다면, 그 결과는 출판되어서는 안 된다는 것입니다. 그의 강연에서 언급된 Leiden declaration 역시 같은 규범을 강조합니다. AI 사용 사실을 공개하고 인간에게 책임을 지도록 하는 것입니다. 한편 기관들은 이 트렌드에 실제 돈을 걸고 있습니다. DARPA의 ExpMath 프로그램은 AI 기반 수학 연구에 자금을 지원하고 있으며, Tao 자신도 철학적 논문인 “Mathematical methods and human thought in the age of AI.”의 공동 저자로 참여했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기