수학의 아포칼립스
요약
최근 AI가 수학적 증명을 제시하는 사례를 접하며, 그 결과물의 명료성과 논리적 흐름에 대한 의문을 제기합니다. AI의 증명은 정답을 내놓지만 인간이 이해하기에는 구조적으로 복잡하고 잡음이 많아 가독성이 떨어진다는 비판입니다. 이는 AI가 복잡한 아이디어를 전달하는 방식과 관련되며, 향후 인간 중심의 증명 과정을 요구해야 함을 강조합니다.
핵심 포인트
- AI는 정답은 내놓지만, 그 과정이 너무 복잡하고 이해하기 어려움.
- 수학적 증명은 단순 코딩 결과와 달리 논리적 일관성과 명료성이 필수임.
- AI의 사고방식과 인간의 사고방식 간의 근본적인 차이를 인식해야 함.
- 향후에는 인간이 다룰 수 있는 규모의, 이해하기 쉬운 증명을 요구할 필요가 있음.
“환각제를 먹고 쓴 듯 불분명하고, 불가능성 결과에도 불구하고 기존 연구를 적용할 수 있는 이유는 설명하지 않은 채 이름만 나열함. AI 도움 없이는 읽기 불가능할 만큼 글이 엉망임”이라는 대목이 흥미로움. 이 사건을 다룬 다른 기사에서는 보지 못한 내용임. 정답은 내놓지만 엉망으로 작성된 남의 코드를 이해하려는 것처럼, 읽고 파악하기가 끔찍할 듯함.
수학 증명은 올바른 방식으로 올바른 결과를 내야 하므로, 코드가 정답을 출력하는 것과는 다름. 아직 증명이 검증되지 않았고 인간이 검증할 수 있을지도 불분명한 만큼, AI 기업의 상장을 위한 대대적인 홍보전처럼 보임.
증명은 명료해야 하는데 잡음이 너무 많다는 점이 의심스러움. 무차별 대입과 사고의 차이가 여기에 있음. 인간의 증명은 논리적으로 맞을 뿐 아니라 사고가 정제되어 있고 일관성이 있어야 함. 이해하는 데 몇 년이 걸리더라도 논리의 흐름 자체는 명확해야 함.
미로를 통과하는 길은 최대한 짧고 지도는 최대한 명료해야 하는데, 이번 결과는 정반대처럼 들림. 실제 통로가 있더라도 너무 복잡하고 오래 걸리면 확인할 수 없음. 앞으로는 인간이 다룰 수 있는 규모의 증명을 요구하거나, 그런 증명이 불가능하며 기계의 증명이 최선임을 입증하도록 해야 한다고 봄. 정지 문제에 걸리지 않고도 가능할 듯하지만 증명할 수는 없음.
이런 증명 뭉치는 오픈소스 저장소를 압도하는 저품질 일회성 PR의 범람을 떠올리게 함.
이런 증명이 인간이 읽기 쉬운 증명을 찾는 시도를 경쟁에서 밀어내 수학 생태계를 해칠 수 있다는 우려와도 맞닿아 있음. 다만 증명을 편집하고 주석을 달아 인간이 이해할 수 있게 만드는 수학 인플루언서가 늘어날 수도 있음.
요즘 AI를 쓸 때 겪는 기본적인 현상 아닌가? 작은 규모의 아이디어는 명료하게 표현하지만, 규모가 커지고 복잡해질수록 인간이 읽기에 부적합한 출력이 나옴. AI의 사고방식이 인간과 너무 다르고, 각 분야 전문가가 기대하는 방식으로 복잡한 아이디어를 전달하도록 훈련받지 못한 듯함.
생성형 AI를 활용한 코드 개발과 닮은 점이 많아서 놀랍지는 않음.
첫 문장만 봐도 AI가 쓰지 않았다는 걸 알 수 있음. “엄마, 완전 털렸다며! 엄마가 평생 연구한 수학 문제를 로봇이 풀었다며! 어쩔!” 같은 말은 우리 집 여덟 살 아이가 식탁에서 할 법한 말투와 정확히 같음.
ChatGPT에 요즘 8~9세 아이처럼 AI에 일자리를 빼앗긴 엄마를 놀려 보라고 했더니, “Siri도 직장이 있는데 엄마는 없네”, “AI한테 내 점심 만드는 법은 가르쳐 줄 수 있겠네” 같은 답을 내놓음.
전부 어색하고 기계적인 놀림인 데다 어딘가 밀레니얼 세대 말투가 묻어남. 아이들의 말투와 언어 변화야말로 최고의 AI 탐지기인 듯함.
“요즘 유행하는 표현을 써라”를 추가하니 덜 기계적인 결과가 나왔고, “cooked”나 “negative aura”도 등장함. 무료 Google AI를 썼는데 손주들에게 듣는 말투와 어느 정도 비슷했음.
그런데 이 댓글은 즉시 신고 표시가 붙었음. 이전에 AI와 무관하게 쓴 수백 개 댓글은 한 번도 그런 적이 없었는데, HN이 AI 탐지에 좀 더 맥락을 따질 줄 알았지만 아닌 모양임.
Ted Chiang은 가장 좋아하는 작가임. AI와는 관계없지만 Exhalation도 추천함.
에이전트 군집이 아니라 모델 자체의 능력만으로 이뤄낸 결과라는 게 아찔함. 언제쯤 이런 능력을 직접 쓸 수 있고, 비슷한 것을 로컬에서 실행할 수 있을까? 그때쯤 최첨단 AI 연구소는 대체 무엇을 갖고 있을까?
내가 과민반응하는 것일 수도 있으니, 일단 정신을 가다듬고 받아들여야 할 듯함.
Aaronson의 글을 읽고서야 각 결과가 에이전트 군집이 아니라 단일 모델을 약 3시간 실행해 얻은 것이라는 사실을 알게 됨. 정말 놀라움.
“모델의 능력”과 “에이전트 군집”을 서로 다른 개념으로 보는 이유가 궁금함.
그건 몇 시간 동안 슛을 놓친 건 빼고, 하프코트 슛을 넣는 데 5초밖에 안 걸렸다고 하는 것과 같음.
글 속 아내가 제기한 쟁점 외에도, Navier–Stokes 결과의 메타 분석은 이 해법들 전반에 의문을 던짐. https://arxiv.org/abs/2610.08144
이 논문은 자연어 증명을 Lean 같은 형식 언어로 자동 변환한 뒤 기계적으로 검증해도, 원래 자연어 증명의 신뢰성은 보장되지 않을 수 있음을 다룸. 의미를 충실하게 옮기려면 모호성을 해소해야 하는데, 이 문제의 복잡도는 해결 가능성 복잡도 지표(SCI) 계층에서 한없이 높아질 수 있어, 비형식적으로 말하면 정지 문제보다도 어렵다는 내용임. 실제 AI 오역 사례와 함께, OpenAI가 발표한 Navier–Stokes 해의 폭주에 대한 Lean 증명이 자연어 증명과 일치하지 않는다는 결과도 제시함.
논문에서 다루는지는 모르겠지만, LLM이 Lean의 버그를 찾아 증명에 악용할 수 있다면 이를 알리지 않은 채 이용할 가능성도 높다고 봄. 따라서 문제의 형식화가 정확한지 확인했더라도, LLM이 내놓은 백만 줄짜리 Lean 증명을 완전히 신뢰하기는 어려움. 의도치 않은 편법을 찾아 악용한 Hugging Face 해킹 사건과 같은 부류의 위험임.
LLM이 버그를 발견했다는 사실을 스스로 어떻게 알 수 있을까?
피타고라스 정리의 증명만 해도 수십 가지 아닌가? 목표는 단순히 증명하는 데 그치지 않고, 해당 분야의 일반적인 연구자가 직관적으로 이해할 수 있는 잘 쓴 결과물을 만드는 것임. 더 깊이 이해해야 더 나은 질문도 할 수 있음.
목적지보다 여정이 중요하다는 말이 여기에도 적용됨. 답 자체만 보면 실용성이 없는 수학 문제가 많고, Navier–Stokes 방정식에 관한 밀레니엄 문제도 그런 부류임. 실제 유체는 그처럼 극단적인 조건에서 해당 방정식을 따르지 않으므로 해 자체는 물리적 의미가 없음. 하지만 해를 찾는 과정에서 정말 유용한 통찰을 얻을 수 있음.
OpenAI가 내놓은 거대한 혼란은 사람들이 진정 원한 통찰을 별로 주지 못한 채 답만 제공한 셈임. 성과가 있는데도 부정적으로 보는 이유 중 하나는 연구 유인의 훼손임. 100만 달러 상금도 없고 두 번째라는 명예만 남으면, 통찰을 주는 해법에 도전할 동기가 훨씬 줄어듦.
지금까지 수학계는 통찰보다 증명 자체를 훨씬 높게 평가해 왔음. 조금만 더 노력하면 둘을 함께 얻을 수 있었기 때문이기도 함. 증명이 전혀 없다가 하나 생기는 것은, 다소 엉성하더라도 AI가 썼든 인간이 썼든 큰 성과임.
학계의 보상 구조와 연구비, 인간의 생존·번식 욕구와 자본주의를 고려하면 틀린 얘기임. 대학과 과학계가 “1억 달러를 줄 테니 자유롭게 탐구하며 이해를 쌓아 보라”고 해 주면 좋겠지만, 현실의 사회는 위계적이고 자본주의적이어서 가치 창출과 지위 확보가 요구됨.
자금 배분 기관은 자원이 의미 있게 쓰였다는 근거가 있어야 지원할 수 있음. 인간도 지위와 권력, 자원, 번식 기회를 추구하며, 의사결정권과 권력이 클수록 이런 것들을 더 많이 확보할 수 있음.
아직 인간이 거의 어느 증명도 이해하지 못했다면, OpenAI의 증명을 실제로 검증한 사람이 있는가? 아니면 Lean 코드가 검증을 통과했다는 이유로 참이라고 가정하는 것인가? Lean 코드로 옮기는 과정부터 잘못됐을 수도 있지 않은가?
정리마다 사정이 다름. 예를 들어 페르마의 마지막 정리를 Lean으로 표현한 명제는 The Natural Number Game을 해 보고 수학과 프로그래밍을 조금 아는 사람이라면 이해할 수 있을 것임. 증명 자체는 컴파일러를 신뢰하면 됨.
반면 다른 정리는 명제의 표현부터 훨씬 섬세할 수 있고, Lean 형식화에 필요한 긴 도입부를 꼼꼼히 확인해야 할 수도 있음. 아직 Lean 형식화 없이 OpenAI 저장소의 난해한 PDF만 있는 결과도 있으며, 그중 일부에 논리적 공백이 있어도 전혀 놀랍지 않을 것임.
시간이 지나면 밝혀지겠지만, 현재로서는 분명 의문이 남아 있고 많은 사람이 검증에 매달리고 있음. https://adam.math.hhu.de/#/g/leanprover-community/nng4
일반적인 안전장치를 제대로 적용해도 Lean 코드가 잘못 형식화될 수 있다고 봄. https://news.ycombinator.com/item?id=49672339
Lean 검증만 믿고 있는 것이냐는 질문에는 어느 정도 그렇다고 답할 수 있음. 원고 722편을 한꺼번에 공개한 지 겨우 24시간이 지났고, 대부분은 사실상 읽기 어려운 수준이라고 함. Lean 증명이 딸린 것은 일부뿐이며, 그 코드 역시 읽기 편하지는 않은 것으로 알고 있음.
컴퓨터과학 박사과정 학생임. 결과가 멋지다고 생각하면서도, 박사과정에서 쌓는 역량이 결국 무가치해질까 봐 두려움. 어떻게 해야 할지 잘 모르겠는데 비슷한 처지에 있는 사람들은 어떻게 생각하는가?
물리학을 공부했지만 동기 대부분은 물리학과 무관한 금융·보험·프로그래밍 분야로 진출함. 연극이든 이론 컴퓨터과학이든 어려운 분야를 공부하면 전문 기술과 범용 역량이 함께 생기므로, 나중에 다른 일을 하더라도 완전히 헛수고가 되지는 않음.
물론 즐거운 상황은 아니며 충분히 공감함. 나도 아직 학생이고 가능하면 금융업은 피하고 싶음. 다만 배우고 있다는 느낌이 든다면 모든 걸 포기하지는 말자는 뜻임. 나 역시 박사과정 연구 주제를 골라야 하는데 급격한 변화 때문에 장기 계획을 세우기가 너무 어려워 조언을 구하고 싶음.
박사학위 이후의 진로에 따라 많이 달라짐. 산업계로 가면 학위 연구 자체보다는 폭넓은 지식, 직관, 엄밀함, 어려운 것을 배우는 능력을 활용해 새로운 연구 성과를 실무에 적용할 가능성이 높음. 이런 역량은 AI가 상금이 걸린 수학 문제의 증명을 선점하는 것과 대체로 별개임.
노동으로 돈을 버는 거의 모든 사람이 이미 같은 처지이거나 곧 그렇게 될 것임. 변화가 얼마나 빠르게 오는지 모르거나 강하게 부정하는 사람이 많을 뿐임. 경제 붕괴 전에 평화적인 정치적 해법을 찾기를 바라는 것 외에 무엇을 해야 할지 우리도 모름.
안개 낀 산 정상으로 순간이동한 등반가라는 비유가 좋았음. 이제 순간이동 장치가 생겼으니 더 많은 정상에 올라 탐험해야 한다는 데 동의함. AI가 없던 세상으로 돌아갈 수는 없음.
핵심은 소유권임. AI가 만든 지식을 분배하거나 이를 이해하는 데 도움을 줄 사람들에게 보상할 수단이 없음. 경제적 목적의 모든 기호 추론과 수치 추론을 AI가 수행하는 세상으로 빠르게 이동하고 있음.
“이 모든 게 진짜가 아니며 아무 의미도 없다고 훈계하듯 설명하는 사람들은 계속 있을 것임. 현실의 증거로 놀라거나 판단을 바꿀 수 있었다면, 수학계의 대격변에 이르기 훨씬 전인 몇 년 전에 이미 바꿨을 것임”이라는 대목이 이 스레드 댓글 절반에 해당함.
반대로 수학은 끝났다며 과열된 찬사를 보내는 댓글도 아주 많음. 증명을 액면 그대로 받아들이고, 모두가 의심 없이 믿을수록 이익을 보는 회사에 가능한 모든 유리한 해석을 해 주고 있음.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기