
GPT-5.6이 30년 된 수학적 간극을 메웠다. 아무도 알아차리지 못했다.
요약
GPT-5.6 Sol이 정교한 프롬프트 프레임워크를 통해 30년간 미해결 상태였던 볼록 최적화의 $\Omega(d^2)$ 하한선을 증명했습니다. 이는 기존 알고리즘의 최적성을 수학적으로 확정하며 복잡도 이론의 중요한 간극을 메운 성과입니다.
핵심 포인트
- GPT-5.6 Sol이 볼록 최적화의 $\Omega(d^2)$ 하한선 증명 성공
- 30년 동안 존재했던 알고리즘 상한선과 하한선 사이의 간극 해소
- 정교하게 설계된 프롬프트 프레임워크가 연구 성과에 결정적 역할 수행
- 단순 계산을 넘어선 복잡도 이론적 증명 능력 입증
GPT-5.6이 30년 된 수학적 간극을 메웠다. 아무도 알아차리지 못했다.
2026년 7월 17일, 한 게시물이 513점과 328개의 댓글을 기록하며 Hacker News 상단에 올랐습니다. 해당 게시물은 Reddit r/math 스레드로 연결되었으며, 그곳에서 한 연구자는 GPT-5.6 Sol이 — 정교하게 구성된 프롬프트 (prompt)의 안내를 받아 — 표준 함수 클래스(standard function class)에 대한 볼록 최적화 (convex optimization)가 $\Omega(d^2)$의 함수 평가 (function evaluations)를 필요로 한다는 것을 어떻게 증명했는지 상세히 설명했습니다. 이 하한선 (lower bound)은 30년 전에 발표된 알고리즘의 상한선 (upper bound)과 일치합니다. 간극이 메워졌습니다. 복잡도 (complexity)가 확정되었습니다.
같은 주에, 동일한 모델에 대한 소비자용 보도는 토큰 비용 계산기나 설정 가이드로 구성되어 있었습니다. 이러한 괴리는 우연이 아닙니다. 이것이 바로 이야기의 핵심입니다.
실제로 일어난 일: $\Omega(d^2)$ 결과
이 구체적인 성과는 계산이 아닌 복잡도 이론적 증명 (complexity-theoretic proof)입니다. 지난 30년 동안, $d$ 차원에서 볼록하고 유계인 Lipschitz 함수 (convex, bounded Lipschitz function)를 최소화하기 위한 가장 잘 알려진 알고리즘은 $\Omega(d^2)$의 함수 평가를 필요로 해왔습니다. 연구자들은 이것이 아마도 최적일 것이라고 알고 있었습니다 — 더 빠른 알고리즘이 발견되지 않았기 때문입니다 — 하지만 아무도 그에 상응하는 하한선 (lower bound)을 증명할 수 없었습니다. 하한선이 없다면, 더 빠른 알고리즘의 존재 가능성을 배제할 수 없습니다. 단지 아직 아무도 찾지 못했을 뿐이라고 말할 수 있을 뿐입니다.
GPT-5.6 Sol이 그 간극을 메웠습니다. 이전 모델들로 1년 동안 실패를 거듭하며 구축한 연구자의 프롬프트 프레임워크 (prompt framework) 하에서 작동한 이 모델은 $\Omega(d^2)$ 하한선이 유효하다는 증명을 생성했습니다. 이 결과는 다음과 같은 의미를 갖습니다: 아무리 영리한 알고리즘이라도 이 클래스의 문제들을 더 적은 평가로 해결할 수 없습니다. 30년 된 그 알고리즘은 내내 최적이었던 것입니다.
상한선 (upper bounds)보다 하한선 (lower bounds)이 더 중요한 이유: 알고리즘이 작동함을 증명하는 것 (상한선)은 하나의 접근 방식이 성공함을 보여줍니다. 반면 하한선을 증명하는 것은 _모든 가능한 접근 방식_을 제한합니다. 이는 특정 해결책의 영리함에 대한 것이 아니라, 문제의 근본적인 구조에 대한 진술입니다. 하한선을 확립하는 것은 범주적으로 훨씬 더 어렵습니다.
계산에는 약 148분이 소요되었습니다. 이는 거의 2시간 반 동안 지속된 추론 (reasoning)이었습니다. 이것은 단순한 패턴 인식 (pattern recognition)의 번뜩임이 아니었습니다. 그것은 모델이 30년 동안 인간 수학자들을 좌절시켰던 증명 전략 (proof strategies)을 탐색하며 수행한 확장된 형식적 논증 (formal argumentation)이었습니다.
이것이 왜 중요한지 이해하려면: 볼록 최적화 (convex optimization)는 학술적 호기심에 그치는 것이 아닙니다. 그것은 모든 신경망 학습 (neural network training) 과정의 모든 경사 하강법 (gradient descent) 단계 밑에 깔린 수학적 토대입니다. GPT-5.6 자체를 학습시키는 알고리즘들도 방금 이 모델이 발전시킨 이론에서 파생되었습니다. 자신을 만드는 데 사용되는 알고리즘 클래스에 대해 최적성 경계 (optimality bounds)를 증명하는 모델에는 어떤 재귀적인 (recursive) 측면이 있습니다.
한 HN 댓글 작성자 (LPisGood)가 언급했듯이: 볼록하고 유계인 립시츠 함수 (convex, bounded Lipschitz function) 최적화는 현대 머신러닝 (machine learning)의 기초입니다. 또 다른 작성자 (hodgehog11)는 반박했습니다 — 현대 AI는 고전적인 볼록 이론이 직접적으로 적용되지 않는 비볼록 목적 함수 (nonconvex objectives)를 사용한다고 말입니다. 이에 대한 재반박 (alternator)은 정확했습니다: ADAM 및 SGD와 같은 옵티마이저 (optimizers)는 볼록 연구에서 기원했으며, 볼록 사례를 이해하는 것은 비볼록 확장 (nonconvex extensions)을 위한 토대로 남아 있다는 것입니다. 실제 운영 환경의 학습이 기술적으로 비볼록이라 할지라도, 이 이론적 결과는 실질적인 다운스트림 영향 (downstream implications)을 가집니다.
패턴: 한 달 사이의 두 가지 프런티어 수학 결과
이는 고립된 사건이 아닙니다. 8일 전, OpenAI는 64개의 병렬 서브에이전트 (parallel subagents)를 사용하는 GPT-5.6 Sol Ultra가 사이클 이중 커버 추측 (Cycle Double Cover Conjecture)에 대한 증명을 생성했다고 발표했습니다. 이는 모든 브리지 없는 그래프 (bridgeless graph)가 각 에지를 정확히 두 번씩 덮는 사이클의 집합을 포함하는지 묻는, 그래프 이론 (graph theory) 분야의 50년 된 미해결 문제였습니다. 그 증명은 1시간도 채 걸리지 않았습니다.
두 결과에 나타난 패턴은 주목할 만한 가치가 있습니다:
| 결과 | 문제의 연령 | 연산 시간 | 방법론 | 검증 |
|---|---|---|---|---|
| 사이클 이중 커버 (CDC) | 50년 | 1시간 미만 | 64개 서브에이전트 (Ultra) | Lean 정식화 (formalization) 제공됨, 동료 검토(peer-review) 미완료 |
| 볼록 최적화 하한 (Convex Optimization Lower Bound) | 30년 | 약 148분 | 단일 프롬프트 유도 세션 (Sol) | 도메인 전문가에 의한 인간 검증 |
CDC 증명이 더 화려합니다. 더 큰 추측이며, 더 극적인 주장입니다. 하지만 볼록 최적화 (convex optimization) 결과는 방법론에 대해 드러내는 바가 더 중요할 수 있습니다. 이 결과는 멀티 에이전트 스웜 (multi-agent swarm)이 아니라, 인간 연구자의 프롬프트에 의해 유도된 단일 모델 인스턴스에 의해 생성되었습니다. 연구자는 컨텍스트 (context)를 구축하고, 이전 모델 버전들로 실패를 경험하며, 접근 방식을 개선하는 데 1년을 보냈습니다. GPT-5.6 Sol이 등장했을 때, 축적된 프롬프트 엔지니어링 (prompt engineering)이 충분한 모델 역량과 만났고, 증명이 나타난 것입니다.
기여의 문제: 누가 수학을 했는가?
HN (Hacker News) 토론에서는 즉각적으로 핵심적인 긴장 관계가 부상했습니다. 사용자 YeGoblynQueenne는 가장 날카로운 질문을 던졌습니다. 연구자가 이전 모델들로 문제를 해결하기 위해 1년을 보냈고 프롬프트에 상당한 컨텍스트와 기술을 제공했다면, 진정으로 AI의 몫은 얼마이며 이전 인간의 작업은 얼마인가 하는 점입니다.
사용자 dwohnitmok은 반박했습니다. AI가 초기 프롬프트에 포함되지 않은 Lean 정식화 (formalization)를 제공했다는 점은, 단순한 검색 (retrieval)을 넘어선 진정한 새로운 기여가 있었음을 시사한다고 말입니다.
이것은 명확한 이분법적 문제가 아닙니다. 2025년 10월의 Adil Salim 논문 — 관련 볼록 분석 (convex analysis) 문제에 대한 이전 GPT-5-Pro의 연구를 기록한 것 — 은 정확히 이러한 역학 관계를 설명합니다: GPT-5-Pro는 전략적인 제안과 부분적인 증명 (partial proofs)을 통해 진보를 가속화했지만, 그 과정에서 미세한 오류를 수정하기 위한 세심한 인간의 감독 (human supervision)이 필요했습니다.
협업 모델은 다음과 같습니다: 인간이 방향을 설정하고 제약 조건 (constraints)을 제공하면, 모델은 인간이 따라갈 수 없는 속도로 후보 증명 (candidate proofs)을 생성하고, 인간이 이를 검증 및 수정하며, 모델이 반복 (iterate)합니다. 어느 쪽도 단독으로는 결과를 만들어낼 수 없었습니다. "누가 수학을 했는가"라는 질문은 페어 프로그래밍 (pair programming)에서 특정 코드 한 줄을 누가 작성했는지 묻는 것만큼이나 시대에 뒤떨어진 질문일 수 있습니다.

반론 코너: 프롬프트가 곧 연구다
가장 강력한 회의론적 입장은 GPT-5.6이 수학을 할 수 없다는 것이 아닙니다. 그것은 분명히 할 수 있습니다. 회의론적 입장은 프롬프트 엔지니어링 (prompt engineering) — 즉, 1년간의 도메인 전문가의 반복 작업, 실패한 시도들, 그리고 축적된 컨텍스트 (context) — 이 실제적인 연구 기여라는 점입니다. 모델은 실행 엔진 (execution engine)이지, 연구자가 아닙니다. 축적된 프롬프트 프레임워크 (prompt framework) 없이 동일한 모델에 동일한 문제를 던져준다면, 모델은 실패합니다. 인간 연구자가 간극을 메웠으며, 모델은 단지 사용 가능한 가장 빠른 펜이었을 뿐입니다.
이것이 중요한 이유는 결과가 확장 (scale) 가능한지를 결정하기 때문입니다. 만약 프롬프트 엔지니어링이 병목 현상 (bottleneck)이라면, AI 수학에는 AI에 능숙한 도메인 전문가 — 즉 희소한 자원 — 가 필요합니다. 만약 모델의 역량이 병목 현상이라면, 세대가 거듭될 때마다 그 문호는 활짝 열릴 것입니다.
주의력의 분산: 역량 vs. 커버리지 (Capability vs. Coverage)
여기서 타이밍이 놀라운 이유가 있습니다. GPT-5.6 Sol은 2026년 7월 9일에 일반 사용 가능 (general availability) 상태로 출시되었습니다. 그 후 9일 동안:
연구 영역에서 생성된 것:
- 볼록 최적화 (convex optimization) 분야에서 30년 된 복잡도 간극 (complexity gap)을 메우는 증명
- CDC 증명에 대한 지속적인 검증 (Lean 정형화 (formalization) 오픈 소스 공개)
- NP-난해 (NP-hard) 문제에서 Sol을 Fable 5와 벤치마킹하는 활발한 HN 평가 스레드 (218점, 107개 댓글)
소비자 측면에서 생성된 것:
- 토큰 비용 (token-cost) 비교 계산기
- 설정 최적화 (settings optimization) 가이드
- 유튜버 반응 썸네일
우리는 이러한 괴리를 직접 다루었습니다: GPT-5.6이 헤드라인을 장악했다. 돈은 Anthropic에 걸렸다.는 예측 시장 (prediction markets)이 Anthropic의 가격을 94%로 책정하는 동안 GPT-5.6이 유튜브 썸네일을 점령했음을 보여주었습니다. 가격에 관한 담론 역시 마찬가지로 동떨어져 있습니다 — 당사의 Sol의 작업당 실제 비용에 대한 분석은 표기된 가격이 실제 지출을 어떻게 가리는지를 기록했습니다.
하지만 이것은 가격 차이보다 더 심각한 문제입니다. 이것은 역량 차이 (capability gap) 입니다 — 즉, 모델이 연구 최전선에서 입증하는 능력과 주의 경제 (attention economy)가 사람들에게 말하는 능력 사이의 차이입니다. 수학적 증명 생성에 Sol을 사용하는 연구자들은 설정 최적화 스레드를 따르는 사용자들과는 다른 현실에 살고 있습니다.

실시간 질문: 누가 연구 의제를 설정하는가?
HN 스레드는 기여도(attribution) 문제보다 더 깊은 우려를 드러냈습니다. 사용자 nicf는 수학 교육에 미칠 영향에 대해 성찰했습니다: 만약 AI가 쉬운 문제(low-hanging problems)들을 해결한다면, 주니어 연구자들은 어떻게 기초적인 경험을 쌓을 수 있을까요? 이 분야의 교육 파이프라인은 다룰 수 있는 미해결 문제(tractable open problems)에 의존하고 있으며, AI가 그것들을 소비하고 있습니다.
Cambridge, Oxford, Columbia를 포함한 15개 대학의 연구자 16명이 2026년 6월에 서명한 Leiden Declaration은 이러한 우려를 공식화했습니다: 기술적 실현 가능성(technical feasibility)이나 상업적 이익이 연구 방향을 결정하게 될 때, 수학은 자체적인 연구 의제(research agenda)를 설정하는 자율성을 잃을 위험이 있다는 것입니다.
이는 추상적인 이야기가 아닙니다. 볼록 최적화 (convex optimization) 결과는 해당 분야에서 가장 중요한 문제가 아니었습니다. 그것은 프롬프트 유도형 LLM 공격 (prompt-guided LLM attack)에 가장 취약한 문제였습니다. 연구자가 그 문제를 선택한 이유는 이전 모델들의 시도가 그 근처까지 도달했었기 때문입니다. AI 지원 연구에서의 선택 편향 (selection bias)은 실재합니다: 모델은 모델이 해결할 수 있는 것을 해결할 것이고, 연구자들은 모델이 도움을 줄 수 있는 것을 추구할 것입니다.

Zvi Mowshowitz의 프레임워크는 운영상의 현실을 포착합니다: Sol은 일꾼(workhorse)입니다. 제한된 기술적 과업에 대해 빠르고, 저렴하며, 신뢰할 수 있습니다. 수학적 결과는 적절한 사람이 적절한 문제를 향해 이 일꾼을 투입했을 때 그 일꾼이 할 수 있는 능력의 천장(ceiling)입니다. Leiden 선언 서명자들이 던지는 질문은, "적절한 문제"가 "수학에 가장 중요한 문제"가 아니라 점점 더 "AI가 다루기 쉬운 문제"를 의미하게 될 것인가 하는 점입니다.
Fable 5 비교: 서로 다른 강점, 같은 주간
볼록 최적화 스레드가 HN(Hacker News)에 올라온 바로 그날, 외판원 문제 (Traveling Salesman Problem) 변형 모델에 대해 Fable 5와 GPT-5.6 Sol을 비교한 또 다른 게시물이 218점을 받았습니다. 그 결과는 다음과 같습니다:
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기