Anthropic의 Riemann Run이 AI 엔지니어들에게 주는 교훈: 60개 서브 에이전트, 650가지 아이디어, 하나의 증명
요약
Anthropic의 연구 사례는 AI가 복잡한 문제를 해결하는 새로운 아키텍처를 제시합니다. 이는 단일 모델의 긴 사고 사슬(CoT)을 넘어, 60개의 서브 에이전트와 분산 검색 과정을 통해 병렬 탐색-가지치기-결합-검증의 시스템적 접근 방식을 강조합니다. 특히 Lean과 같은 형식 검증 도구를 활용하여 결과물의 신뢰성을 확보하는 것이 핵심입니다.
핵심 포인트
- 단일 CoT 대신 코디네이터 + 스웜 + 검증기의 아키텍처가 필요하다.
- 분산 검색(Fan-out/Prune)은 복잡한 문제 해결의 최전선 패턴이다.
- Lean과 같은 형식 검증기는 AI 결과물의 신뢰성을 보장하는 필수 인프라다.
2026년 10월 5일, 공개되지 않은 Claude 빌드는 리만 제타 영점(Riemann zeta zeros)이 임계선(critical line) 상에 존재할 확률에 대한 수십 년 된 수론적 경계를 41.6%에서 67.2%로 끌어올렸습니다. 수학은 잠시 잊으십시오. 흥미로운 부분은 그 결과를 도출해낸 아키텍처인데, 이는 전 세계적으로 어려운 문제들이 어떻게 해결될지에 대한 청사진이기 때문입니다.
모델이 아닌 시스템
Anthropic의 연구 게시물에 따르면, 한 스태프 연구원이 모델에게 "비현실적인 도전"을 던졌습니다. 바로 리만 가설(Riemann hypothesis)에 실제로 도전해보라는 것이었습니다. Anthropic은 이를 해결하지 못했다고 솔직히 인정했습니다. 하지만 이 실행 과정에서 약 650가지의 서로 다른 수학적 접근 방식이 테스트되었고, 이는 60개의 서브 에이전트(subagents)를 통해 조정되었습니다. 살아남은 결과물은 Lean에 형식화되어 라인별로 기계 검증을 거쳤으며, 사내 수학자 두 명과 외부 전문가들의 검토를 받았습니다.
엔지니어의 관점에서 이 내용을 다시 읽어보십시오. 이것은 단순히 "매우 똑똑한 모델이 깊이 생각하는 것"이 아닙니다. 이것은 분산 검색 과정(distributed search process)입니다:
- 확장 (Fan out): 수백 가지 후보 접근 방식에 걸쳐 병렬 탐색을 생성합니다.
- 가지치기 (Prune): 실패한 방식을 초기에 제거하고 살아남은 것들만 유지합니다.
- 연결 (Stitch): 살아남은 스레드들을 하나의 일관된 결과로 결합합니다.
- 검증 (Verify): 출력물을 수작업으로 처리할 여지를 허용하지 않는 형식 검증기(formal checker)를 통해 실행합니다.
만약 여러분이 여전히 "하나의 모델, 하나의 긴 사고 사슬(one model, one long chain-of-thought)"을 구축하고 있다면, 여러분은 2024년을 위한 아키텍처를 설계하는 것입니다. 단일 컨텍스트 창으로는 너무 큰 문제에 대한 최전선 패턴은 이제 코디네이터 + 스웜(swarm) + 검증기입니다.
Lean이 핵심인 이유
대부분의 보도가 놓치고 있는 부분이 바로 여기에 있습니다. 이 결과가 일반적인 AI 수학 헤드라인과 다르게 나온 이유는 Lean 때문입니다. Lean은 모든 논리적 단계가 컴퓨터로 검사되도록 강제하는 오픈 소스 증명 보조 도구(proof assistant)입니다.
자연어 형태의 증명 개요는 미묘한 간극을 숨길 수 있습니다. OpenAI가 최근 발표한 722페이지짜리 논문을 면밀히 검토한 수학자들은 바로 이 문제를 지적했습니다. Lean 증명은 컴파일되거나, 아니면 아예 되지 않습니다. "검토자가 기분이 좋았는지"와 같은 변수는 존재하지 않습니다.
이것은 타입 체커(type checker) 비유입니다. 타입 체커는 '프로그래머를 믿어라'라는 것을 '컴파일된다'로 바꿨습니다. Lean은 '수학자를 믿거나' — 혹은 '모델을 믿는 것' — 을 같은 것으로 바꾸고 있습니다. 만약 여러분이 결과물이 중대한 영향을 미치는 에이전트를 구축하고 있다면, 기계가 검증할 수 있는 계층(verification layer) 없이 생성하는 것은 제품이 아니라 데모에 불과합니다.
다음 빌드를 위한 세 가지 시사점
인프라로서의 검증(Verification as infrastructure). 어떤 도메인이든, 스스로에게 물어보십시오. 나의 Lean은 무엇인가? 내 에이전트의 출력물과 사용자 사이에 놓이는 기계가 검증할 수 있는 계층은 무엇인가?
모놀리스보다 스웜(Swarms over monoliths). 하나의 컨텍스트 창에 맞지 않는 문제의 경우, 길게 생각하는 것보다 팬아웃-앤-프룬(fan-out-and-prune)이 더 효과적입니다.
스코어보드가 바뀌었다(The scoreboard moved). 코딩 벤치마크는 포화 상태에 이르렀고; 증명 검증은 곡선에 따라 점수를 매기지 않습니다. 느낌 기반의 채점 방식보다는 공식적인 참값(formal ground truth)을 가진 작업을 선호하십시오.
광범위하게 생성하고, 가차 없이 검증하며, 컴파일되는 것만 출시하십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기