ICML에서 논문 2,200편을 재현하며 배운 점
요약
본 게시물은 ICML 2026 오픈 재현(Open Reproductions) 챌린지 결과를 공유하며, AI 연구의 재현 가능성과 학회 심사 시스템에 대한 통찰을 제공합니다. 대규모 에이전트 기반 재현 시도는 많은 논문의 주장이 독립적으로 검증되거나 거짓임이 밝혀졌습니다.
핵심 포인트
- 대규모 오픈 재현 챌린지를 통해 AI 연구의 재현 가능성을 검증했습니다.
- 검토된 논문의 51%는 최소한 하나의 주장이 독립적으로 검증되었습니다.
- 23%의 논문에서는 주장 중 거짓이거나 이의가 제기되는 부분이 발견되었습니다.
- Claude Code, Codex 같은 에이전트들이 연구 재현 및 분석 속도를 혁신적으로 높였습니다.
Reproduction: Learning-Augmented Paging에서의 최적 강건성 향상
대화형 로그북에서 프로젝트 로그, 코드 및 추적 기록을 탐색해 보세요.
이 게시물에서는 저희가 이 해커톤을 진행하며 배운 점과, 에이전트들이 연구 실험을 수행할 때 인간의 역할에 대해 시사하는 바를 공유합니다.
AI 연구가 실제로 얼마나 재현 가능한지에 대한 질문은 현재 AI 물결보다 오래되었습니다. 하지만 이러한 질문들은 규모(scale) 때문에 더욱 심화되고 있습니다. ICML 2026에서는 23,918건의 제출과 6,352편의 논문이 채택되었는데, 이는 전년 대비 약 두 배에 달하며, AI 에이전트들이 실험을 수행하고 이를 작성하는 과정을 더 빠르게 만들어 이 현상에 부분적으로 기여한 지수적 추세를 이어가고 있습니다.
심사 역량은 그만큼 증가하지 않았습니다. 대부분의 학회 심사위원들은 자원봉사자이며, 논문을 완전히 검토할 시간이나 전문 지식을 갖추지 못하는 경우가 많습니다. 여기는 한 ICML 2026 스포트라이트 논문의 리뷰를 심사위원이 직접 작성한 내용입니다:
"제가 낮은 신뢰 점수를 준 이유는 모든 증명을 주의 깊게 확인하지 않았기 때문입니다."
이 논문은 높은 점수와 스포트라이트를 받았다는 점에 주목하세요. 왜냐하면 이 논문을 나중에 게시물에서 다시 다룰 것이고, 우리가 마침내 증명들을 주의 깊게 확인했을 때 무슨 일이 일어났는지 보여드릴 것이기 때문입니다.
하지만 바뀐 점은, 제출 폭주를 야기하는 동일한 기술이 우리에게 이를 따라잡는 데 도움을 줄 수 있다는 것입니다. Claude Code, Codex, Cursor, Pi와 같은 코딩 에이전트들은 이제 논문을 읽고, 코드를 작성하며, 실험을 실행하고, 발견한 내용을 보고할 수 있습니다. 논문을 주의 깊게 확인하는 것은 과거에는 심사위원에게 주말 전체를 소요하게 했지만, 에이전트는 이를 오후에, 병렬적으로, 수천 번 시도할 수 있습니다.
그래서 저희가 묻고 싶었던 질문은 다음과 같습니다: 만약 우리가 실제로 주요 학회를 대규모로 재검토하고 모든 논문을 재현하려고 시도한다면, 무엇을 발견하게 될까요?
저희가 직접 논문을 검토하는 대신, 모든 에이전트 프레임워크의 다양성, 컴퓨팅 예산, 그리고 과학적 취향을 끌어들여 전체 커뮤니티에 공개했습니다. 2026년 7월 15일부터 8월 2일까지 진행된 ICML 2026 오픈 재현(Open Reproductions) 챌린지는 다음과 같이 작동했습니다:
orx
그리고 그 사이의 모든 것들. 저희는 에이전트가 단일 명령으로 논문, 해당 주장의 내용, 그리고 챌린지 지침을 가져올 수 있도록 간소화된 인터페이스를 제공했습니다. 참가자들은 HF Jobs에서 실험을 실행하기 위해 Hugging Face 컴퓨팅 크레딧 $20를 받았으며; 챌린지 기간 동안 참가자들은 총 2,962개의 클라우드 작업을 시작했습니다. 예를 들어 논문의 데이터셋이 독점적이거나 체크포인트가 공개되지 않아 완전한 재현이 불가능했던 경우에는, 참가자들이 원본의 속성을 모방하는 합성 데이터를 이용해 장난감 수준의 재현(toy reproductions)을 수행했습니다.
완성된 재현 결과는 다음과 같습니다:
수치로 볼 때, 이 해커톤은 과학 컨퍼런스에서 시도된 가장 큰 규모의 재현 작업이었을 것입니다:
논문별 주장 수준 판결 취합:
검토된 논문의 51%(1,103편)는 최소한 하나의 주장이 독립적으로 검증되었습니다. 이 중 266편은 추출된 모든 주장이 검증되면서 완전하게 재현되었고, 632편은 아무것도 거짓으로 판명되지 않으면서 부분적으로 재현되었습니다. 총 3,978개의 개별 주장이 실제 실험을 통해 확인되었습니다.
검토된 논문의 23%(496편)는 최소한 하나의 주장이 거짓이거나 이의가 제기되었습니다. 여기에는 모든 주장이 거짓으로 판명되어 아무것도 검증할 수 없었던 49편과, 어쩌면 가장 흥미로운 부분일지 모르는 점은, 독립적인 재현 팀들이 동일한 주장들에 대해 반대 판결을 내린 242편이 포함됩니다. 재현 가능성은 이분법적이지 않습니다. 그것은 적대적(adversarial)입니다.
나머지는 중간에 머물렀습니다: 장난감 규모의 증거만 있는 502편, 그리고 어느 쪽으로도 아무것도 확립할 수 없었던 280편(가장 흔한 원인은 누락된 아티팩트였습니다).
일부 논문들은 이 과정을 거쳐 멋지게 통과했으며, 커뮤니티의 최고의 로그북은 그 자체로 읽을 가치가 있습니다:
참가자 35명이 자신이 무언가를 조작했다고 공식적으로 주장했습니다. 우리는 이 주장이 제기된 모든 위조 사례를 적대적(adversarial)으로 재검증했습니다. 검증 과정은 논문을 다시 읽고, 기록부(logbook)를 다시 읽으며, 수학 공식을 다시 유도하거나 논문 자체의 텍스트로부터 실험을 재구현하는 방식으로 이루어졌습니다.
확인된 몇 가지 위조 사례와 이를 발견한 기록부를 연결하여 설명합니다:
서론 부분의 페이징 논문. 증명을 주의 깊게 확인하지 않은 리뷰어? "Towards Optimal Robustness in Learning-Augmented Paging"이라는 제목의 이 논문은 자체 알고리즘이 강건성(robustness)을 달성한다고 주장합니다. 한 참가자의 기록부는 가산 항(additive term)이 X와 같이 증가하는 것을 측정했으며, 증명이 깨지는 정확한 단계를 찾아냈습니다. 저희가 직접 재구현하여 스윕(sweep) 범위를 k = 1,024까지 확장했고, 약 나인 시그마(nine sigma) 수준에서 그 증가를 확인했습니다. 실제 강건성은 Y입니다.
단계 224 이후에 발생하는 정리. "Attention's forward pass and Frank-Wolfe"는 토큰 입자(token particles)가 원점(origin)이 자신의 볼록 껍질(convex hull) 내부에 있을 때 언제나 원점으로 수렴한다는 것을 증명합니다. 세 개의 독립적인 팀이 반례를 발견했는데, 위반은 각각 t = 224, ~3,800, 그리고 6,416 단계에서 처음 나타났습니다. 이는 다른 모든 사람들이 해당 주장을 "검증"한 이유를 명확하게 설명해줍니다: 유한 범위(finite-horizon) 검사는 너무 일찍 중단되기 때문입니다. 가장 깔끔한 반례는 정확한 유리수 산술(exact rational arithmetic)로 제시되어 있어 숨길 수 있는 부동 소수점 모호성(floating-point ambiguity)이 없습니다. 저자들은 같은 날 이를 확인하고 수정 작업에 착수했습니다.
하나의 손실 함수를 위해 작성된 이론, 다른 방식으로 도출된 결과. "Self-Distillation Enables Continual Learning" 논문은 중심 방정식과 전체 이론 섹션에서 역(reverse) KL 발산(KL divergence)을 분석하지만, 저자들이 모든 논문의 결과를 도출했다고 밝힌 공개 코드의 기본값은 순방향(forward) KL을 계산합니다. 이를 포착한 기록부는 또한 저자들 자신의 코드와 데이터로는 해당 논문의 주요 결과인 +4pp를 재현하는 데 실패했습니다. 저자들은 이미 arXiv에 수정된 버전을 업로드했습니다.
패딩으로 희석된 평가 결과. "Do Transformers Need Three Projections?"라는 논문에서 한 참가자는 평가된 레이블 위치의 약 66%가 EOS 패딩 토큰(padding tokens)이며, 이 토큰들이 거의 제로에 가까운 손실을 학습하여 퍼플렉서티(perplexity)를 대략 세 분의 일 수준으로 떨어뜨린다는 것을 발견했습니다. 초록에서 언급된 "캐시 감소 50%에 대한 품질 비용 3.1%"는 수정 후 약 9.4%가 됩니다.
🚨 잘못된 반증. 때때로 우리는 시도된 재현 과정에서 결함을 발견했습니다. 한 로그북에는 "해당 논문의 방법론이 기준선(baseline)보다 2배 느리다"고 극적으로 주장했지만, 이는 재현 과정에서의 산술적 오류였습니다. 즉, 트래젝토리별 시간과 배치 크기 50개 단위의 시간을 비교한 것이었습니다. 올바르게 정규화하자, 참가자 자신의 데이터는 논문이 주장하는 8배 속도 향상을 확인해 주었습니다.
우리는 모든 확인된 발견 사항에 대해 저자들에게 글을 쓰기 시작했으며, 간단한 틀로 접근했습니다. "저희가 무엇을 발견했는지, 여기에 모든 증거가 있습니다. 동의하시나요, 아니면 저희 분석이 잘못되었나요?" 초기 반응은 매우 긍정적이었습니다.
현재까지 저자들은 여러 논문에서 발견 사항을 확인해 주었으며, 두 건의 arXiv 수정본이 진행 중이고, 한 경우에는 도전 과제가 이 오류를 발견하기 한 달 전에 저자가 조용히 새로운 arXiv 버전에서 오류를 수정한 사례가 있었습니다. 이는 저희가 독립적인 합의(convergence)로 계산합니다 🤗
이 해커톤이 제기하는 가장 흥미로운 질문은 다음과 같습니다: 인간은 여전히 논문 검토에 역할을 할까요? 우리는 몇 가지 이유 때문에 그렇다고 생각합니다.
순수 에이전트 실행은 실제 한계에 부딪힌다. 에이전트들은 국소 루프(local loops)에 빠지거나, 규모 의존적 행동(scale-dependent behavior)을 잘못 읽었습니다 (페이지잉 논문에서 나온 여러 "검증된" 판결 중 일부는 로그-k 성장이 눈에 띄기 전에 멈춘 검사에서 비롯되었습니다). 또한 때로는 단위 불일치(units mismatch)를 기반으로 전체적인 반증 구조를 만들어내기도 했습니다. 이 도전 과제에서 가장 신뢰할 수 있는 결과들은 인간이 주도하는 워크플로우에서 나왔습니다: 에이전트에게 재지정하거나, 가정을 질문하거나, 또는 일주일간의 컴퓨팅 자원을 소모하기 전에 실험의 전제가 잘못되었다고 판단한 경우였습니다.
현재로서는 일부 평가는 본질적으로 인간의 영역입니다. 현재 가장 명확한 예시가 바로 사람이 개입하는 방식(human-in-the-loop)으로 진행된 우승 사례입니다. 해당 논문은 극단적인 양자화(quantization) 조건에서도 안정적인 이미지 생성을 주장했습니다. 수치적 지표는 "붕괴 없음(no collapse)"이라고 말했지만, 이미지가 실제로 사용 가능한지 여부는 인식론적 질문이었습니다. 참가자는 목적에 맞게 제작된 검토 UI를 구축했고, 한 사람이 128쌍의 모든 이미지를 직접 평가했으며, 주석은 저장소(repo)에 커밋되었고 이후 에이전트가 그 일관성을 검증했습니다. 공개된 에이전트 추적 기록에는 참여자가 검토 도구가 어떻게 작동하는지 질문하고 돌아와 "쌍들을 검토하여 csv 파일을 저장소에 넣었으니 확인해 주세요"라고 말하는 순간까지 전체 교환 과정이 담겨 있습니다.
그렇다면 우리 인간 심사위원의 역할은 무엇일까요? 저희는 그것이 지능을 효과적으로 관리하는 것이라고 생각합니다. 마치 교수나 책임 연구원(PI, Principal Investigator)이 대학원생들이 좋은 성과를 낼 수 있는 환경—컴퓨팅 자원, 도구, 데이터 접근성, 그리고 적절한 순간의 목표 지향적 피드백—을 설정해 주는 것과 같습니다. 에이전트로부터 가장 많은 것을 얻은 참가자들은 올바른 환경을 구축하고 올바른 질문을 던진 후, 에이전트가 실행하도록 맡긴 사람들이었습니다.
참여한 1,221명, 우승자들, 품위 있게 응답해 준 저자들, 그리고 Hugging Face와 alphaXiv의 주최진 여러분께 감사드립니다. 이 도전 과제에서 나온 모든 로그북, 평결, 추적 기록 및 결과물은 도전 공간(challenge Space)부터 공개됩니다. 저희는 이것이 현재까지 가장 크고 개방적인, 주장별 감사를 거친 머신러닝 학회 사례라고 생각하며, 이 기록을 오래 유지하고 싶지 않습니다.
향후 재현 이벤트에 많은 관심을 부탁드립니다. 🤗
상호작용 로그북에서 프로젝트 로그, 코드 및 추적 기록 탐색하기
당신의 에이전트로 모든 ICML 2026 논문 재현하기
상호작용 작업 공간에서 프로젝트 로그 및 추적 기록 탐색하기
웹 대시보드에서 코드 로그, 추적 기록 및 작업 공간 탐색하기
웹 UI에서 실험 로그, 코드 및 추적 기록 탐색하기
프로젝트 로그를 탐색하고 AI 에이전트를 초대하여 협업시키기
웹 인터페이스에서 실험 로그를 탐색하고 관리하세요.
상호작용적인 로그북으로 코드, 추적(traces), 작업 공간을 탐색할 수 있습니다.
이러한 도구를 사용하여 ICML에 채택된 논문 중 하나를 재현해 본 것은 흥미로웠습니다.
이번 해커톤의 분석은 특히 통찰력이 있었으며, 에이전트 기반 재현성은 ML 컨퍼런스에서 주장의 신뢰도를 높이는 사실상의 표준이 될 잠재력을 가지고 있습니다. 또한 이는 자율적인 과학적 발견을 개선하기 위한 가치 있는 경로가 될 수 있으며, 에이전트가 성공한 지점뿐만 아니라 실패한 지점도 밝혀내어 그 한계와 인간-에이전트 협업을 어떻게 개선할 수 있는지에 대한 중요한 통찰력을 제공합니다.
정말 마음에 듭니다.
저는 규모는 다르지만 보완적인 실험을 https://ReproducibleAIList.org에서 진행해 왔습니다. 저희는 Chip Huyen의 GoodAIList.com에서 모델들을 가져와 코드 저장소(논문이 아닌)를 사용하여 클린룸 에이전트가 각각의 모델을 처음부터 재현하도록 시도하고 있습니다.
한 가지 다른 점은 모든 시도가 roar (python 패키지 roar-cli) 하에서 실행된다는 것입니다. 이는 Trackio나 W&B와 같은 코드 계측(instrumentation)에 의존하기보다는 출처(provenance)를 수동으로 포착합니다. 이를 통해 저희는 코드, 데이터, 환경 및 아티팩트의 실제 계보를 얻고, AI-BOM과 다른 사람이 독립적으로 반복할 수 있는 roar reproduce 경로를 자동으로 생성합니다.
관련 내용을 비교해 보고 싶습니다.
이번 실험에 참여하게 되어 정말 즐거웠습니다. 저희의 재현 결과가 커뮤니티 최고의 성과 중 하나로 조명되는 것을 보니 보람을 느꼈습니다.
'A Coin Flip for Safety'는 AlphaXiv의 OpenResearch와 OpenCode의 무료 BigPickle 모델을 사용하여, 2× NVIDIA RTX 3090에서 로컬로 실험이 진행되면서 재현되었습니다.
이는 에이전트 지원 연구가 비교적 적은 컴퓨팅 자원으로도 독립적인 재현과 감사(auditing)를 어떻게 가능하게 하는지에 대한 훌륭한 시연이었습니다.
Hugging Face와 AlphaXiv 팀에게 챌린지를 조직하고 전체 과정을 개방적이고 재현 가능하도록 만들어 주셔서 감사합니다!
이번 실험에 참여하게 되어 정말 즐거웠습니다. 저희의 재현 결과가 커뮤니티 최고의 사례 중 하나로 조명된 것을 보니 보람을 느꼈습니다.
'A Coin Flip for Safety'는 AlphaXiv의 OpenResearch와 OpenCode의 무료 BigPickle 모델을 사용하여, 2개의 NVIDIA RTX 3090에서 로컬로 실험을 진행하며 재현했습니다.
이는 에이전트 지원 연구가 비교적 적은 컴퓨팅 자원으로도 독립적인 재현 및 감사(auditing)를 어떻게 가능하게 하는지 보여주는 훌륭한 시연이었습니다.
챌린지를 조직하고 전체 과정을 개방적이고 재현 가능하게 만들어 준 Hugging Face와 AlphaXiv 팀에 감사드립니다!
다른 한 가지 차이점은, 모든 시도가 roar(python 패키지 roar-cli) 하에서 실행된다는 것입니다. 이는 Trackio나 W&B 같은 코드 계측(instrumentation)에 의존하기보다 출처(provenance)를 수동으로 포착합니다. 이를 통해 저희는 코드, 데이터, 환경 및 아티팩트의 실제 계보(lineage)를 얻을 수 있으며, 자동으로 AI-BOM과 다른 사람들이 독립적으로 반복할 수 있는 roar 재현 경로를 생성합니다.
이러한 도구들을 사용하여 ICML에 채택된 논문 중 하나를 재현하는 것은 흥미로웠습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hugging Face Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기