Google이 지능 폭발을 촉발했나?
요약
본 기사는 AI의 재귀적 자기개선(RSI) 개념을 다루며, AI가 스스로 개선하는 과정을 탐구합니다. Google DeepMind와 University of Maryland는 'Wet Dream RSI' 논문을 통해 모델 자체를 건드리지 않고도 발견 능력을 향상시키는 방법을 제시했습니다. 이는 에이전트의 탐색 정책을 과거 실행 기록(discovery logs)에 기반하여 테스트하고 최적화하는 방식입니다.
핵심 포인트
- AI가 스스로 개선하는 'RSI' 개념과 그 중요성을 다룸.
- DeepMind는 모델 수정 없이도 발견 능력을 향상시키는 방법을 제시함.
- 핵심은 에이전트의 탐색 정책(exploration policy)을 최적화하는 것임.
- 과거 실행 기록(discovery logs)을 활용하여 다양한 정책 테스트가 가능해짐.
1965년, 제2차 세계대전 중 블레츨리 파크에서 게이 아란 튜링과 함께 나치와 싸웠던 영국 수학자 I.J. Good은 최초의 초지능 기계는 인류가 만들 필요가 없는 마지막 발명품이 될 것이라고 썼습니다. 왜냐하면 AI가 스스로를 개선할 만큼 충분히 좋아지면, 모든 개선이 그것을 개선하는 능력을 더 좋게 만들고, 그 개선 능력이 다시 더 좋은 개선 능력을 만들어내기 때문입니다. 이것은 RSI(재귀적 자기개선)라고 불리며, AI 연구자들의 오랜 꿈이었습니다. 지난주에는 ByteDance, Tsinghua 및 몇몇 다른 중국 실험실의 33명의 연구자들이 'The Last AI Built by Humans'라는 논문을 발표했습니다.
그들은 최종 단계에서 AI가 스스로를 개선하는 데 사용했던 과정을 재작성하는 다섯 단계 로드맵을 제시했으며, 이 경우 우리 모두는 농업 노동을 위해 시골로 재배치될 것이라고 했습니다. 그러자 일요일에 Google DeepMind와 University of Maryland가 'Wet Dream RSI'라는 유사한 논문을 발표하며 대응했습니다. 그들은 AI의 오래된 발견 기록(discovery logs)을 시뮬레이터로 변환하고 그 안에서 수천 개의 새로운 검색 전략을 꿈꾸게 함으로써, 모델 자체를 아무도 건드리지 않고도 AI가 무언가를 발견하는 능력이 향상되었다고 주장합니다.
오늘 영상에서는 Dream RSI가 내부적으로 어떻게 작동하는지 분석하고, 에이전트가 스스로의 탐색 정책(exploration policy)을 재작성할 수 있는 것이 실제로 RSI인지 아니면 단순한 과장된 허풍(hype slop)에 불과한지 판단해 보겠습니다. 지금은 2026년 9월 17일이며, 여러분은 The Code Report를 시청하고 있습니다. AI가 수학적 돌파구를 이룰 때마다 그 과정은 작년에 Alpha Evolve가 대중화했던 것과 동일했습니다. 코딩 에이전트에게 문제와 점수 함수(scoring function)를 주고, 그것이 해결책을 제안하고, 평가하고, 피드백을 읽고, 수천 번 동안 다시 시도하는 루프를 실행하는 것입니다.
이 과정은 이번 여름에 Jacobian conjecture를 발견했고, OpenAI가 이달 초 Navier-Stokes 문제를 선점하는 데 사용한 것이기도 합니다. 하지만 이 과정에서 가장 흥미로운 부분은 아무도 제대로 이야기하지 않는 '탐색 정책(exploration policy)'이라는 것입니다. 그 아이디어는 루프의 매 단계마다 에이전트가 다음에 무엇을 시도할지에 대한 결정을 내려야 한다는 것입니다. 예를 들어, 루프가 말들의 매칭 알고리즘을 최적화한다고 가정해 봅시다. 한 번의 시도가 다른 시도보다 말이 조금 더 잘 짝지어 준다면, 에이전트는 그것을 계속 발전시켜 나갈까요, 아니면 더 좋을 수 있는 무언가로 처음부터 다시 시작할까요?
만약 어떤 시도가 말 한 마리도 매칭되지 못한 채 실패한다면, 전체 아이디어가 잘못된 것일까요, 아니면 단지 구현 방식이 잘못된 것일까요? 이번 주까지 이 탐색 정책은 설계를 맡은 누군가에 의해 루프에 하드 코딩되어 있었습니다. 하지만 DeepMind 팀이 알아낸 것은 모든 시도에서 나온 결과물(작성한 코드, 얻은 점수, 실패 여부 등)을 저장해 두면, 새로운 정책을 테스트하기 위해 실제로 모델을 다시 건드릴 필요가 없다는 것입니다. 단지 새 정책에게 디스크에 캐시된 이전 실행 기록들을 보여주고 거기서부터 어디로 나아갈지 결정하게 할 수 있습니다.
그리고 이것은 비용이 들지 않기 때문에, 에이전트는 동일한 실행 기록에 대해 수천 가지의 다른 정책을 테스트할 수 있고, 그중 가장 적은 시도로 최고의 결과를 달성했을 정책을 유지합니다. 그런 다음 그 정책을 다음 실행에 배포하고, 그 실행 기록도 저장한 후 이 과정을 반복합니다. 논문에서는 이 과정을 '꿈꾸기(dreaming)'라고 부르며, 이를 테스트하기 위해 Gemini를 알고리즘 설계와 수학 전반에 걸친 여덟 가지 다른 문제에 겨냥했고, 고정된 정책으로 동일한 설정을 실행하여 꿈꾸는 버전이 그것을 능가할 수 있는지 확인했습니다.
TMBB에 대해서는 지루하게 설명하지 않겠습니다만, 가장 인상적이었던 것은 라쏘(lasso) 솔버를 작성한 것이었습니다. 이 솔버는 파이썬의 머신러닝 라이브러리를 약 300번 만에 능가했는데, 정적 정책은 550번을 필요로 했고, 이전 기록 보유자는 약 51,000번을 필요로 했습니다. 그리고 우리가 지옥에 살고 있기 때문에 가장 흥미로운 부분은 프롬프트였습니다. 이 프롬프트는 기본적으로 에이전트에게 코드를 작성하기 전에 모든 과거 시도를 읽어보라고 간청합니다. 같은 아이디어를 반복해서 사소하게 수정하는 것을 멈추고, 어떤 프로세스도 종료시키지 않겠다고 약속하라고 말했습니다.
그래서, 이 모든 것이 실제로 RSI(Recursion-based Improvement)일까요? I.J. Good의 정의에 따르면 아닙니다. 왜냐하면 핵심은 개선을 수행하는 대상 자체가 매 라운드마다 더 똑똑해진다는 점이기 때문입니다. 이 경우, 새로운 탐색 정책을 작성하는 모델은 여전히 동일한 Gemini이므로, 자신이 이미 작성할 수 없는 해답을 절대 찾을 수 없습니다. 단지 그것들을 더 빠르고 낭비되는 시도 없이 찾아낼 뿐입니다. 하지만 그렇다고 해도, 이것은 올해 우리가 경험한 모든 AI 수학적 돌파구에도 해당됩니다. 자코비안 추측(Jacobian conjecture), 나비에-스토크스 방정식(Navier-Stokes), 그리고 리만 가설(Riemann hypothesis)에 대한 진전 모두 커스텀 하네스 안에 갇힌 정적 모델에서 나왔으며, 서브 에이전트(sub-agents), 스웜(swarms), 오케스트레이션(orchestration)이 대부분의 무거운 작업을 수행했습니다.
그리고 가중치(weights)는 인간이 돌아와서 스웜이 발견한 것을 가지고 다음 모델을 훈련할 때만 더 좋아집니다. 만약 당신이 I.J.에게 버섯을 주고, 루프 내에 있는 인간이 여전히 중요하다는 것을 설득한다면, 그는 이것이 인류가 만들 필요가 없는 마지막 발명품이라고 동의할 수도 있을 것입니다. 하지만 그가 정신을 차리면, 그것은 단지 캐싱(caching)이 적용된 멋진 검색 알고리즘일 뿐이라고 주장할 가능성이 높습니다. 그래서 오늘 영상의 스폰서인 Blacksmith를 확인해 보셔야 합니다. 이것은 GitHub runners의 드롭인 대체품으로, 비용은 75% 절감하면서 GitHub actions을 두 배 빠르게 실행할 수 있게 해줍니다.
그리고 그들은 여러분의 레포지토리와 CI 실행 과정을 파악하는 클라우드 코딩 에이전트인 Code Smith를 출시했습니다. 따라서 제가 지금 하고 있는 것처럼 GitHub, 웹 또는 Slack에서 무언가를 만들도록 요청할 수 있습니다. 저는 이 앱에 새로운 AI 프로바이더를 추가하고 인프라 레포지토리에 API 키를 연결하도록 요청합니다. 그리고 그것은 각각의 PR을 열고, 실패하는 테스트를 수정하거나 봇 간 메시지에 의존하지 않고 리뷰 코멘트를 처리할 수 있습니다. 또한 CI 기록에 대해 더 나은 러너(runner) 크기를 추천해 달라고 요청하고, 그 변경 사항들을 풀 리퀘스트(pull request)로 만들어 여러분이 세미콜론을 확인하기 위해 슈퍼컴퓨터를 임대하는 상황을 막을 수도 있습니다.
아래 링크에서 무료로 사용해 보고 3,000 GitHub Actions 분을 받으세요. 이것은 Code Report였습니다. 시청해주셔서 감사드리며 다음 영상에서 뵙겠습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube Fireship (개발 트렌드)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기