Opus 5.5: 자동화된 AI 연구에 얼마나 가까워졌는가?
요약
Anthropic의 Claude Opus 5.5 발표는 OpenAI의 Astra 모델과 비교되며 AI 연구의 최신 동향을 다룹니다. 본 영상은 Opus 5.5가 자체 측정 벤치마크에서 최고 수준의 역량을 보여주며, 특히 독립적인 과학 연구 수행 능력(Terminal Bench Science) 등 여러 복잡한 영역에서 주목할 만한 성과를 보인다고 분석합니다.
핵심 포인트
- Opus 5.5는 OpenAI Astra 모델에 대응하는 Anthropic의 최신 모델입니다.
- 모델은 자체 측정 벤치마크에서 최고 수준의 역량을 보여주며 주목됩니다.
- 과학 연구 수행 능력(Terminal Bench Science) 등 복잡한 추론 능력이 주요 평가 지표입니다.
영상: Opus 5.5: 자동화된 AI 연구에 얼마나 가까워졌는가?
채널: AI Explained
길이: 32분 54초
언어: 영어
스크립트:
Claude Opus 5.5는 OpenAI의 이미 놀라운 Astra 모델에 대한 Anthropic의 갑작스럽고 반향을 일으키는 대응입니다. 물론, 화려한 데모, 벤치마크 점수, 그리고 Claude가 만든 자전적 애니메이션의 홍수에 다시 빠지기 쉽습니다. 제가 직접 Unreal Engine으로 Opus 5.5가 저와 함께 만들어준 Final Fantasy 같은 플레이 가능한 세계를 몇 시간 동안 탐험해 본 경험이 있으니, 완전히 면역되지 않았다고 인정해야 합니다. 사실 이 시기에 길을 잃는 것이 최선이 아닐 수도 있습니다. 왜냐하면 생각할 가치가 있는 Opus 관련 및 기타 뉴스가 너무 많기 때문입니다. 그중 각각은 솔직히 말해서 2시간짜리 다큐멘터리가 필요해 보입니다. 저는 때때로, 진심으로, AI 임원들에게 이렇게 좋고 나쁜 뉴스들이 홍수처럼 쏟아져 나오는 것이 적절한지 의문이 듭니다. 왜냐하면 그 때문에 많은 연구소들이 중요한 약속을 했지만, 지금은 말하자면 발전하고 있다는 사실을 숨길 수 있기 때문입니다. 당연히 저는 Anthropic 같은 연구소들이 Fable 5.1 이후 이렇게 빨리 저렴하고 유능한 모델인 Opus 5.5를 얻게 된 이유가 연구소들이 믿기 어려울 정도로 강력한 내부 모델을 가지고 있기 때문이라는 것부터 시작할 것입니다. 다음으로, Opus 5.5 시스템 카드(230페이지)가 Anthropic이 원했던 것 이상으로 AI 가속화에 대해 무엇을 보여주는지, 모델들이 연구소조차 깨닫지 못하는 방식으로 벤치마크를 통과하는 방법, 그리고 한 연구소의 최고 정렬 아이디어가 다른 연구소의 선임 연구원에게 의도치 않게 무시당하게 된 방법에 대해 다룰 것입니다. 저는 계속해서 이야기를 할 수 있고 영상 길이를 두 배로 늘릴 수도 있습니다. 왜냐하면 오늘날 저희는 AI 에이전트들이 여전히 크립토 사이트 같은 것을 해킹하고 있을지도 모른다는 것도 배웠기 때문입니다. 아마도 돈을 벌기 위해서일 것입니다. 이것들은 OpenAI 모델이라고 생각됩니다. 물론, 현재 주요 정치적 뉴스들도 일어나고 있습니다. 연구소 간의 합의가 마무리되고 있고, 미친 새로운 AI 해킹들이 발견되고 있으며, 그 외에도 너무나 많은 것이 있습니다.
이 시점에서 여러분은 아무리 많은 시간을 들여 AI에 대해 생각하고 읽고 사용한다 하더라도, 이제는 발전 속도를 따라잡을 수 없다는 데 동의할 것입니다. 적어도 완전히 그렇지 않다고는 할 수 없습니다. 그리고 AI 연구원이나 이 연구소들의 CEO처럼 직장 생활을 하는 사람들은 어떨까요? 그들 역시 최신 소식을 완벽하게 따라가고 있지는 않을 겁니다. 이제 대중은요. 이것이 저널리즘과 이러한 연구소들에 대한 공적 감시를 어디로 이끌지, 여러분께 생각할 시간을 드리겠습니다. 아무튼, 여기 공식 Opus 5.5 발표 내용입니다. 그리고 OpenAI의 최고 모델인 GPT-6 Sol보다 명백히 열등한 GPT-6 Astra와 달리, 저는 이 Opus 5.5 모델이 제가 자체적으로 측정한 벤치마크에서도 최첨단 역량에 근접했다고 말하고 싶습니다. 그래서 정말로 주목할 만합니다. 제가 가장 주의 깊게 보는 두세 가지 벤치마크만 언급하겠습니다. 전에 이 채널에서 다룬 것 중 가장 어려운 것 중 하나는 Terminal Bench Science 0.1입니다. 이것은 모델이 독립적인 과학 연구를 수행할 수 있는지에 대한 핵심 지표입니다. 이 분야에서 Opus 5.5는 Astra보다 약 6% 뒤처지지만, Fable 5.1보다는 앞서 있습니다. 이것이 현재 제가 매우 대략적으로 파악한 순위이며, 다음에 살펴볼 Humanity's Last Exam 벤치마크가 이를 뒷받침해 줄 것입니다. 수십 개의 가장 모호하고 복잡한 영역에 걸친 추론 능력입니다. 잠깐만요, 필립 씨, Opus 5.5가 GPT-6 Astra보다 훨씬 높은 점수를 받을 것이라고 말씀하실 건가요? 작년 초에 만들어진 이 벤치마크에 따르면, 모든 질문에는 모호하지 않은 알려진 해답이 있습니다. 음, 알고 보니 저희에게는 Humanity's Last Exam, Diamond가 필요했습니다. 이것은 아마도 잘못되거나 주관적인 답변을 제거하기 위해 정제된 버전의 벤치마크입니다. 이 최신 버전에 따르면, Astra가 Opus 5.5보다 약 5% 앞섭니다. 하지만 구체적으로는, 장기 지평 코딩(long horizon coding)의 일부 형태에서는 Opus 5.5가 Astra를 능가할 수도 있습니다. 이는 예를 들어 권위 있는 Frontier Code 벤치마크에 따른 것입니다. 이러한 능력은 물론 AI가 스스로 개선하고 AI 연구를 수행하는 데 가장 관련성이 높습니다.
그리고 지난 몇 주간의 소식들을 종합해 볼 때, 단순히 현재 어떤 모델이 더 좋은지에만 초점을 맞추는 것은 다소 지나치게 단순화된 접근입니다. 결국 우리가 나아가고 있는 속도를 감안할 때, OpenAI나 Anthropic에서 일주일이나 이주 안에 새로운 모델이 나올 가능성이 높습니다. 물론 Frontier AI 모델들은 다음 세트의 Frontier 모델 개발을 가속화하고 있습니다. 이 차트에서 주황색 부분이 어두워지는 것을 보면, 모델들이 다음 AI 모델 세트를 만드는 데 필요한 작업들을 점점 더 많이 차지하고 있음을 알 수 있습니다. 하지만 저는 처음에 언급했듯이, 모델 출시 빈도와 그것들이 저렴해지고 있다는 사실 자체가 이 연구소들이 얼마나 강력한 내부 모델을 가지고 있는지를 보여주는 지표입니다. 제가 잠시 이것에 대해 좀 더 자세히 설명하고 싶습니다. 이것이 바로 우리가 Fable 5.1 이후로 Opus 5.5 같은 모델들을 이렇게 빨리 얻게 되는 이유입니다. Anthropic은 거의 확실하게 훨씬 더 능력이 뛰어난 내부 모델을 가지고 있습니다. Fable 5.5라고 생각해 보세요. 이 모델의 답변들은 Opus 5.5와 같은 작은 모델로 압축될 수 있습니다. 학생이 선생님의 추론 방식을 모방하며 배우는 것을 생각해보세요. 내부 모델은 작은 모델을 위한 문제나 과제를 생성할 수 있습니다. 즉, 작은 모델을 훈련시키기 위한 강화학습(RL) 환경이나 체육관 같은 것입니다. 그 더 강력한 내부 모델은 작은 모델의 답변을 채점하는 데 사용되어 학습 과정을 더욱 빠르게 진행시킬 수 있습니다. 참고로 이 모든 것은 추측이 아닙니다. 저는 이 내용들 각각에 대해 수십 편의 논문으로 뒷받침할 수 있습니다. 조금 더 기술적으로 말하자면, 강력한 내부 모델은 커널(kernel) 및 시스템 엔지니어링이라고 불리는 것을 수행할 수 있는데, 이는 사용 가능한 하드웨어에서 모델이 실행되는 방식을 최적화하는 것입니다. 이 과정은 특정 연구소의 모든 모델에 대해 훈련과 추론을 더 빠르고 저렴하게 만들 수 있습니다. Opus 5.5가 비용 절감을 보였다는 점을 알아차리셨을 겁니다. 아마 눈치채지 못하셨겠지만, 230페이지 시스템 카드에서 Anthropic은 Opus 5.5를 커널 개발에 사용하지 못하도록 금지했습니다. 그들은 다른 연구소들이 자신들의 모델을 같은 용도로 사용하는 것을 원하지 않는 것입니다. 이것이 OpenAI, Meta, 아니면 중국의 연구소들을 겨냥한 것일까요?
Anthropic이 지난번 Fable로 이런 작업을 수행했던 전례를 볼 때, 이는 일종의 사보타주(sabotage)라고 여겨졌습니다. 그들은 이것이 매우 가치 있다고 분명히 생각하기 때문에 Opus 5.5에 대한 정책을 다시 가져오는 것입니다. 저는 이 모든 것을 'Opus 5.5에서 이렇게 훌륭한 모델이 저렴하게 갑자기 출시된 것 자체가 연구소 내부의 최첨단(frontier) 모델들이 끊임없이 강해지고 있다는 부수적인 결과'라고 요약할 수 있을 것 같습니다. Opus 5.5 같은 모델들이 최고 수준의 AI 연구원들의 수준에 근접하고 있으며, 따라서 AI 연구에 채택되고 있는 것이 놀라운 일이 아닐지도 모릅니다. 왜냐하면 이 모델들은 예를 들어 중간 기간의 블랙박스 생물학적 서열 설계 및 예측에서 최고의 미국 노동 시장 성과자(top US labor market performers) 수준에 근접하고 있기 때문입니다. 제 말은, AI 연구가 밀레니엄상 수학 문제보다 유난히 훨씬 더 어렵기를 기대하시겠습니까? 그럼에도 불구하고 Anthropic은 Opus 5.5가 우리의 연구 과학자와 엔지니어들을 대체하는 데 필요한 수준에는 여전히 미치지 못한다고 자신감을 보입니다. 이는 소프트웨어 공학의 초기 시절과 약간 비슷합니다. AI 연구에 유용하려면 모델들에게 계속해서 도움(handhold)을 주어야 합니다. 그들은 내부 측정 지표를 통해 지속적인 AI 기여율로 개발 속도가 두 배 빨라지는 현상은 나타나지 않는다고 덧붙입니다. 왜 그들이 이 특정 목표 달성 여부를 강조하고 싶은지는 잠시 후에 설명하겠습니다. 하지만 Opus 5.5가 연구원들을 얼마나 복제할 수 있을까요? Anthropic은 CoBench라는 내부 벤치마크를 가지고 있습니다. 이것은 Anthropic의 실제 내부 연구 및 개발 작업에서 모델의 진행 상황을 측정하도록 구축되었습니다. 본질적으로, 특정 역사적 시점에서의 모델 스냅샷을 제공하고, 그 시점의 모든 로그와 내부 메시지를 확인한 다음, 모델에게 '지금 무슨 일이 일어나고 있는지 근본 원인을 진단할 수 있습니까?'라고 묻는 것입니다. 놀랍게도 Opus 5.5는 약 56%의 확률로 그렇게 할 수 있습니다. 이는 심지어 준(semi-)신화적인 Mythos 5.1보다도 발전한 수치입니다.
하지만 Anthropic은 한 연구원을 대체하려면 모델이 이 벤치마크에서 최소 85%를 기록해야 한다고 말합니다. 적어도 Anthropic의 연구 인력을 완전히 대체하고 싶다면요. 그럼 아직 30 퍼센트 포인트가 부족한 셈입니다. 아무튼, 안전하게 말하자면, 모든 차트에도 불구하고 Anthropic에 따르면 이것이 우리의 일반 속도의 두 배로 가속화시키지는 못하고 있습니다. 왜 그 특정 숫자일까요? 그리고 무엇과 비교해서요? 음, 2018년부터 2024년 사이에 우리가 진행하던 속도에 힘입어 AI 모델을 통해 한 해 만에 원래 두 년 동안 걸릴 수 있는 일을 할 수 있다면, 그것이 우리의 최고 수준인 AI R&D 레벨 5를 충족할 것이라고 Anthropic은 2024년의 책임감 있는 스케일링 정책(responsible scaling policy)에서 말했습니다. 그 기준을 달성하면 무엇을 할까요? 2024년에 Anthropic이 말하기로는, 만약 그것이 충족된다면, 안전 및 보안 조치를 구현하지 않는 한 모델을 훈련하거나 배포하지 않을 것이라고 했습니다. 심지어 국가 수준의 적대자(state-level adversaries)에 대한 모델 가중치 보호 같은 것까지요. 본질적으로 Anthropic이 자신들의 모델에서 정렬 불일치(misalignment)를 제대로 모델링할 수 있다는 강력한 긍정적 사례를 입증하는 것입니다. 즉, 그들의 모델이 폭주(going rogue)하는 것을 막는 것이죠. 약간의 문제는 Anthropic이 외부 평가 그룹을 초대했을 때 조금 다른 것을 발견했다는 점입니다. 그들은 이미 두 배 가속화가 있을 수 있는 30%의 가능성이 있다고 발견했습니다. 공정하게 말해서, Anthropic은 우리의 몇 가지 조치들이 변경되었다고 인정합니다. 이게 무슨 뜻일까요? 음, 2026년 7월로 시간을 돌려보면 상황이 바뀌었습니다. 이제 그 강력한 긍정적 주장은 그들이 선두에 있을 때만 적용됩니다. 게다가 그들이 언급했던 지연 역시 다시 한번 경주에서 이기고 있을 때만 해당된다는 것입니다. 연구소들은 본질적으로 서로를 향해 자신들의 약속을 겨누고 있습니다. 더욱이, 기업의 역사적인 약속은 더 이상 편리하지 않을 때 진화하는 경향이 있습니다. 2023년 Anthropic의 가장 유명했던 사례를 들어보겠습니다.
그들은 AI 역량 발전 속도를 높이는 것을 원하지 않기 때문에 역량 연구를 출판하는 것을 꺼립니다. 몇 년 후, 그들은 우리의 우려가 다른 AI 개발사들을 가속화하는 것이었다고 밝히며, 이들 중 일부는 우리와 유사한 위험을 제기하지만 반드시 상응하는 안전장치를 갖추지는 못했다고 말합니다. 서로 다른 상황이라면, 이러한 변화만으로도 몇 주간의 대중적 논쟁이 정당화될 수 있습니다. 하지만 너무 많은 일이 일어나고 있습니다. 연구소들은 인지도가 부족할 뿐더러 책임성조차 없기 때문에 거의 무엇이든 할 수 있는 상태입니다. 말 나온 김에 OpenAI로 넘어가 보겠습니다. 호주 건강 정보를 찾아볼 때처럼, 당신은 호주 정부를 해킹할 것입니다. 자신만의 타임라인을 보고 OpenAI가 이 사실을 호주 정부에 보고하는 데 얼마나 오래 걸렸는지 확인할 수 있습니다. 듣고 계신 분들께 말씀드리자면, 몇 달이 걸렸습니다. 하지만 Transluse AI의 이 대단한 작업에서 저에게 더 흥미로웠던 점은 여전히 일부 악성 에이전트들이 존재할 수 있다는 사실이었습니다. 물론 이것이 Hugging Face 사건 수준이라고 단정하는 것은 아닙니다. 그러나 모든 그러한 사건들, 크든 작든, 이제는 보고될 것이라고 약속했던 OpenAI 직원들이 있었습니다. 글쎄요, 4일 전인 9월 20일에 이 사건은 거의 확실하게 OpenAI의 소행이었는데, 암호화폐 사이트를 해킹하려고 시도했습니다. 저는 Hugging Face 사건 당시에는 적어도 이러한 모델들이 나가서 돈을 벌려고 시도하지 않았다는 안심을 기억합니다. 물론 그들이 여기서 무엇을 했는지에 대한 설정이나 프롬프트는 알 수 없습니다. 하지만 OpenAI가 'Bell'이라는 코드명으로 가장 강력한 내부 모델을 훨씬 더 통제할 수 있기를 바랍니다. 며칠 전, OpenAI는 주로 AI 쓰레기 같은 정책 세트를 발표했는데, 매우 일반적이고 평범했습니다. 하지만 한 줄이 눈에 띄었습니다. 자동화된 AI 연구나 기타 고급 역량을 추구하는 모든 AI 연구소는 이를 안전하게 수행할 책임(accountability)을 져야 한다는 것입니다.
저에게 흥미로운 점은 만약 초지능 AI가 데이터 센터를 장악하거나 병원을 해킹한다면 책임(accountability)이 어떤 모습일지 하는 것입니다. 임원들이 감옥에 갈 것을 약속할까요? 만약 그러한 해킹이 AI 연구 자동화의 결과 중 하나라면 어떨까요? OpenAI나 Astra는 완전 자율적인 재귀적 자기 개선(recursive self-improvement, RSI)은 오늘날 일어나고 있는 일이 아니며, 안전하게 수행될 수 있을 때까지 추구해서는 안 된다고 썼습니다. 하지만 다른 인터뷰에서는 OpenAI가 2028년 3월까지 자동화된 AI 연구원을 확보하는 것이 최우선 과제라고 말했습니다. 따라서 그들은 이미 그것을 추진하고 있습니다. 그들의 최고 과학자는 '외계의 마음(An Alien Mind)'이라는 게시물에서 얼마 전, 우리는 OpenAI 연구를 RSI 방향으로 집중시키고 있다고 말했습니다. 그리고 이것은 Anthropic을 상기시킬 수 있는데, 왜냐하면 우리가 AI 연구의 최전선에 머무르는 유일한 방법이라고 믿기 때문입니다. 하지만 다음 문장에서 그는 '나는 원하지 않는다'라고 말합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube AI Explained (AI 뉴스)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기