GPT-6 Astra: OpenAI마저 우려할 만큼 뛰어난 성능
요약
GPT-6 Astra는 단순한 모델을 넘어선 인상적인 추론 능력을 보여주며, OpenAI 내부에서도 우려할 만큼 뛰어난 성능을 자랑합니다. 이 영상은 Anthropic의 Claude Fable 5.1 등 경쟁 모델과의 비교를 통해 Astra의 강점을 입증하며, 과학적 데이터 분석 및 복잡한 문제 해결 능력을 다양한 테스트 케이스로 제시합니다.
핵심 포인트
- GPT-6 Astra는 단순 성능 점수 이상의 인상적인 추론 능력(reasoning)을 가졌습니다.
- 과학적 질문에 답하기 위해 코드를 사용하거나 복잡한 데이터를 분석하는 능력이 뛰어납니다.
- 기후학, 천문학, 의료 영상 등 다양한 전문 분야에서 높은 수준의 문제 해결력을 보여줍니다.
영상: GPT-6 Astra, 너무 좋아서 OpenAI조차 걱정하는 모델
채널: AI Explained
길이: 29분 5초
출처: 자막 (자동, 영어)
GPT-6가 드디어 출시되었고, 네, 또 다른 AI 모델입니다. 하지만 GPT-6 Astra는 새로운 숫자와 이름이 필요합니다. 그리고 몇 주 또는 몇 달 동안 AI를 따라오지 못한 사람들을 아신다면, 그들이 생각하는 모델에 대한 견해가 자신이 생각하는 것보다 훨씬 구식일 수 있습니다. 왜냐하면 이 영상의 제목에서 말하듯이, Astra는 단순히 높은 테스트 점수들의 집합체가 아니라 정말 인상적인 모델이기 때문입니다. 이것은 단순한 마케팅이 아닙니다—Astra가 조용히 추론(reason)하는 능력은 OpenAI 내부의 많은 사람들에게 다소 불안감을 주고 있습니다. 영상의 전반부는 왜 저를 포함하여 많은 사람들이 이 모델을 그렇게 좋다고 생각하는지 설명할 것이고, 후반부는 이러한 우려 사항들을 다룰 것입니다.
물론 무엇에 초점을 맞출지는 여러분에게 달려 있습니다. 하지만 더 이상 지체하지 않고, 사람들은 왜 이 모델이 그렇게 좋다고 말할까요? 음, 이야기는 그들의 주요 경쟁사인 Anthropic과 며칠 전 출시된 Claude Fable 5.1 모델에서 시작될 수 있습니다. Anthropic은 Fable 5.1이 얼마나 좋은지 강조하기 위해 어떤 테스트를 선택할 수도 있었겠지만, 당연히 가장 어려운 몇 가지를 선택했습니다. 이제 제가 이 테스트들 중 일부가 얼마나 어려운지를 전달해 보겠습니다. 예를 들어 Terminal Bench Science와 Automation Bench 같은 것들이요.
하지만 여러분이 알아야 할 중요한 점은 이것들은 Anthropic이 선택한 테스트라는 것입니다. 그리고 바로 이 테스트들에서 GPT-6 Astra는 Fable 5.1보다 더 나은 성능을 보여주며, 비용도 더 적게 듭니다. 우리는 수십 가지의 테스트에서 이러한 추세를 보겠지만, 어떤 모델이 최고인지 가장 신경 쓰는 분들에게만 설득력이 있을 것입니다. 만약 여러분이 이 모든 모델들이 과대평가되었고 다소 쓸모없다고 생각한다면, 우리는 이 테스트들 중 일부를 더 자세히 살펴봐야 할 것입니다. 예를 들어 Terminal Bench Science 0.1부터 시작하겠습니다. 이름이 너무 지루한데, 이 테스트에서 좋은 결과를 보여준다는 것이 실제로 무엇을 의미할까요?
음, 저는 모델을 사용해서 그 자체의 성능을 설명해 보겠습니다. 실제 과학적 질문에 답하기 위해 코드를 사용하는 모델이 어떤 일을 해야 하는지 예시를 보여드리겠습니다. 이 테스트에서는 세 개의 별에 대한 25,000개의 밝기 등급이 주어집니다. 모델은 이 별들의 밝기에서 작고 반복되는 하락세를 찾아내야 합니다. 그런 다음 그 모델이 보지 못한 여섯 개의 데이터셋으로 작동하는 프로그램을 작성해야 합니다. 모델은 이런 것과 비슷한 수천 줄의 데이터를 봅니다. 몇 달러로 전문가보다 나은 결과를 얻을 수 있다는 것이 지금 좀 인상적이지 않나요?
기후학 분야는 어떨까요? 거의 3GB에 달하는 이미지 데이터가 있습니다. 그린란드에 있는 40개 호수의 일일 이미지 수천 장입니다. 그리고 이 호수들이 왜, 어떻게 건조해졌는지, 예를 들어 153일간의 계절 동안을 판단해야 합니다. 그리고 기억하세요, 정답이 나올 때까지 추측하는 것은 아닙니다. 모델은 잘못된 가설을 세우면 페널티를 받습니다. 또한 '지저분한' 데이터도 있습니다. 구름과 눈 때문에 특정 날짜의 정확한 유출량을 가릴 수 있다는 것입니다. 따라서 모델은 전후 증언들을 연결해야 합니다. 저는 계속 이야기할 수 있습니다. 237개의 MRI 이미지입니다.
주요 부상을 찾아내고, 측정하고, 이미지에 표시해야 합니다. 그는 네 개의 오답을 분석했는데, 이것이 하나의 테스트 질문에 대한 모든 것입니다. 좋습니다, 이것은 단지 하나의 테스트일 뿐이지만, 많은 테스트가 있습니다. 다른 사람들은 어떨까요? 자, 이제 '최종 에이전트 시험(The Last Agent Exam)'으로 넘어가겠습니다. 그리고 네, OpenAI가 포함하지 않은 테스트들에 대해 이야기할 것입니다. 추측하셨겠지만, 이 테스트에서 Astra는 새로운 높은 성능 기준을 설정하며 Claude Fable 5를 능가하고, 훨씬 낮은 비용으로 이를 달성합니다. 여러분은
이는 토큰을 더 효율적으로 사용하기 때문에 비용이 낮아질 수 있다는 의미입니다. 하지만 이것은 열성 팬들을 위한 사실일 뿐입니다. 저는 회의론자들, 즉 이러한 테스트가 실제 아무것도 측정하지 못한다고 말하는 사람들에게 더 초점을 맞추고 싶습니다. 실제로 무언가를 측정하기 위해 캘리포니아 대학교 버클리(University of California, Berkeley)에서 '최종 에이전트 시험(Last Agent Exam)'을 개발했습니다. 전문가들이 검증된 결과를 바탕으로 선정한 수천 가지 작업들로, 55개 산업 분야의 경제적으로 가치 있는 작업을 다룹니다. 좀 더 명확하게 설명하자면, 모델이 산업용 기계 가공 소프트웨어를 마스터해야 하는 예시가 있습니다.
실제 공장에서 사용되는 도구와 실제 사람들에 의해 얻은 데이터가 사용되어야 합니다. 물론 이 모델은 응답이 평가될 숨겨진 테스트를 알지 못합니다. 이 질문의 경우, 보시다시피 평가 시스템은 숨겨진 기준 표면에서 10,000개의 지점을 선택적으로 확인하며, 여기서 임계점들은 0.3mm 이내에 있어야 합니다. 이를 모른 채 Astra는 각 절단 계획을 세우고 충돌을 피해야 하는데, 감지된 모든 충돌이나 완성된 부품의 절단은 0점이라는 결과를 초래합니다. 또는 전문가가 받게 될 것과 동일한 입력 데이터를 제공받는 용융 플라스틱에 대한 질문일 수도 있습니다.
아니면 기존의 오래된 게임 속 지도, 괴물, 전투를 재현해야 하는 게임 디자인에 대해서는 어떻습니까? 그리고 별도의 시각 모델이 결과의 모든 결함을 평가할까요? 저는 계속 이야기할 수 있습니다. 이러한 테스트들은 모델들에게 극도로 도전적이도록 설계되었습니다. 비전(vision)에 대해 말하자면, ScreenSpot Pro를 간단히 살펴보겠습니다. 이것은 92% 정도의 정확도라는 고급 수준의 정확도가 필요하다는 말을 할 필요조차 없을 것입니다. 저는 1년여 전에 발표된 원본 기사를 깊이 파고들었는데, 모델들이 어떤 소프트웨어로 테스트되는지 보실 수 있습니다.
Adobe Premiere, Photoshop, Office 365 등입니다. 그런데 여기서 핵심은 이 소프트웨어에서 작업한 결과물이 얼마나 인상적인가에 있는 것이 아니라, 모델이 실제로 이렇게 복잡한 화면을 정확하게 탐색하고 매우 복잡한 그래픽 사용자 인터페이스(GUI)와 상호작용할 수 있는지 여부입니다. 곧 Astra가 무엇을 만들 수 있는지 예시를 보게 될 텐데, 여러분도 직접 시도해 볼 것이라 확신합니다. 이는 Astra가 인터페이스에 대한 매우 세밀한 제어 능력을 갖춘 컴퓨터에 너무나 익숙하기 때문에 그렇게 인상적인 결과물을 만들어낼 수 있기 때문입니다.
다시 말해, 이것들은 가짜 벤치마크(fake benchmarks)가 아니며, 저는 아직 가장 인상적인 것들을 다루지도 않았습니다. Frontier Math 레벨 4를 빠르게 살펴보겠습니다. 비용 면에서는 Fable을 능가한다는 것을 스스로 확인하실 수 있지만, 더 중요한 이야기는 이 벤치마크가 약 1년 전에 어떻게 만들어졌는지입니다. 이것은 Epoch AI가 Frontier Math를 위해 만든 가장 어려운 수준의 수학 문제입니다. 한 수학 교수는 당시 다음과 같이 말했습니다. “인용: 저는 제가 속한 분야의 일부 문제조차 겨우 풀 수 있기 때문에, 인공지능이 이 중 어떤 것도 풀지 못하기를 바랍니다.” 끝. 당시 모델들은 약 0점에 가까운 점수를 얻었습니다. 예를 들어 Gemini 2.5 Pro 같은 경우입니다. 실제로 정확히 1년 전에 출시된 GPT-5조차도 10%, 12%, 20%에 머물렀습니다. 하지만 GPT-6 Astra는 최고 98%의 점수를 기록했을 뿐만 아니라—이것은 나중에 영상에서 다시 다루겠지만—논란의 여지 없는 83%를 달성했습니다. 초안(draft)도, 사고 과정(chain of thought)도 없이, 단순히 답을 요구하자마자—83%입니다. 분명히
자, 이제 스탠퍼드 부교수님께로 넘어가겠습니다. 저는 이 결과에 대해 잘 안다고 주장하지 않지만, 그분은 GPT-6이 전설적인 Terence Tao를 포함한 여러 사람들의 결과를 능가하며, 소수(prime numbers) 사이의 거리를 찾는 데 있어 한 자릿수(order of magnitude)만큼 더 나은 성능을 보였다고 말했습니다. 그것뿐만이 아닙니다. 이 핵심 비유를 통해 1930년대부터 존재했던 문제를 해결하기 위한 새롭고 간단한 출발점을 만들어냈습니다. 마치 수십 년 동안 인간의 전통을 파괴한 후에 완전히 새로운 체스 오프닝을 발견하는 것과 같습니다.
그들은 이것이 37번째 수(move 37)와 비슷하다고 말하지는 않을 것입니다. 다른, 좀 더 현실 세계적인 결과에 대해서는 어떨까요? 모델 개발은요? 한 OpenAI 연구원은 “Astra를 사용하면서, 예전에는 최소한 풀타임으로 한 달이 걸리던 연구 통합 주기가 단 일주일 조금 넘는 시간 만에 끝났고, 실제 작업에 투입된 시간은 그보다 훨씬 적었으며, 말 그대로 다음 모델을 즉시 개선할 수 있었습니다.”라고 말했습니다. 저는 지금 재귀적 자기 개선(recursive self-improvement)에 대한 강한 충동을 느낍니다. 또한 잠시 동안 내부적으로 5.6 Soul을 다시 사용해야 했습니다.
제가 처음에 언급했었지만, 만약 3개월 전에 AI에 대해 의견을 형성했던 사람을 아신다면, 그 의견은 이미 놀라울 정도로 구식이 되었을 것입니다. 그럼에도 불구하고 시청자들 중에는 “네, 하지만 환각(hallucinations)은요?”라고 말하는 사람들이 있을 겁니다. 그의 어두운 면은요? 올바른 것들은 잠시 잊어봅시다. 그가 잘못 하는 모든 것들은요? 네, 사실입니다. 여전히 환각을 일으키고 있습니다. 이것은 거대 언어 모델(large language models)의 본질적인 부분입니다. 그는 허구(fiction)를 제거하지 못했습니다. 하지만 여기에서 6 Astra로 강조 표시된 환각 수의 급격한 하락을 보세요.
OpenAI는 이전 모델들이 사용자들과 작업할 때 환각(hallucinations)을 생성하던 상황에서 이 모델을 테스트했습니다. 그리고 그러한 시나리오에서 Astra는 훨씬 적게 환각을 일으켰습니다. 여러분 스스로 확인하실 수 있습니다. 하지만 이게 뭐죠? 3배, 5배, 10배 적은 환각인가요? 어떤 사람들은 창의성을 위해 환각이 필수적이라고 말하지만, Astra는 창의성 부문에서도 어려움을 겪지 않는 것 같습니다. 이미 많은 분들이 이 부분을 다루었기 때문에, 저는 화려한 시각적 데모에 너무 집중하지 않겠습니다. 하지만 여기 GPT-6 Astra가 Unreal Engine에서 맨해튼을 건설하는 모습이 있습니다.
다른 사람들은 Astra에게 그들의 고향인 트빌리시(Tbilisi)의 비행 시뮬레이터를 만들도록 강요했습니다. 저는 거기에 한 번 가보고 싶습니다. 저는 이웃 국가 아르메니아에 있었습니다. 한편, 다른 사람들은 인테리어 디자인에 초점을 맞추어 Fable 5.1과 대비되는 매끄러움, 정밀도, 순수한 시각적 품질을 보여주었습니다. 비교를 위한 이렇게 실제적인 벤치마크는 어떻습니까? 부동산 중개인들이 이 기능을 사용하여 부동산을 판매하는 모습을 상상해 볼 수 있습니다. 하지만 대부분의 리뷰가 시각적 데모에 초점을 맞출 것이기 때문에, 저는 다른 측면들을 다루고 싶었습니다. 그래서 이제 Arc AGI 3와 이것이 우리 모두에게 무엇을 의미하는지 살펴보겠습니다.
Arc AGI 3는 모델들을 게임 환경에 배치하여, 이전에 본 적 없는 추상적인 패턴을 인식하도록 과제를 부여합니다. Arc AGI 시리즈(1, 2, 3)의 전체 요점은 모델들이 즉석에서 추론할 수 있는지 테스트하는 것이었습니다. 사실, 그들이 할 수 없다는 것을 보여주는 것이 필요했습니다. 모델들은 실패했을 뿐만 아니라, 무작위 움직임들을 많이 시도하며 매우 비효율적으로 실패했습니다. 제가 강조하고 싶은 주요 점은 GPT-6 Astra가 Arc AGI 3에서 거의 100%를 기록했다는 사실이 아닙니다. 참고로 이것은 6개월도 채 되지 않은 버전의 벤치마크입니다.
저는 각 레벨을 해결하는 데 더 적은 행동이 필요하다는 점에 초점을 맞추고 싶습니다. 그녀는 평균적인 사람보다 효율성이 좋습니다. 벤치마크 작성자들은 평균적인 사람이 이 새로운 게임 과제들의 각 레벨을 성공적으로 완료하는 데 얼마나 많은 시간이 걸리는지 분석했습니다. 이것이 바로 인간의 기준선(human baseline)입니다. 그러니 이 레벨을 통과하지 못한 사람들에 대해서는 잊어버리죠. Astra는 최대 설정에서 이 인간 기준선보다 더 적은 행동을 사용했으며, 이는 96%의 경우에 해당합니다. 평균적으로 약 50% 적습니다. 저 자신도 Arc-AGI-3 과제를 거쳤습니다.
조금만 생각하면 상당히 효과적으로 해결될 수 있습니다. LLM(대규모 언어 모델)은 효율성으로 유명하지 않습니다. 따라서 모든 레벨을 올바르게 해결한 사람들보다 더 효율적이라는 것은 매우 인상적이며, 작성자들 스스로도 이를 인정합니다. 그들이 이 벤치마크를 만들기 전에, 그리고 제가 개인적으로 그 개발자 중 한 명을 알고 있는데, 그들은 이렇게 말했습니다. “우리는 성능이 인간과 AI 사이의 경계선으로 남아 있을 것이라고 가정했습니다.” 물론 이것은 경계선이지만, 사람들은 결국 잘못된 쪽에 서게 되었습니다. 물론, 이것은 비용이나 시간 문제에 도달하기 전의 이야기입니다.
이것들은 모델이 인간보다 얼마나 현저하게 뛰어난지 보여주는 추가적인 매개변수일 뿐입니다. 평균적인 인간이 AI보다 더 잘 수행할 수 있는 텍스트 기반 과제를 만드는 것이 현재 매우 어렵다는 사실 때문에, 저는 저 자신의 비공개 벤치마크인 Simple Bench를 포함하여 AGI의 조용한 이정표에 대한 Patreon 영상을 만들었습니다. 또한 GPT-6 Astra 아키텍처에 대해서도 약간 언급합니다. 아마도 이것이 ARC AGI 시리즈의 주 저자인 François Chollet가 이렇게 말하는 이유일 것입니다. 누군가가 그를 인용하며 “ARC AGI의 최종 버전은 아마 여섯 번째 또는 일곱 번째가 될 것”이라고 말했습니다. 핵심은 인간이 완료할 수 있지만 인공지능이 할 수 없는 과제를 제시하는 것이 불가능해질 때까지 테스트를 만드는 것입니다.
AGI는 대략 2030년경에 도달할 것이라고 말했습니다. 그러자 그에게 여전히 유효한지 물었습니다. 콜(Cholle)은 다음과 같이 답했습니다. 오히려, 제가 예상했던 것보다 진전이 더 빠르기 때문입니다. 저와 저는 공개적으로 '모든 과제(any task)'에 대해 이야기하는 것이 적절한지에 대해 논쟁해 왔으며, 제 생각에는 오직 '대부분의 과제(most tasks)'에 대해서만 이야기하는 것이 적절하다고 생각합니다. 왜냐하면, 평균적인 인간이 AI보다 더 잘할 수 있는 모든 과제를 기준으로 삼는 것은 너무 높은 기준이기 때문입니다. 저에게는 이것이 ASI, 즉 초지능(superintelligence)에 가깝습니다. 아마도 일부 OpenAI 연구원들이 우리가 AGI의 시대를 맞이했다고 말하는 정량적 이유가 바로 이것일 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube AI Explained (AI 뉴스)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기