
젠슨 황이 AGI 시대가 도래했다고 했죠. 거기엔 GPT-6 Astra 이게 있어요.
요약
본 글은 젠슨 황이 언급한 AGI 시대 도래와 관련하여, ARC-AGI-3 벤치마크를 통해 최신 AI 모델의 성능 변화를 분석합니다. 특히 Astra가 새로운 환경에서 규칙을 추론하고 계획적으로 문제를 해결하는 능력이 크게 향상되었음을 강조하며, 이는 AI가 미지의 상황에 적응하는 능력 면에서 큰 진전을 보여주었음을 시사합니다.
핵심 포인트
- ARC-AGI-3는 단순 지식 시험이 아닌, 새로운 환경에서의 추론 및 계획 능력을 측정한다.
- Astra는 Standard 조건 62.7%, Provider Adapter 환경 99.9%라는 높은 점수를 기록했다.
- Astra는 스스로 규칙을 압축하여 내부 모델을 만들고 계획적으로 문제를 해결하는 방식을 보여주었다.
- AI의 오래된 약점인 '새로운 상황 적응 능력'에서 큰 경계가 무너졌다는 것이 핵심이다.
젠슨 황이 AGI 시대가 도래했다고 했죠. 거기엔 GPT-6 Astra 이게 있어요.
개인적으로 ARC-AGI-3 벤치마크를 잘 보는게 이걸 보면 어느 정도 가늠해볼 수 있다고 봐요.
먼저 ARC-AGI-3는 단순 지식 시험이 아니예요.
설명서도 규칙도 없는 처음 보는 환경에서 AI가 직접 탐색하고, 규칙을 추론하고, 목표를 발견하고, 계획을 세워 문제를 해결해야 합니다.
한마디로 처음보는 세계를 얼마나 빨리 이해하고 대응할 수 있느냐를 보여주죠.
그런데 이 시험에서 불과 몇 달 전까지만 해도 최첨단 AI는 사실상 아무것도 하지 못했어요.
GPT-5.5는 0.43%, Claude Opus 4.7은 0.18%, GPT-5.6 Sol도 7.78% ... 그정도 수준이었습니다.
그런데 Astra 는..
같은 Standard 조건에서 62.7%,
OpenAI의 추론 상태를 유지하는 Provider Adapter 환경에서는 무려 99.9% 를 기록해버렸어요.
단순한 몇 % 개선이 아닙니다. 거의 못하던 능력이 갑자기 가능한 능력으로 바뀐 것!
더 인상적인 부분은 문제를 푸는 방식인데..
Astra는 화면을 무작정 클릭한 것이 아니라, 처음 보는 세계의 규칙을 스스로 압축해 내부 모델을 만들고 그 위에서 계획했습니다.
완료한 레벨의 96%에서는 인간 중앙값보다 더 적은 행동으로 풀었고, 평균 행동 수도 인간보다 51.7% 적었습니다.
물론 ARC-AGI-3 하나를 통과했다고 AGI가 증명된 것은 아니겠죠.
하지만 AI의 오래된 약점 = 학습 데이터에 없던 새로운 상황에 적응하는 능력
여기에서 큰 경계가 무너졌다는 점은 분명하다고 봐요.
Astra의 의미는 AI가 이제 모르는 것을 스스로 배울 수 있는 무언가로 넘어가기 시작했다는 것.
AGI 선언의 이유는 분명히 있을겁니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @lucas_flatwhite (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기