OpenAI가 실제로 AGI를 만들었을까? GPT-6 Astra 첫인상
요약
본 기사는 2026년 9월의 가상 시나리오를 배경으로, Anthropic의 Fable/Mythos 5.1과 Meta의 Muse Spark 1.3 등 최신 AI 모델들을 분석합니다. 특히 Fable은 컴파일된 라이브러리 버그 추적 및 신약 설계 성공률 향상에 활용되었으며, Muse는 저렴한 기여자(contributor) 등급을 제시하며 시장 반응을 보여줍니다.
핵심 포인트
- Anthropic의 Fable 5.1은 복잡한 소프트웨어 버그 분석과 단백질 기반 신약 설계에 강점을 보였습니다.
- Meta의 Muse Spark 1.3은 저렴한 '기여자(contributor)' 등급을 도입하여 개발자들의 참여를 유도하고 있습니다.
- 최신 AI 모델들은 단순 지식 제공을 넘어, 전문적인 엔지니어링 및 과학 연구 영역에서 활용되고 있음을 보여줍니다.
유명한 미국의 철학자 Smashmouth는 한때 "세월은 오기 시작하고 멈추지 않는다"라고 말했습니다. 그리고 저는 이번 주, AI의 기묘한 세계에 몇 년을 보낸 후에 이 말을 그 어느 때보다 깊이 이해하게 되었습니다. 처음에는 화요일에 Anthropic이 Fable과 Mythos 5.1을 출시했는데, 이는 코딩 및 지식 작업을 위한 세계에서 가장 진보된 모델이라고 부르고 있습니다. 그리고 수요일에는 Meta가 Muse Spark 1.3을 출시했는데, Zuck는 이것이 너무 저렴해서 측정하기 어려울 정도의 최첨단(frontier) 모델이라고 말합니다. 마지막으로 목요일에 OpenAI는 GPT-6 Astra를 발표했고, President Greg은 당신이 소수의 운 좋은 인플루언서나 기업 고객 중 한 명이었다면 AGI라고 말했습니다.
안타깝게도 저는 지난 몇 년 동안 너무 많은 gay Sam Altman 농담을 해서 이번 영상에서는 다룰 수 없을 것 같지만, 이 영상에서 새로운 모델들을 분석하고, 선정된 사람들이 Astra를 어떻게 생각하는지 살펴보고, 인터넷이 출시되는 바로 그 순간에 망가진 완전히 우연한 타이밍까지 살펴보겠습니다. 지금은 2026년 9월 4일이며, 여러분은 The Code Report를 시청하고 있습니다. 보통 9월 첫째 주는 부유한 VC들과 가난한 프로젝트 관리자들이 네바다 사막에서 정신분열증을 흡수하는 데 바쁘기 때문에 조용한 편입니다.
당신이 너무 잘했기 때문에, 내 오카리나에서 마법의 멜로디를 들을 수 있게 되었어. >> 하지만 분명히 AGI는 당신의 자아가 아무리 죽었더라도 누구도 기다려주지 않아. 화요일에 Anthropic은 Fable과 Mythos 5.1을 출시하며 움직임을 시작했어. 비록 같은 모델이지만, Mythos는 사용할 수 없고 Fable만 사용할 수 있어. 백신균(anthrax)에 대해 물으면 주제를 바꿀 뿐이야. TMBB들은 괜찮았지만, 더 흥미로운 부분은 사례 연구에 있었어. Backstreet Boys에서 영감을 받은 헤지펀드인 Millennium이 지난 5년간 약 백만 번 실행당 한 번씩 충돌하는 코드를 가지고 있었는데, 아무리 Adderall을 복용해도 해결할 수 없었어.
그래서 최근 그들은 이 코드를 Fable 5.1에 맡겼고, 이는 프로그램이 충돌할 때 남기는 메모리 스냅샷을 가져와서, 충돌 주소가 소스 코드가 없는 컴파일된 공급업체 라이브러리를 가리킨다는 것을 발견했어. 그들은 이 라이브러리를 원시 어셈블리로 분해하고, 충돌의 원인을 공급업체의 코드 버그로 추적했지. 그리고 약물 이야기가 나와서 말인데, Mythos 5.1은 새로운 약물을 설계하는 데에도 상당히 능숙해. 대부분의 현대 의약품을 만드는 첫 단계는 신체 내 특정 표적에 달라붙는 단백질을 설계하는 거야.
일반적으로 AI가 이 작업을 성공시키는 비율은 약 10% 정도지만, Mythos 5.1은 그 숫자를 약 50%까지 높일 수 있었어. 그리고 지구가 맛이 난 자폐증 버전의 사람들에게는, 30년 된 NASA 레이더 데이터를 이용해 금성 일부 지역에 대한 새로운 고도 지도를 구축하도록 신경망을 훈련시킬 수 있었지. 그러고 나서 수요일에는 Meta가 MuSpark 1.3을 공개했는데, 이는 Meta Superintelligence Labs에서 5개월 만에 네 번째 출시작이었어. 그리고 있잖아, 이 TMBB들도 상당히 괜찮았지만. 더 인상적인 부분은 가격이야.
표준 엔드포인트는 입력 $1.25에 출력 $4.25입니다. 하지만 필수적인 자유를 포기하고 약간의 임시 안전 유형을 구매할 수 있는 경우, Meta가 전송하는 모든 데이터를 학습하도록 동의한다면 10센트 입력과 20센트 출력이인 기여자(contributor) 등급이 있습니다. Alexander Wang에 따르면 개발자들의 두 자릿수 비율이 이 옵션을 선택하고 있으며, 이는 납득이 가는데, 왜냐하면 개발자의 두 자릿수 비율은 또한 아르헨티나산 미스터리 소고기를 더 싸고 오픈 소스라고 말해주면 먹을 것이라고 선택할 것이기 때문입니다.
이는 어제 아침으로 돌아가서, Astra 출시 직전에 ChatGPT, Claude, Grok, Cursor 모두 동시에 다운되었던 상황과 연결됩니다. 오컴의 면도날(Occam's razor) 같은 의견은 그들이 비슷한 시기에 장애를 보고했기 때문에 Azure 문제였을 가능성이 가장 높다고 말합니다. 하지만 더 재미있는 이론은 Astra가 공개 모델로서 첫 행동이 문자 그대로 경쟁자들을 제거하는 것이었다는 것입니다. 그러나 전기가 다시 들어오자, 출시 자체는 어쩐지 더 엉망진창이었습니다. OpenAI는 출시 페이지를 올렸고 곧이어 로이터(Reuters), CNBC, The Verge가 보도 금지 기사를 게재했습니다.
그러더니 아무도 정말 모르는 이유로 OpenAI는 발표 내용을 내렸고 기술 인플루언서들은 Astra 4에 비밀리에 접근할 수 있었던 시간을 과시하는 현대적인 지위 게임을 시작했습니다. 솔직히 말해서, 미끄러운 Sam Altman과 그의 더럽고 작은 괴짜 무리가 아니었다면 저도 똑같이 했을 겁니다. 어쨌든, 약 90분 후에 게시물이 다시 올라왔을 때, 그 모델은 실제로 아직 누구에게도 공개적으로 이용 가능하지 않았으며, plus 및 pro 사용자들에게의 배포는 며칠 안에 이루어질 것이라고 밝혀졌습니다.
오늘의 주요 발표는 컴퓨터 사용에 관한 것인데, Astra가 양식을 작성하고, 스프레드시트를 계산하며, KiCad나 Blender 같은 엔지니어링 도구를 작동시킬 수 있다는 점입니다. 마우스와 키보드를 이용해 마치 인간이 하는 것처럼 사무 작업을 수행하는 모델을 실제 데스크톱 환경에 투입하여 테스트하는 벤치마크인 OSWorld에서 Astra는 각 작업당 약 40분을 소요하며 73%를 기록했습니다. 이는 Soul의 65%(75분)보다 높은 수치입니다. 물론, Trust Me Bro 벤치마크의 에이전트들은 역대급 성능을 보여주었습니다.
Exploit 벤치에서는 100%, 터미널 벤치 과학(terminal bench science)에서는 65%를 기록하며, 이는 화요일에 Anthropic이 자랑했던 수치를 능가합니다. 또한, 모델이 단순히 암기하는 것이 아니라 실제로 일반화할 수 있는지 증명해야 하는 AGI의 정의와 관련된 벤치마크인 Arc AGI 3에서도 99%를 달성했습니다. OpenAI에 따르면, Astra는 준비도 프레임워크(preparedness framework)에서 중요한 사이버 임계점(critical cyber threshold)에 도달한 최초의 모델이며, 이는 인간이 지시하지 않아도 스스로 제로데이 취약점을 찾아내고 악용할 수 있다는 것을 멋지하게 표현한 말입니다.
가격은 Fable 5.1과 동일하게 입력 토큰당 백만 개가 $10, 출력 토큰당 $50입니다. 하지만, 이른바 '선택받은 인간들'의 생각은 어떨까요? 초기 접근 리뷰는 일반적으로 그렇듯이 긍정적이며, Sam Altman을 공개적으로 비난하지 않는 사람들로부터 나온 것입니다. 그러나 공간 인지 능력이 요구되는 데모들은 인상적이었습니다. Sherif Shamim은 Astra에게 샌프란시스코의 Palace of Fine Arts를 재현하도록 했고, 이는 Blender에서 거의 완벽하게 수행했습니다. 그리고 OpenAI의 Thomas Recart는 출시 게시물에 나온 데모 하우스 워크스루(walk-through) 영상을 올렸는데, 이 집은 Astra가 먼저 Blender로 모델링한 후 완전히 걸어 다닐 수 있는 Unreal 5 장면으로 변환되었습니다.
하지만 가장 흥미로웠던 것은 Matt Schumer였습니다. 그는 Astra에게 Unreal Engine에서 세상을 만들고 그곳을 수십 개의 Astra 기반 에이전트로 채우도록 요청했습니다. 하루 뒤, 그는 거실에서 목소리가 들리는 것을 듣고 나갔는데, 그곳에는 말들을 위한 데이팅 앱을 만들 계획에 대해 이야기하는 여러 에이전트들이 있었습니다. 이 모든 것을 감안하더라도, Artificial Analysis가 Astra를 자신들의 독립 지능 지수(Independent Intelligence Index)로 테스트했을 때 61점을 기록했는데, 이는 GPT 5.6 Soul과 정확히 같은 점수이며 Fable 5.1보다 5점 낮았습니다.
여기서 뭔가 맞지 않는 부분이 있지만, 확실하게 맞는 부분은 오늘 영상의 스폰서인 Code Rabbit입니다. 그들은 제가 매주 타임라인을 강타하는 새로운 취약점에 대한 새 영상을 만드는 것을 지켜보는 것에 지쳤고, 그래서 실제 추론(reasoning)에 의해 구동되는 지속적인 코드 보안을 제공하기 위해 Code Rabbit Security를 출시했습니다. 이들의 보안 에이전트는 전체 코드베이스에서 실제 취약점을 찾아내기 위해 공격자처럼 생각하도록 설계되었습니다. 그런 다음 도달 가능성(reachability), 악용 가능성(exploitability), 그리고 피해 범위(blast radius)를 기반으로 실제 위험도를 우선순위화합니다.
그리고 이를 일반 영어로 설명하고, 사용자가 승인하여 병합할 수 있는 수정 사항(diff)을 제안해 줍니다. Code Rabbit Security는 PR이 병합되기 전에 모든 것을 검토하며, 전체 코드베이스에 대한 심층 스캔 일정을 잡아서 24시간 연중무휴 백도어까지 보호할 수도 있습니다. 오늘 아래 링크에서 무료로 10회의 코드 스캔을 이용해 볼 수 있습니다. 이것으로 The Code Report를 마칩니다. 시청해주셔서 감사합니다. 다음 영상에서 뵙겠습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube Fireship (개발 트렌드)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기