모델 폭발: GPT 5.6 Sol, Grok 4.5 및 Meta Muse가 규칙을 다시 쓰다
요약
본 기사는 OpenAI의 GPT 5.6 Sol, Grok 4.5, Meta Muse 등 최신 모델들을 비교 분석하며 AI 기술 발전의 방향성을 제시합니다. 특히 저렴한 비용으로도 높은 성능을 유지하는 것이 가능함을 강조하고, 실제 산업 및 금융 분야에서의 적용 가능성에 대해 논합니다.
핵심 포인트
- OpenAI의 신규 모델(Soul, Terror, Luna 5.6)은 Anthropic Claude 시리즈 대비 낮은 비용으로 우수한 성능을 보임.
- GPT 5.6 Sol과 같은 최신 모델들은 복잡한 'Agents Last Exam' 등에서 높은 점수를 기록함.
- 최근 AI 기술 발전은 단순 코딩 지원을 넘어, 인간의 개입 없이도 실제 산업 과제를 수행하는 방향으로 진화하고 있음.
- 금융 및 사무 영역에서도 AI를 활용하여 부채 관리나 업무 처리를 자동화할 수 있는 잠재력이 높음.
우리는 오직 AI 리더보드에서 가장 높은 점수와 우리 자체 워크플로우에서의 최고의 느낌에만 신경 써야 한다고 생각했습니다. 하지만 Three Frontier Labs는 우리에게 '가격은 더 낮으면서 거의 비슷한 품질을 제공할 수 있다면 어떨까요?'라고 물었습니다. 이 질문에 대한 답이, 슈퍼 앱의 책임자인 OpenAI가 Anthropic의 무료 사용 관련 게시물에 응답하며 쓴 '두렵다'라는 말의 이유를 설명할 수도 있습니다. 하지만 더 광범위하게는, 이 영상은 지난 정신없는 24시간 동안 무슨 일이 일어났는지 이해하기 위해 새로운 모델, 데모 및 기사들 사이에서 수십 개의 숨겨진 보석들을 분류하는 데 도움을 줄 것입니다.
그리고 Anthropic의 AI 의식에 대한 다소 불안감을 주는 게시물과 기사는 언급하지 않은 것이었습니다. 이 내용은 제 Patreon에서 자세히 논의됩니다. 그래서 저는 새로운 Gypsy 5.6 Soul, Terror, Luna를 포함하여 저만의 사설 벤치마크에서도 수백 번 테스트했고, 물론 모든 것을 직접 읽어보았습니다. 잠깐만요, 이건 말도 안 됩니다. 제가 무슨 뜻인지 아시겠죠—수동으로요. 자, 그럼 시작하겠습니다. 우선 OpenAI가 세 가지 새로운 모델을 출시했습니다. Soul, Terror, 그리고 Luna 5.6 버전입니다.
Soul은 유료 플랜에서만 이용 가능합니다.
이것은 알려지지 않은 수준의 노력과 결합되어 있습니다. 언뜻 보기에는 다섯 개가 있는 것 같지만, 숨겨진 전문가 모드도 있습니다. 하지만 좋은 소식은 이러한 관찰들이 일반적으로 모두에게 해당된다는 것입니다. 그러니 너무 걱정하지 마세요. 왜냐하면 진실은 대부분의 벤치마크에서—최고 사양의 Soul을 Fable과 비교하거나, Terror를 Opus와 비교하거나, Luna를 Sonnet과 비교하는 경우—OpenAI 모델이 Anthropic의 Claude 시리즈보다 일반적으로 약 3분의 1 비용이라는 것입니다. 그리고 참고로, 이것은 훨씬 낮은 가격에 항상 성능이 떨어진다는 것을 의미하지는 않습니다.
좋습니다. 저는 이 벤치마크인 'Agents Last Exam'을 강조했습니다. 보시다시피, 최고 성능의 GPT 5.6 Sol이 초고(extra-high) 설정에서 거의 54%를 기록하는 반면, Fable은 최대 설정에서 45%를 얻습니다. 네, 중요하지 않습니다. 또 다른 벤치마크가 있습니다. Philippe. 하지만 잠깐만요, 이 연구는 UC 버클리 대학 주도였으며 55개 산업을 다루고 있습니다. 300명의 전문가들이 경제적으로 가치가 있는 장기 과제를 만들었습니다. 이 벤치마크의 전설적인 리더인 Dawn Song은 다음과 같이 말했습니다. "각 과제는 인간 전문가가 이전에 완료한 실제 프로젝트에서 가져왔습니다.
'느낌(vibes)'도 없고, 인간 심사관도 없으며, 완전하게 재현 가능합니다." 좋습니다, 아마 생각하실 겁니다. 이 벤치마크를 만드는 것을 감독한 매우 인상적인 사람들의 목록이군요. 하지만 45%에서 54%로의 증가는 정말 그렇게 중요한가요? 음, Sol과 관련된 비용을 절감하는 것 외에도, 개발자들이 코드를 수동으로 작성하는 것을 중단하게 하려면 Frontier 프로그래밍 테스트에서 반드시 90%에 도달할 필요는 없었다는 점도 지적하고 싶습니다. 우리가 극복할 수 있는 테스트가 하나도 없었습니다. 제가 말하는 것은 수동으로 코드를 작성하던 순간에서 AI를 우선시하는 단계로 넘어갔을 때의 그 순간입니다.
그렇다면 지금 금융이나 최신 에이전트 시험에서 다루는 다른 많은 산업에서도 똑같은 일이 일어나지 않을 것이라고 누가 감히 말할 수 있겠습니까? 며칠 전 Bloomberg에서 보고서를 들었는데, Core가 재무 회사들로부터만 이번 달에 수백억 달러의 부채를 안고 있다고 보도했습니다. 그렇다면 올해 말까지 금융 및 기타 사무 영역에 AI를 사용하는 것으로 넘어갈 수 없을까요? 모델이 먼저 새로운 ChatGPT 탭에서 작업을 수행하고, 사용자가 결과를 확인하고 조정하는 방식으로요? 여러분 중 일부는 테스트 중 하나가 조작되었다고 생각할 수도 있습니다.
그래서요? 에이전트 시험(Agent Exam)은 비교적 새로운 테스트라 GPT 5.6 학습 데이터에서 답을 찾기 어렵고, Zapier의 자동화 벤치마크(Automation Bench)도 마찬가지입니다. 불과 몇 주 전만 해도 이 테스트 출시에 대해 이야기했던 것 같은데요. 다시 말해, 이 테스트는 수백만 개 기업의 실제 패턴을 기반으로 영업, 마케팅, 운영, 지원, 재무, 인사 등 비즈니스 기능을 아우르는 실시간 도구를 사용하여 엔드투엔드 워크플로우를 실행하는 AI 에이전트를 테스트합니다. 이번에는 OpenAI에게 '달러당 성능(performance per dollar)'이라는 눈에 띄는 이점이 아닙니다.
Soul at Max에서는 포인트에서 7%의 우위를 볼 수 있습니다. 이 출시 비용은 Fable과 거의 비슷합니다. 하지만 결과는 여전히 이전 가장 유명한 실질적 영향 측정 테스트인 GDP Four와 유사합니다. 이번에는 Fable이 실제로 약간 더 높은 ELO 등급을 가지고 있지만, 비용은 세 배나 더 많이 듭니다. 몇 가지 더 인상적인 예시를 보여드리고, 그리고 반론도 제시하여 제가 OpenAI에 편향되어 있지 않다고 생각하게 만듭니다. Artificial Analysis는 여러 프로그래밍 테스트를 하나의 종합 분석으로 결합했습니다. 그리고 그가 무엇을 보여줬는지 볼 수 있습니다.
보시다시피, GPT 5.6 Soul은 낮은 비용에도 불구하고 지수에서 가장 높은 점수인 80점을 받았고, Fable은 77점이었습니다. 이는 터미널 벤치(Terminal Bench) 2.1 점수로도 확인될 수 있습니다. 이것을 모델이 터미널 명령어 라인을 사용하여 작성, 디버깅, 소프트웨어 실행 및 다단계 도구 사용과 같은 상당히 복잡한 작업을 수행하는 능력이라고 생각하시면 됩니다. 하지만 잠깐, Artificial Analysis 프로그래밍 지수 역시 동일한 테스트를 다룹니다. 터미널 벤치 깊이(Terminal bench depth). 제가 말하려는 것은 이 소수의 테스트들이 Soul이 가장 좋아하는 분야인 프로그래밍에서 Fable보다 훨씬 더 뛰어나다는 인상을 줄 수 있다는 것입니다.
하지만 이것들은 단지 두 가지 지표일 뿐이며, Deep Sui뿐만 아니라 Frontier와 Sui Marathon이라는 두 가지 더 새롭고 복잡한 테스트에 대한 질문들이 제기되었습니다. GPT Soul의 결과는 Sui Marathon에 대해 발표되지 않았는데, 이는 수천만 개의 토큰을 각 시도마다 사용하는 몇 시간 동안의 과제를 포함하는 소프트웨어 개발 마라톤입니다. Grock 4.5가 앞서나가고 있다는 것을 알 수 있습니다. SpaceX가 AI 서비스 Cursor를 인수한 후 Grock이 받은 모든 데이터가 그를 앞서나가는 데 정말 도움이 된 것 같습니다. 이 테스트에서 Fable 5가 뒤처지는 것을 볼 수 있습니다.
또한 이것도 염두에 두세요: Fable 5에서 GPT 5.6 Soul로 전환하게 만들 수도 있는 논거, 즉 거의 비슷하지만 훨씬 저렴하다는 사실이 여러분을 Grock 4.5나 어쩌면 중국산 모델인 GLM 5.2를 선택하게 할 수도 있습니다. 이 모델들이 그래프에 추가되면 OpenAI의 곡선은 그렇게 매력적으로 보이지 않을 수 있습니다. 괜찮습니다만, 이 순간이 여러분의 열정을 약간 식게 했을지도 모릅니다. 왜냐하면 추상적인 패턴 인식 테스트인 ARC AGI 3—업계에서 가장 많이 논의된 추론 테스트의 후속작이며, 참고로 모델에게 심각한 페널티를 부과합니다—에 주목한다면, GPT 5.6 Soul은 여전히 잘 수행하기 때문입니다.
네, 단지 8%에 불과하지만, 이는 겨우 2%에 도달하는 다른 모델들과 비교하면 엄청난 수치입니다. 저는 Anthropic이 높은 비용 때문에 Fable을 출시조차 하지 않았다고 생각합니다. 다음은 스포츠 프로그래밍 차례입니다. 지난 24시간 동안 OpenAI의 모델(아마도 사내 개발)이 스포츠 프로그래밍 테스트를 문자 그대로
다음으로 살펴보고 싶은 또 다른 테스트가 있습니다. 어쩌면 이것은 회사들이 모델의 역량을 보여주기 위해 정식 게임 버전(game versions)을 출시 노트의 일부로 공개하는 완전히 새로운 유형의 테스트일지도 모릅니다. 이를 통해 모델이 사용자 친화적이고, 인체공학적이며, 기능적인 인터페이스를 만들 수 있고, 심지어 브라우저를 사용하여 작업 결과를 테스트할 수 있음을 보여줍니다. 실제로 여러분도 같은 것을 할 수 있습니다. 저는 이 5.6 Soul Ultra 모델에 대해 Fable 때 사용했던 것과 동일한 질의를 사용했습니다. 그리고 제 생각에 Fable의 결과보다 훨씬 나은 타이틀 페이지가 있는 게임을 얻었습니다.
5.6이 사운드 설정을 두 번 변경했기 때문에 모든 것이 순조롭지는 않았다는 점을 언급해야 합니다. 그런데 미니게임을 설명란에 올렸으니 원하면 플레이할 수 있습니다. 요약하자면, Fable만큼 시각적으로 멋지진 않지만, 저는 이 작은 동반자가 마음에 듭니다. 이것은 사실 포켓몬 클론이지만, 이벤트는 Red Wall 세계관에서 벌어집니다. 그리고 정말로 여러분의 동반자를 볼 수 있습니다. 움직일 때 그저 따라다닙니다. 상당히 귀엽습니다. 물론 크레딧을 더 많이 소모하는 Lightning 모드를 사용했을 때, 저는 20분 만에 결과를 얻었지만 Fable은 한 시간을 넘게 걸렸습니다.
하지만 여기서 Meta의 Muse Spark 1.1을 언급하고 싶습니다. 메타가 자랑스러워하는 주요 벤치마크 중 하나는 Vibe Code를 할 수 있는 능력입니다. 그들은 Vibe Code Bench에 연결합니다. 이것은 독립 회사인 valves.ai에서 만든 것입니다. 그리고 거기서 보면, Muse Spark가 그다지 뒤처지지 않는 점수를 얻고 있음을 알 수 있습니다. Soul이 72% 대 81%이지만, 약 35분의 1 가격입니다. 이것은 앞서 논의되었던 비용 효율성이라는 어색한 지점과 같습니다. OpenAI는 Meta와 XAI에서 GPT 시리즈만큼 거의 비슷하지만 훨씬, 훨씬 저렴한 다른 모델들이 존재할 때, 자신의 모델이 거의 비슷하면서도 더 싸다는 것에 너무 의존할 수 없습니다.
제가 Vibe Coding을 언급하는 이유는, 예를 들어 게임 디자인, 웹사이트 목업 또는 기타 소비자나 전문적인 작업을 수행할 때, Soul 모델은 필요하지 않을 수 있기 때문입니다. 심지어 훨씬 가벼운 Luna 모델조차 필요하지 않을 수도 있습니다. 이 벤치마크에 비해서도 여전히 네 배 더 비싸고 현저히 느립니다. Meta의 새로운 Muse Spark 역시 컴퓨터 사용 면에서 멀어 보이지 않습니다. 우리는 훨씬 광범위한 범위의 벤치마크를 봐야겠지만, 그 가능성은 존재합니다. 물론 이것은 시작일 뿐이며, 이렇게 작고 저렴한 모델이 어떻게 '인류의 궁극적인 시험'에서 그렇게 높은 점수를 얻을 수 있는지 궁금해할 수도 있습니다. 이 시험은 Meta가 인수했던 Scale AI가 공동으로 만든 것입니다.
누군가 데이터 유출에 대해 말했나요? 하지만 너무 회의적일 필요는 없습니다. GLM 5.2도 있습니다. 근접한 선두급 성능을 훨씬 적은 비용으로 달성할 수 있는 여러 사례들이 있습니다. 아, 그리고 제가 제 개인 벤치마크인 Simple Bench에 대해서조차 논하지 않고 여기까지 왔습니다. 최근 The Economist와 MIT Tech Review가 인터뷰를 요청했지만, 그것은 본질적으로 트릭 질문이거나 상식 테스트였습니다. 오늘날 진정한 베테랑은 2년 이상 업계에 있었던 사람입니다. 그래서 OpenRouter는 모델의 특정 미공개 프로 버전에 대한 접근을 열어줍니다.
그리고 Soul Pro와 함께 71.7%를 보았습니다. 이것은 여전히 Fable보다 10% 낮습니다. 그리고 사실 Grok 4.5도 그리 멀지 않습니다. XAI에 큰 공로가 돌아갑니다. Grok 4.5는 텍스트 완성용으로 정말 좋은 모델인 것 같습니다. Soul 자체는 약 65%를 받았습니다. 저는 또한 Sonnet 5, Kimmy K 2.7, GLM 5.1 및 5.2도 추가했습니다. 그리고 더 중요한 것은, 모델의 진행 상황을 볼 수 있는 타임라인과 비용 대비 성능 분석 그래프를 추가했다는 것입니다. 본질적으로 돈으로 어떤 가치를 얻고 있습니까? 저에게 눈에 띄는 것들은 Qwen 3.7, GLM 5.2, 그리고 사실 DeepSeek V4 Flash입니다.
믿을 수 없을 만큼 저렴한 모델이지만 여전히 50%에 가까운 성능을 보여줍니다. 만약 비용에 크게 신경 쓰지 않고 빠르고 좋은 결과를 얻고 싶다면, OpenAI가 새로운 '울트라 모드(ultra mode)'를 시연한 비디오가 있습니다. 이는 Gemini의 '딥 싱크 모드(deep think mode)'나 Claude의 '울트라 모드'와 다소 유사합니다. 더 많은 수의 병렬 에이전트가 작업을 더 빠르게 수행합니다. 즉, 이것은 단순히 익스플로잇 생성에 대한 하나의 테스트일 뿐이지만, 이러한 추세는 계속될 것입니다. 비디오 말미에는 왜 제가 생각하기에 우리는 아직 이런 접근 방식에서 포화 상태에 도달하지 못했다고 설명할 것입니다.
다음으로, 아마도 제가 더 많은 시간을 할애해주기를 기대했을 지점—자기 개선(self-improvement)에 대한 주장입니다. GPT 5.6이 OpenAI를 가속화한다는 사실 말입니다. 적어도 그렇게 주장되고 있습니다. 출시 비디오에는 Soul이 Luna를 재훈련했다고 추가되었지만, 이러한 주장은 평가하기가 매우 어렵습니다. 그녀가 정말로 Luna를 완전히 훈련시켰을까요? 얼마나 많은 인간 검증(human verification)이 포함되었을까요? 그녀가 Luna를 훈련할 수 있는 지점까지 도달하는 데 얼마나 많은 노력이 들었을까요? 이것이 같은 일을 시도한 OpenAI 연구원들보다 못한 결과는 아닐까요?
결국, 우리는 Fable 5와 같은 모델조차 Post-train Bench 같은 사전 학습(pre-training) 벤치마크에서는 여전히 매우 멀다는 것을 알고 있습니다. 저는 OpenAI가 점점 더 프리릴리즈 모델을 사용하고 있으며, 모델당 출력 토큰 수가 두 배로 늘어나고 있고, 그들의 연구 예산이 기존 모델을 사용하여 자체 연구를 가속화하는 방향으로 증가하고 있다고 전적으로 믿습니다. 비록 Anthropic이 이와 관련된 주의점(caveats)에 대해 더 정직했다고 느끼지만 말입니다. Mythos 시스템 맵에서 그들은 이러한 모든 '성능 향상'이 자신들의 연구 속도를 두 배로 늘리는 데 필요한 양보다 한 자릿수(order of magnitude)가 적다고 언급했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube AI Explained (AI 뉴스)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기