최근 모델 출시의 여파가 가라앉고 실제 사용 경험을 바탕으로 공유하는 생각들
요약
최근 출시된 주요 AI 모델들의 실제 사용 경험을 바탕으로 grok 4.5의 우수성과 데이터 수집의 중요성을 분석합니다. 또한 Opus 5의 한계와 모델 학습 방향성이 인간 친화성을 잃어가고 있는 현상을 비판적으로 다룹니다.
핵심 포인트
- grok 4.5는 실시간 데이터와 Cursor 데이터 통합을 통해 매우 쾌적한 성능을 보여줌
- 인기 있는 에이전트 하네스를 통한 사용자 데이터 수집이 모델 성능의 핵심 차별점
- Opus 5는 인간 친화적인 대화 능력보다 기계적 결과물에 치중하여 실패함
- 모델 학습이 인간의 피드백보다 기계적 검증 결과에 과도하게 의존하는 경향이 있음
최근 모델 출시의 여파가 가라앉고, 이 모든 모델들을 실제로 사용할 충분한 시간을 가진 지금, 좀 더 완전한 생각들을 공유해보고자 합니다.
- grok 4.5는 아마도 지난 몇 주 동안 발생한 단일 사건 중 가장 중요한 사건일 것입니다.
저는 다양한 모델 제품군을 사용하는 많은 헤비 유저(heavy users)들과 대화를 나누어 왔으며, grok 4.5가 일상적으로 작업하기에 가장 "쾌적한" 프런티어 모델(frontier model)이라는 점에 거의 의견이 일치합니다. 개발 팀이 어떻게 이 완벽한 스윗 스팟(sweet spot)을 정확하게 찾아내어, 이토록 빠르고 효율적이며 유능한 모델을 만들어냈는지 정말 놀랍습니다.
이는 spacexai가 이제 anthropic 및 openai에 이어 진정한 세 번째 플레이어가 되었음을 증명했습니다. 그들은 인류의 가장 큰 공공 광장으로부터 실시간 데이터를 보유하고 있으며, 인기 있는 에이전트 하네스(agent harness)를 인수했고, 이제 훌륭한 모델을 만들 수 있다는 것을 증명했습니다. 그리고 자세히 살펴보면, 그들은 자체 칩을 설계하고 있으며, 자체 데이터 센터를 보유하고 있고, GPU를 우주로 보내 햇빛으로부터 토큰(tokens)을 만들어낼 수도 있습니다.
세상에나.
- 데이터에 대해 말하자면, 하네스(harness)를 통한 인간의 사용은 좋은 모델을 훈련시키는 데 매우 중요하다는 것이 증명되었습니다. grok 4.5는 cursor의 데이터를 통합한 첫 번째 모델이었으며, 이는 이전 세대의 grok과 비교했을 때 엄청난 차이를 만들어냈습니다.
이것은 왜 amazon이 직원들에게 kiro 사용을 의무화하는지, 왜 meta가 직원 기기에 대규모 감시 체계를 설치했는지, 왜 anthropic이 제3자 하네스(3rd party harnesses)를 금지하는지, 그리고 왜 google이 여전히 gemini로 고전하고 있는지를 설명해 줍니다. 그들은 데이터를 수집할 수 있는 대중적인 채택률을 가진 인기 있는 하네스(harness)를 가지고 있지 않기 때문입니다.
이것이 제가 보조금이 지급되는 LLM 구독이 조만간 끝나지 않을 것이라고 생각하는 이유 중 하나입니다. 광범위한 소비자 채택이 데이터 수집의 가장 좋은 원천이기 때문입니다. 우리는 그들의 모델에 업무를 수행하는 방법을 가르침으로써 보조금이 지급되는 토큰(tokens) 비용을 지불하고 있는 셈입니다.
- opus 5는 실패했습니다. 거의 아무도 좋아하지 않습니다. 그것을 좋아하는 유일한 사람들은 인상적으로 보이지만 아무도 구매하지 않을 3D 게임을 원샷(one-shot)으로 만드는 데 사용하고 있는 것으로 보입니다.
AI가 원샷(one-shot)으로 해낼 수 있는 것이라면 그것은 그저 쓰레기의 정의일 뿐입니다. 왜냐하면 간단한 프롬프트 하나로 그것을 원샷할 수 있다면, 수십억 명의 다른 사람들도 똑같이 할 수 있다는 뜻이기 때문입니다. 이런 방식으로는 가치 있는 그 어떤 것도 만들어낼 수 없습니다.
그리고 이것은 모델 학습(model training)이 미끄러운 경사로를 향해 가고 있다는 더 근본적인 문제의 증상입니다. 즉, 기계가 검증 가능한 결과(machine verifiable outcome)가 인간의 피드백(human feedback)보다 지배적인 위치를 차지하고 있다는 점입니다.
최신 학습 프로세스는 에이전트(agent)가 오랫동안 실행하여 복잡한 프로젝트를 완수하는 것에 보상을 주지만, 에이전트가 인간과 어떻게 대화하는지에 대해서는 더 이상 신경 쓰지 않는 것처럼 보입니다.
전문 용어(jargons), 텍스트의 벽(walls of text), "정직한 실수(an honest mistake)" — opus 5는 우리에게 더 인간 친화적인 AI가 필요하다는 것을 보여주었습니다. 우리가 하루 종일 로봇 같은 재수 없는 놈들(robotic a**holes)과 일하게 되는 세상은 만들지 맙시다.
- fable 5는 여전히 상한선(upperbound)으로서 무패를 기록 중입니다.
저는 지혜(wisdom) 대 근면함(diligence)에 관한 이전 포스트에서 이 이야기를 했습니다. 벤치마크(benchmarks)는 이 두 가지를 혼합해 놓았기 때문에 구분하기 쉽지 않지만, fable 5는 모든 벤치마크에서 승리하지는 않더라도 "지혜" 차원에서는 역대 최고(GOAT)입니다. 만약 여러분이 이를 의미 있게 사용해 보았다면, 제가 무엇을 말하는지 알 것입니다.
그렇긴 하지만, Anthropic은 오픈 모델(open models)을 포함한 다른 플레이어들이 동일한 지능 수준에 도달하는 것에 대해 극도로 편집증적인 태도를 보이는 것 같습니다. 이는 해자(moat)가 강력하지 않다는 신호이기도 합니다. kimi k3는 그것이 어떤 모습일지에 대한 일종의 예고편에 불과합니다.
동시에, fable은 토큰 비용(token cost)이 매우 현실적인 문제가 되는 첫 사례입니다. 지금까지 제가 하루 종일 계속 사용할 여유가 없는 유일한 모델입니다. 저는 이 상황이 당분간 지속될 것이라고 의심하며, 우리는 fable 급의 모델을 일상적인 주력(daily driver)으로 사용하는 것이 아니라 어떤 작업에 맡길지 선택하고 골라야 할 것입니다.
- OpenAI는 흥미로운 위치에 있습니다.
GPT 모델들은 효율성 측면에서 훌륭했지만, 이제 grok 또한 매우 경쟁력이 있습니다. 또한 GPT는 아직 fable이 도달한 것과 같은 지혜의 상한선에 완전히 도달하지 못했습니다 — 비록 GPT 6가 이를 바꿀 수도 있겠지만 말입니다.
저는 OpenAI가 추구해야 할 두 가지 관점이 있다고 생각합니다:
-
효율성 (efficiency)에 계속해서 베팅하고, Claude가 너무 비싸고 Grok이 브랜드 비용 (brand tax)을 지불해야 하는 상황을 이용해 기업 도입 (enterprise adoption)을 추구하는 것입니다. 이는 매우 실행 가능한 전략입니다.
-
또는.. 지혜 (wisdom) 측면에서 Fable과 정면 승부하여 "인간 친화적 (human friendly)"인 측면에서 그들을 이기는 것입니다. 비록 전통적으로 이것이 OpenAI 모델들의 강점도 아니었기에, 이는 낮은 투자 대비 수익 (low-ROI) 옵션처럼 느껴집니다.
좋습니다, 다소 긴 글이었지만 지형이 점점 더 복잡해지고 있습니다. 이러한 생각들이 현재 일어나고 있는 모든 일들을 합리화하는 데 참고가 될 수 있는 자료로서 도움이 되기를 바랍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기