
gpt-6 astra와 claude fable 5.1이 같은 가격표를 가지고도 완전히 다른 청구서가 나오는 이유를 알아내기 위해 20시간을
요약
GPT-6, Astra, Claude Fable 5.1 등 최신 LLM들의 가격표가 동일해도 청구서가 다른 이유를 분석했습니다. 실제 비용은 단순히 표면적인 가격이 아닌, 캐시 읽기(cache reads)와 같은 에이전트 작업의 복잡한 워크로드에 의해 결정됩니다. Astra는 컴퓨터 활용 능력과 속도에서 강점을 보였고, Fable 5.1은 코딩 지구력과 효율적인 비용 구조를 가졌습니다.
핵심 포인트
- 실제 LLM 비용은 표면 가격보다 캐시 읽기 등 워크로드에 의해 결정됨.
- Astra는 컴퓨터 활용 및 속도에서 강점을 보이며, Fable 5.1은 코딩 지구력과 효율성을 갖춤.
- Gemini 3.8 Flash와 같은 모델이 일상적 작업에는 충분하며 비용 효율적임.
- 단일 공급업체 종속성 위험을 피하기 위해 워크로드를 여러 계층의 모델에 분산해야 함.
저는 gpt-6, astra, 그리고 claude fable 5.1이 정확히 같은 가격표를 가지지만 완전히 다른 청구서를 받는 이유를 알아내기 위해 20시간을 보냈습니다.
두 모델 모두 이틀 간격으로 출시되었고, 각각 백만 토큰당 입력 $10, 출력 $50을 부과합니다. 서류상으로는 동일하지만, 실제로 사용해보면 그렇지 않습니다.
astra의 진정한 강점은 컴퓨터 활용 능력입니다. 소프트웨어를 직접 작동시키고, 양식을 작성하며, CRM 기록을 업데이트하고, 리서치를 수행하며, 웹사이트를 구축하고 자체 프론트엔드를 QA 검사할 수 있습니다. 이 작업에서 astra는 osworld 2.0에서 약 40분 만에 72.6%의 성능을 보였는데, 이는 sol이 75분에 기록한 65.7%보다 높은 수치입니다. 또한 OpenAI 자체 페이지에서 확인된 매우 인상적인 안전성 지표도 있습니다: hugging face 사고 이후 특별히 구축된 새로운 평가(eval)에서, sol은 생산 환경 보호 장치가 없음에도 불구하고 48%의 확률로 승인 범위를 벗어났습니다. 반면 astra는 이 비율이 0%였습니다.
fable 5.1의 진정한 강점은 지구력과 코딩 능력입니다. terminal-bench-science에서 opus 5의 29%, sol의 22.4%를 능가하는 52.6%를 기록했습니다. 또한 terminal-bench 4.0에서도 55.8%를 달성했습니다. 세 가지 노력 수준(effort levels) 중 낮음과 중간 수준은 비용을 훨씬 적게 들여도 fable 5.1의 결과와 일치하는 경우가 많습니다.
이것이 제가 그 20시간 동안 가장 많이 추적한 내용입니다. 바로 캐시 읽기(cache reads)입니다. fable 5.1은 백만 토큰당 $0.25를 부과하지만, astra는 $1을 부과하여 네 배나 비쌉니다. 에이전트 작업(agentic work)은 단일 작업에서 동일한 컨텍스트를 수십 번 재읽기 때문에, 실제 워크로드에서는 캐시 읽기가 새로운 입력보다 훨씬 큰 비용을 차지합니다. 이 부분이 실제로 청구되는 금액을 결정하며, 단순히 표면에 적힌 가격표가 아닙니다. 또한 astra는 272k 입력 토큰을 초과할 경우 추가 요금을 부과하여 전체 요청에 대해 $20/$75를 적용합니다.
이번 주에 돌고 있는 벤치마크 비교 자료에 대해서도 솔직하게 언급할 가치가 있습니다. 어느 쪽도 상대방을 직접 테스트한 적이 없습니다. 심지어 공유된 벤치마크인 osworld 2.0조차 두 발표 사이에서 세 가지 다른 점수 산정 방식(scoring methods)으로 보고되고 있습니다. 따라서 이들을 비교하는 모든 표는 동일한 테스트가 아닌 서로 다른 측정치를 비교하고 있는 것입니다.
gemini 3.8 flash는 여기에서 지능으로 경쟁하려 하지도 않습니다. 입력 $0.75, 출력 $3.75로 양쪽 모두 13배의 격차를 보입니다. 메시지 분류, 통화 요약, 송장(invoice)에서 필드 추출과 같은 대부분의 일상적인 작업에는 프론티어 모델(frontier model)이 전혀 필요하지 않으며, 어쨌든 이를 구동하는 것은 사용하지도 않을 역량에 대해 프론티어 가격을 지불한다는 의미입니다.
20시간을 보내고 난 후 실제 얻은 교훈은 이렇습니다. astra는 컴퓨터 사용, 속도, 그리고 작업 경계 내에 머무르는 능력에서 승리합니다. fable 5.1은 코딩, 연구 지구력(stamina), 그리고 진정한 에이전트적 청구서(agentic bills)를 결정하는 캐시 읽기 라인에서 승리합니다. flash는 일상적인 작업 비용 면에서 한 자릿수 차이로 승리합니다. 올바른 전략은 하나의 우승자를 선택하는 것이 아니라, 워크로드를 여러 계층에 분산시키고 시스템을 구축하여 그 아래의 모델이 교체 가능하도록 만드는 것입니다. 왜냐하면 두 개의 프론티어 연구소(lab)가 서로 48시간 간격으로 출시했기 때문에, 이것만으로도 단일 공급업체 종속성(single-vendor lock-in)이 이론적인 위험이 아니라 실제 위험임을 알려줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @cyrilxbt (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기