Claude Haiku 5.5
요약
Anthropic이 Haiku 5.5를 출시하며 가격 경쟁력을 크게 강화했습니다. 이 모델은 특히 분류나 요약 같은 저비용 작업에 적합하며, 기존 Claude 모델 대비 현저히 낮은 비용으로 높은 성능을 제공합니다. 또한, Anthropic은 구독자에게 월간 API 크레딧을 지급하는 등 플랫폼 활용도를 높이는 전략을 펼치고 있습니다.
핵심 포인트
- Haiku 5.5는 저비용 작업에 최적화되어 가성비가 뛰어남.
- Anthropic이 경쟁력 있는 저가 LLM 시장 진입에 성공함.
- 구독자에게 월간 API 크레딧을 제공하여 플랫폼 사용 유도.
- 토큰당 고정 요금제보다 실제 연산량 기반 가격 책정이 합리적임.
가격 체계가 좀 이상함. 프롬프트가 10만 토큰 이하면 100만 토큰당 입력 $0.10, 출력 $0.50인데, 10만 토큰을 넘으면 입력 $0.50, 출력 $2.50로 올라감. 10만 토큰 기준은 터무니없이 낮고 Sonnet이나 Opus가 아닌 Haiku에만 적용됨. 에이전트 작업이라면 금방 넘길 수준이지만, 일반적인 생성이나 Jev 같은 분류 작업에는 가성비가 좋음. 본문에 따르면 이런 작업이 Haiku 사용량의 대다수를 차지한다고 함.
어느 구간이든 Haiku 4.5의 입력 $1·출력 $5보다 훨씬 저렴하며, GPT-6 Luna의 입력 $0.10·출력 $0.50와 더 잘 경쟁할 가격임. 처음에는 Luna에 토큰 기준이 없는 줄 알았는데, 수정하자면 27만 2천 토큰 기준이 있다고 함.
토크나이저 효율 차이도 있음. 최신 Claude의 10만 토큰은 최신 GPT 기준 약 6만~6만 5천 토큰에 해당하므로, 실제로 Luna의 가격 인상 기준은 Haiku보다 훨씬 멀리 있음.
Anthropic의 count_tokens 엔드포인트나 https://crates.io/crates/tokwc로 확인할 수 있음.
오히려 기존의 토큰당 고정 요금제가 이상함. 인코딩과 디코딩 모두 연산량이 선형으로 늘지 않으므로, 제공업체는 예상 평균 길이를 고려해 가격을 정해야 함. 이번 요금제는 실제 토큰 생성 비용에 더 가까워지는 것임.
Haiku 5.5는 GPT-6 Luna보다 확실히 똑똑해서 이런 가격 전략이 이해됨. Anthropic에는 한동안 요약, 문맥 압축, RAG 보조 등에 쓸 가성비 좋은 저가 LLM이 부족했음.
이런 일회성 작업은 대개 10만 토큰 미만이거나 그 안에 들어오도록 구성할 수 있음. 일부 코딩 벤치마크에서는 Haiku 5.5가 Sonnet 5도 이김. 특히 요구사항이 명확한 Jira 티켓 구현 같은 작업에서 그러하며, 불과 몇 달 사이 비용 대비 지능이 크게 높아진 것이 인상적임.
Luna에도 더 높은 기준이 적용됨. OpenAI 웹사이트에 따르면 입력이 27만 2천 토큰을 초과하는 프롬프트는 요청 전체에 입력·캐시 요금 2배, 출력 요금 1.5배가 적용됨.
Haiku의 권장 용도 중 하나가 Jev와 경쟁하는 분류 요청이라는 점이 눈에 띔. 가격도 OpenAI의 Jev 경쟁 서비스인 "Decisions API"에 쓰이는 GPT-6 Luna와 같음.
이 용도에는 입력 10만 토큰이면 충분함. 다만 Anthropic과 OpenAI의 100만 토큰당 $0.10도 Jev의 $0.04보다는 2.5배 비쌈.
Anthropic이 이제야 경쟁력 있는 저가 모델을 내놓음. Haiku 4.5는 몇 달째 성능 대비 너무 비쌌고, 출시 당시에도 그다지 인상적이지 않았던 것 같음. 이번 모델은 실제로 일부 용도에 쓸 만해 보임.
공개한 벤치마크만큼 Luna보다 성능이 좋다면 내 작업 흐름에서도 Luna를 대체할 듯함. 가격이 오르는 10만 토큰 기준은 낮지만, 나는 원래 소형 모델을 작은 작업에 쓰는 편임.
이번 주부터 Claude Platform에서 쓸 월간 API 크레딧을 모든 Max·Team 구독자에게 지급한다고 함. Max 5x는 월 $100, Max 20x는 $200이며, Team은 사용자들이 공동으로 쓰는 크레딧을 최대 $500까지 받게 됨.
내게는 아주 큰 혜택임. 이제 추가 비용을 내거나 온디바이스 모델에 전적으로 의존하지 않고도, 구독에 포함된 혜택으로 실제 AI 강화 기능을 출시할 수 있음. 다만 사용자에게 불리한 변경의 충격을 줄이려는 조치일까 봐 걱정됨.
OpenAI도 일주일 안에 자사 요금제에 추가할 것 같음.
API에 묶어 두려는 전략임. 무료 할당량을 중단한 뒤에도 계속 돈을 내길 바라는 것임.
Max 요금제의 월간 API 크레딧은 특히 Haiku 가격까지 고려하면 정말 좋아 보임. 평소 Claude Code 사용에 더해 다른 실행 도구와 용도에도 Claude 구독을 활용하는 것이 내가 원하던 전부임.
지난 몇 주간 Anthropic은 계속 올바른 선택을 하는 반면, OpenAI는 기회를 놓치고 있음.
구독 할당량으로 실행하는 오케스트레이터가 API 에이전트 여러 개를 띄우는 구성은 특히 효율적일 수 있음. 원래도 배치 요금으로 쉽게 비용을 아낄 수 있었는데, 거기에 공짜 크레딧까지 주며 장려하는 셈임.
각 모델의 표준 속도로 비교하면 Haiku 5.5가 가장 빠르지만, Fast Mode의 Opus보다는 느리다고 함.
Opus 5.5는 OpenRouter에서 평균 초당 117토큰이므로, 굳이 이를 밝힐 정도라면 Haiku가 적어도 초당 10~20토큰은 느린 게 아닐까 싶음. 마케팅에 도움이 되지도 않는데 왜 언급했는지는 모르겠음. https://openrouter.ai/anthropic/claude-opus-5.5
독자들이 관심을 가질 만한 정보라고 생각했을 수도 있음.
Anthropic이 다른 운영체제도 지원해 줘서 반가움.
AI LLM에도 무어의 법칙에 해당하는 규칙이 있는지 궁금함. 이 기술은 얼마나 자주, 어떤 주기로 발전한다고 기대할 수 있을까?
지난 약 5년간 같은 품질을 내는 효율이 18개월마다 90%씩 개선됐으며, 추세가 둔화할 조짐은 거의 없음. 오히려 시스템 1 모델과 잠재적인 1-2-3 작업 흐름이 향후 3~5년에 걸쳐 개선 속도를 더 높일 가능성도 있음.
7B 같은 소형 모델과 32B 모델의 지능 격차가 줄지 않고 커지기 시작하면 이 추세가 멈췄다는 신호임. 그때는 7B가 해당 크기에서 가능한 지능의 한계에 가까워졌다는 뜻이며, 이후 32B, 70B 등이 차례로 뒤따를 것임. 내가 아는 한 아직 어떤 크기에서도 그런 현상은 나타나지 않았음.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기