
Kimi K3, 그리고 pelican 벤치마크에서 여전히 배울 수 있는 것들
요약
Moonshot AI가 2.8조 개의 파라미터를 가진 대규모 모델 Kimi K3를 발표했습니다. 이 모델은 주요 벤치마크에서 Claude 및 GPT 시리즈와 경쟁하며, 높은 성능과 효율적인 토큰 사용량을 보여줍니다.
핵심 포인트
- 2.8조 파라미터 규모의 오픈 3T급 모델 발표
- Claude Fable 5 및 GPT-5.6 Sol과 경쟁하는 성능
- 이전 모델 대비 출력 토큰 사용량 21% 감소
- Frontend Code 아레나에서 Claude Fable 5를 능가
Kimi K3, 그리고 pelican 벤치마크에서 여전히 배울 수 있는 것들
2026년 7월 16일
중국의 AI 연구소 Moonshot AI가 오늘 아침 Kimi K3를 발표하며, 이를 "2.8조 개의 파라미터(parameters)를 가진 현재까지 가장 유능한 모델"이라고 설명했습니다. 현재 이 모델은 웹사이트와 API를 통해 사용할 수 있지만, "2026년 7월 27일까지" 오픈 웨이트(open weight) 출시가 약속되었습니다.
Moonshot은 이를 최초의 "오픈 3T급 모델"(2.8조를 3조로 반올림한 것으로 보입니다)이라고 부르며, DeepSeek의 1.6T v4 Pro로부터 왕좌를 빼앗았습니다. 자체 보고된 벤치마크(benchmarks)에 따르면 K3는 Claude Opus 4.8 max와 GPT-5.5 high를 대부분 앞서지만, Claude Fable 5와 GPT-5.6 Sol에는 뒤처지는 것으로 나타났습니다.
해당 모델에 대한 Artificial Analysis 보고서의 몇 가지 주요 내용은 다음과 같습니다:
- "우리의 자체적인 장기 지식 작업 평가(long-horizon knowledge work evaluation)에서 Kimi K3는 Kimi K2.6보다 732포인트 높은 1547의 전체 Elo 점수를 기록했으며, Claude Fable 5에 이어서 두 번째를 차지했습니다."
- "작업당 비용($0.94)은 GPT-5.6 Sol($1.04)과 유사하며, Opus 4.8($1.80)의 약 1/2 가격이고 오픈 웨이트(open weights) 경쟁 모델들보다는 높습니다."
- "Artificial Analysis Intelligence Index에서 Kimi K3의 토큰(token) 사용량이 크게 감소하여, K2.6보다 출력 토큰(output tokens)을 21% 적게 사용했습니다."
또한 이 모델은 현재 Arena.ai의 Frontend Code 아레나(arena)에서 Claude Fable 5를 능가하며 선두를 달리고 있습니다.
이 새로운 모델은 가격 책정 면에서 주목할 만합니다: 입력 토큰 100만 개당 $3, 출력 토큰 100만 개당 $15로, Anthropic의 Claude Sonnet 시리즈와 같은 수준이며, 중국 AI 연구소가 지금까지 출시한 모델 중 가장 비쌉니다. 이는 Kimi K2.6($0.95/$4)과 같은 이전 모델들에 비해 상당히 증가한 수치입니다. 2.8조 개의 파라미터(parameters) 또한 해당 1T 모델보다 두 배 이상 큰 규모입니다.
하지만 얼마나 pelican(펠리컨)할까요?
저는 (Moonshot API 키를 발급받는 번거로움을 피하기 위해) OpenRouter를 사용하였고, llm-openrouter 플러그인을 사용하여 자전거를 타는 펠리컨의 SVG를 생성해 보았습니다:
llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'
다음은 그 기록입니다. 다음과 같이 보입니다:

그 펠리컨(pelican)은 95개의 입력 토큰(input tokens)과 16,658개의 출력 토큰(output tokens)(그 중 13,241개는 추론 토큰(reasoning tokens))을 사용했으며, 총 비용은 25센트였습니다!
K3는 이미지 입력을 수용하기 때문에, 위에서 렌더링된 SVG(내 대체 텍스트 프롬프트 포함)를 대상으로 실행해 보았고 (0.6센트의 비용으로) 다음과 같은 결과를 얻었습니다:
빨간색 스카프를 두르고 회색 도로 위 빨간색 자전거를 타고 달리는 흰색 펠리컨의 만화 삽화; 도로에는 흰색 점선이 그려져 있음; 펠리컨은 커다란 주황색 부리와 페달을 밟는 주황색 물갈퀴 발을 가지고 있으며, 뒤에는 흰색 움직임 선이 있음; 배경에는 흰 구름이 있는 연한 파란색 하늘, 노란 태양, 날아다니는 두 마리의 작은 검은 새, 그리고 전경에는 작은 흰 꽃이 피어 있는 초록색 풀이 보임
펠리컨으로부터 무엇을 배울 수 있는가?
'자전거를 타는 펠리컨의 SVG 생성하기' 테스트를 수행한 지 이제 21개월이 되었습니다. 이 테스트는 결코 특별히 훌륭한 벤치마크(benchmark)는 아니었습니다. 처음에는 이 모델들을 비교하는 것이 얼마나 터무니없이 어려운지를 보여주는 농담으로 시작되었지만, 첫 1년 동안은 모델들이 실제로 얼마나 뛰어난지와 놀라운 상관관계를 보였습니다.
하지만 그 연결 고리는 이제 대부분 끊어졌습니다. GPT-5.6과 Claude Fable 5의 펠리컨들은 GLM-5.2에 의해 압도당했으며, 제가 GLM을 매우 좋아하긴 하지만 그것이 Fable급 모델이라고 생각하지는 않습니다.
(저는 여전히 연구소들이 이 벤치마크를 위해 학습시키고 있다는 점에는 확신이 없습니다. 만약 그랬다면 훨씬 더 나은 결과를 기대했을 것입니다. 다만 Gemini가 탈것을 탄 동물이라는 어떤 조합에 대해서든 최적화(optimized)했을 가능성은 있습니다!)
펠리컨의 가장 큰 한계는 오늘날의 모델에서 가장 중요한 요소, 즉 에이전트적 도구 호출(agentic tool calling)과 대화가 길어짐에 따라 도구를 안정적으로 작동시키는 능력에 대해서는 전혀 다루지 않는다는 점입니다.
그러니 모델을 비교하기 위해 펠리컨을 사용하지 마세요!
그럼에도 불구하고, 저는 여전히 이 벤치마크를 직접 실행함으로써 상당한 가치를 얻고 있습니다.
첫째로, 이는 실제로 모델을 테스트하게 만드는 강제 장치 (forcing function) 역할을 합니다. 제가 펠리컨을 보여드린다는 것은, 제가 해당 모델에 프롬프트를 실행하는 데 성공했다는 의미입니다. 모델에 공식 API가 있다면 그것을 사용할 것이고, 만약 오픈 웨이트 (open weight) 모델이며 (128GB M5 MacBook Pro에 들어갈 만큼 충분히 작다면) 제 개인 기기에서 실행해 볼 것입니다. 보통 llama.cpp나 LM Studio 또는 Ollama를 통해 실행합니다. 저는 종종 OpenRouter를 사용하는데, 이는 새로운 API 키를 발급받을 필요 없이 공식 API에 대한 프록시 (proxy)를 제공해주기 때문입니다.
제 펠리컨 대부분은 제가 만든 LLM CLI 도구를 사용하여 생성되며, 이는 해당 도구의 플러그인 중 하나를 통해 최신 모델들이 지원되는지 확인하도록 저를 독려하는 데 도움이 됩니다.
하지만 더 중요한 점은, "자전거를 타는 펠리컨의 SVG를 생성해줘"라는 단 한 번의 프롬프트 실행만으로도 흥미로운 모델의 특성을 드러낼 수 있다는 것입니다.
오늘의 Kimi K3 결과를 살펴보겠습니다. 이러한 간단한 프롬프트들을 실행하는 것은 모델에 관한 몇 가지 핵심적인 사항들을 강조하는 데 도움이 되었습니다.
- 현재 이 모델은 단 하나의 추론 노력 (reasoning effort) 단계인 "max"만을 가지고 있으며, 그 특징이 명확히 드러납니다. 모델은 3,417 토큰의 응답을 출력하기 위해 13,241개의 추론 토큰 (reasoning tokens)을 소비했습니다. 이는 비용이 많이 듭니다. 펠리컨 한 마리에 25센트가 들었습니다!
- "자전거를 타는 펠리컨의 SVG를 생성해줘"라는 프롬프트가 어떻게 95개의 입력 토큰이 될 수 있을까요? OpenAI의 토크나이저 (tokenizer)는 10개로 계산하며, Anthropic은 Opus 4.6의 경우 10개, Opus 4.7은 30개, Sonnet 5/Fable 5는 25개로 계산합니다. Kimi K3에 "hi"라고 프롬프트를 입력했을 때 86개의 토큰이 계산되었는데, 이는 85개의 토큰으로 구성된 숨겨진 시스템 프롬프트 (system prompt)가 있을 가능성을 시사합니다. 하지만 모델은 이를 유출하기를 거부했습니다.
- 시각 (Vision) 기능은 잘 작동합니다. 모델이 생성한 대체 텍스트 (alt text)는 매우 훌륭합니다.
K3는 현재 하나의 사고 노력 (thinking effort) 단계만 가지고 있지만, 저는 최근 동일한 펠리컨 프롬프트를 서로 다른 노력 단계로 실행하여 그것들이 어떤 영향을 미치는지 빠르게 파악함으로써 꽤 많은 가치를 얻고 있습니다. 예를 들어, 여기 GPT-5.6 모델 제품군에 대한 저의 매트릭스 (matrix)가 있습니다.
하지만 정말로 펠리컨 테스트를 통해 제가 얻는 주요 사항들은 다음과 같습니다:
- 모델 프롬프팅 (prompting)을 위한 "hello world" 연습입니다.
- 간단한 작업에 대한 대략적인 비용 및 추론 (reasoning) 추정치입니다.
- 모델이 유효한 SVG를 출력할 수 있으며, 기하학 (geometry) 및 공간 인지 (spatial awareness)에 대한 기본적인 개념을 가지고 있음을 확인해 줍니다. 이는 제 노트북에서 실행되는 더 작은 모델들에게 훨씬 더 큰 의미를 갖습니다.
- 동일한 모델 제품군 내에서 릴리스 간의 pelican을 비교하는 것은 여전히 흥미롭습니다. K3의 pelican은 Kimi 2.5에 비해 눈에 띄는 개선을 보여줍니다.
- 제가 직접 시도해 보았음을 보여줄 수 있는 공유 가능한 결과물입니다. 게다가 pelican이 포함된 댓글을 다는 것은 이제 Hacker News의 일종의 전통이 되었습니다. 제가 게시가 늦을 때마다 어디에 있느냐고 묻는 댓글을 받곤 합니다!
AI 자동 생성 콘텐츠
본 콘텐츠는 Simon Willison Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기