
Kimi K3와 Claude Fable 5 실측 비교: 차이가 나타난 것은 추론력보다 출력 예산과 검증성
요약
Kimi K3와 Claude Fable 5의 추론 성능을 확률, 물리, 논리 문제 등을 통해 실측 비교한 분석 보고서입니다. 두 모델의 응답 시간, 중간 계산 과정의 일관성, 토큰 사용량 및 검증 가능성을 심층적으로 다룹니다.
핵심 포인트
- Kimi K3는 응답 시간은 길지만 수식 전개와 중간 계산의 일관성이 뛰어남
- Claude Fable 5는 응답 속도가 빠르며 검증 가능한 코드 생성에 유리함
- 긴 생성 시 finish_reason과 실행 테스트를 통한 검증이 필수적임
- 모델별로 추론 토큰 사용량과 출력 예산에 따른 성능 차이가 존재함
모델 비교에서 간과하기 쉬운 점은 HTTP 200 응답과 결과물의 완성이 동일하지 않다는 점입니다. 본고에서는 최종 답변뿐만 아니라 finish_reason, 중간 계산, 실행 가능한 코드까지 확인했습니다.
Fable 5의 평균 응답은 37.1초, Kimi K3는 108.0초였습니다. 반면, 확률 문제의 중간 계산은 Kimi K3가 더 일관적이었습니다.
Test date: 2026-07-17
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
...
두 모델에는 동일한 프롬프트와 검증 조건을 부여했습니다. HTTP 200만을 성공으로 간주하지 않고, 최종값, 중간 상태, finish_reason, 실행 가능한 Python, 동일한 assert를 확인했습니다.
Python 함수에서는 request_id별 재시도(retry) 통합, ISO-8601 시간, 반개구간 [start,end), 토큰(token)과 지연 시간(latency)의 집계, 다단계 정렬(multi-stage sort)을 다루었습니다.
Round 1, max_tokens=4000:
Kimi K3 finish_reason=length
Fable 5 finish_reason=length
...
max_tokens=4000에서는 둘 다 length로 종료되었습니다. 7000으로 늘리자, 두 Python 구현 모두 동일한 8개의 assert를 통과했습니다.
| 과제 | Kimi K3 | Claude Fable 5 |
|---|---|---|
| HHTH 확률 문제 | 통과 | 최종값은 맞지만, 중간 계산에 오류 |
| ... |
평균 응답 — Kimi K3: 108.0 s
평균 응답 — Claude Fable 5: 37.1 s
편향된 동전으로 P(H)=3/5일 때, 패턴의 중복을 허용하며 HHTH가 처음 나타날 때까지의 기대 투척 횟수를 구했습니다. 올바른 결과는 다음과 같습니다.
E[T] = 715/54 ≈ 13.2407407407
E1 = 625/54
E2 = 475/54
...
Kimi K3는 상태 방정식, border 공식, 공정한 동전의 특수 사례를 대조했습니다. Fable 5는 최종값은 맞았으나, 두 가지 중간 상태에서 산술적 불일치가 있었습니다.
Kimi K3 completion tokens: 13,975
Kimi K3 reasoning tokens: about 12,500
Fable 5 completion tokens: 10,187
Kimi K3는 첫 회에 약 12,500개의 reasoning tokens를 보고했습니다. 검증은 철저하지만, 대기 시간과 긴 코드의 가시적 출력에 영향을 미칩니다.
물리 문제는 완전 비탄성 충돌, 마찰, 용수철 압축의 2단계로 구성했습니다. 두 모델의 결과는 다음과 같습니다.
Post-collision speed: 2.4 m/s
Energy lost in collision: 21.6 J
Maximum compression: about 0.2212 m
물리 문제의 최대 압축량은 약 0.2212 m였으며, 근무표의 유일한 해는 Eli, Bo, Ada, Cici, Deng이었습니다.
두 모델은 동일한 유일한 평일 스케줄을 도출했습니다.
| 월요일 | 화요일 | 수요일 | 목요일 | 금요일 |
|---|---|---|---|---|
| Eli | Bo | Ada | Cici | Deng |
물리 문제의 최대 압축량은 약 0.2212 m였으며, 근무표의 유일한 해는 Eli, Bo, Ada, Cici, Deng이었습니다.
- 빠른 검증 가능한 코드는 Fable 5부터 시도할 것
- 엄격한 수식 전개에는 Kimi K3를 남겨둘 것
- 긴 생성에서는
finish_reason과 실행 테스트를 필수적으로 할 것
이는 소규모 실측이며 보편적인 랭킹은 아닙니다. 실제 운용에서는 각 카테고리를 20~50회 반복하여 성공률, 중간 중단율, 첫 토큰 시간, P50/P95/P99 지연 시간, completion tokens, 채택 결과당 비용을 측정해야 합니다.
본 테스트에서는 Fable 5가 빠른 실무 루트, Kimi K3가 수식의 중간 일관성을 중시하는 루트라는 차이가 보였습니다.
from openai import OpenAI
client = OpenAI(api_key="YOUR_API_KEY", base_url="https://cn.crazyrouter.com/v1")
response = client.chat.completions.create(
...
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기