
Kimi K3와 GPT-5.6-SOL 비교: 수학, 물리, 프로그래밍 고난도 실측
요약
Kimi K3와 GPT-5.6-SOL 모델을 대상으로 수학, 물리, 프로그래밍 고난도 추론 능력을 비교 테스트한 결과입니다. GPT-5.6-SOL은 모든 문제에서 정확한 답변을 반환했으나, Kimi K3는 토큰 제한 및 타임아웃 문제로 인해 완전한 답변을 내놓지 못했습니다.
핵심 포인트
- GPT-5.6-SOL은 수학, 물리, 프로그래밍 전 영역에서 완전한 답변 제공
- Kimi K3는 토큰 상한 및 타임아웃 문제로 인해 추론 과정 중단 발생
- GPT-5.6-SOL의 프로그래밍 코드는 논리적으로 우수하나 샘플 테스트 오류 발견
- 고난도 추론 태스크에서 모델별 토큰 소모량 및 응답 안정성 차이 확인
이번에는 간단한 Q&A가 아니라, 연속적인 추론 (Reasoning)이 필요한 3문항으로 고정했습니다. 구체적으로는 패턴 중첩과 2차 모멘트 (Second Moment)를 포함하는 확률 문제, 도르래의 회전 관성 (Rotational Inertia)과 실의 느슨함으로의 전환이 포함된 물리 문제, 그리고 closure, 다일 용량 (Multi-day capacity), 3단계 tie-break에 의존하는 Python 문제입니다. 두 모델 모두 동일한 인터페이스, 동일한 프롬프트, 유사한 출력 상한을 사용하였으며, 도구 (Tool) 사용이나 인터넷 연결은 활성화하지 않았습니다.
먼저 결론부터 요약하겠습니다.
gpt-5.6-sol은 3문제 모두에서 완전한 가시적 답변을 반환하였으며, 수학과 물리의 참조 결과도 정확했습니다.
kimi-k3는 첫 번째 6500 token 상한에서는 수학과 물리 모두 finish_reason=length로 종료되어 가시적인 답변이 비어 있었습니다. 수학은 상한을 10000으로 높였음에도 여전히 도중에 끊겼습니다. 프로그래밍 문제는 약 245초 후에 read timeout이 발생했습니다.
GPT-5.6-SOL의 프로그래밍 구현은 의존성 폐쇄 (Dependency closure), 다일 용량, tie-break, 무효한 의존성, 순환 의존성 (Circular dependency)의 독립 추가 체크를 모두 통과했으나, 스스로 첨부한 첫 번째 assert 샘플에는 기대값 오류가 있었습니다. 즉, "코드 본체가 올바른 것"과 "샘플 테스트도 전부 올바른 것"은 분리하여 평가해야 합니다.
참고로, 여기서의 지연 시간은 이번 요청에서 관측된 값이며 고정된 SLA를 의미하지는 않습니다. 첫 번째 병렬 요청에서 GPT의 수학과 물리 응답이 HTTP 408을 반환했기 때문에, 그 이후에는 순차적 재시도 (Retry)로 전환했습니다. 따라서 속도는 어디까지나 호출 경험의 관측치이며, 절대적인 순위 매기기에는 사용하지 않았습니다.
테스트 일시는 베이징 시간 2026-07-17부터 2026-07-18이며, 인터페이스는 다음과 같습니다.
POST https://cn.crazyrouter.com/v1/chat/completions
model: kimi-k3 / gpt-5.6-sol
temperature: 0.2
첫 시도는 공통적으로 수학과 물리는 max_tokens=6500, 프로그래밍은 max_tokens=7500으로 설정했습니다. 각 문제에서는 검산 가능한 유도 과정 또는 실행 가능한 코드 제시를 요구하였고, finish_reason, completion/reasoning token, 요청 지연 시간, 수치의 정확성, 그리고 코드가 Python 3.11에서 독립적으로 실행 가능한지를 기록했습니다.
| 태스크 | kimi-k3 | gpt-5.6-sol | 판정 |
|---|---|---|---|
| 수학: HHTH의 기대값과 분산 | length, 186.98 s, 6500 tokens; 가시적 내용 없음 | 순차 재시도 stop, 236.07 s, 6872 tokens | GPT는 완전한 답변; Kimi는 첫 시도에서 답안 형성에 이르지 못함 |
| 물리: 도르래, 착지, 용수철 | length, 202.05 s, 6500 tokens; 가시적 내용 없음 | 순차 재시도 stop, 156.29 s, 4501 tokens | GPT는 완전하며 수치도 정확함 |
| 프로그래밍: 의존성 폐쇄 백팩 | 245.54 s 후에 TimeoutError 발생 | stop, 87.96 s, 4514 tokens | GPT의 코드는 실행 가능; Kimi는 완전한 코드를 반환하지 않음 |
| Kimi 수학 재측정 | length, 286.99 s, 10000 tokens | — | 예산을 늘려도 종료되지 않음 |
Kimi의 수학과 물리 요청에서는 인터페이스상의 reasoning token이 각각 6497 전후였습니다. 수학 재측정에서는 reasoning token이 9997 전후였습니다. 이는 Kimi에게 추론 능력이 없다는 의미가 아니라, 이 문제 설정과 현재의 라우팅 (Routing)에서는 추론 예산을 다 쓰기 쉬워 호출 측에서 최종 답안을 받지 못할 수 있음을 나타냅니다.
문제는 앞면 확률 p=3/5, 뒷면 확률 q=2/5인 동전을 계속 던질 때, HHTH가 처음 나타날 때까지의 횟수를 T라고 할 때의 E[T]와 Var(T)를 구하는 것입니다. 패턴 중첩은 허용됩니다.
올바른 전방 오토마톤 (Forward Automaton)의 상태는 S0=빈 접두사, S1=H, S2=HH, S3=HHT, S4=HHTH (흡수 상태)입니다. 중요한 것은 S2 --H--> S2입니다.
라는 전이로, HH 다음에 다시 H가 나와도 최장 접미사(longest suffix)는 여전히 HH이며, 실수로 공백 상태(empty state)로 돌아가서는 안 됩니다.
GPT-5.6-SOL이 세운 1차 모멘트 방정식(first moment equation)은 다음과 같습니다.
M0 = 1 + p M1 + q M0
M1 = 1 + p M2 + q M0
M2 = 1 + p M2 + q M3
...
나아가 2차 모멘트 방정식(second moment equation)을 세우면 다음과 같이 얻어집니다.
E[T] = 715/54 ≈ 13.2407407407
E[T²] = 195335/729 ≈ 267.9492455418
Var(T) = 270115/2916 ≈ 92.6320301783
기댓값은 경계 공식(boundary formula)으로도 독립적으로 검산할 수 있습니다. HHTH의 비공백 진정한 경계(non-empty true boundary)는 단일 문자 H이므로, E[T] = 1/p + 1/(p³q) = 715/54입니다. GPT의 완전한 답변은 상태 전이(state transition), 2차 모멘트의 전개, 그리고 산티티 체크(sanity check)까지 한 차례 모두 포함하고 있었습니다. Kimi는 6500과 10000 중 어느 상한에서도 가시적인 유도 과정을 보여주지 못했기 때문에, 이번에는 수학적 정확성을 채점할 수 없어 '예산 내 미완료'로 기록했습니다.
설정은 다음과 같습니다. m_A=4.0 kg은 25°의 거친 경사면 위에 있으며, μ_k=0.18입니다. m_B=3.0 kg은 매달려 있습니다. 도르래는 M_p=1.2 kg, R=0.10 m입니다. B가 1.50 m 하강한 뒤 지면에 접촉하면 실은 즉시 느슨해집니다. 그 후 A는 경사면 상방으로 0.10 m를 더 미끄러져 k=250 N/m의 스프링에 접촉합니다. g=9.8 m/s²입니다.
착지 전에는 실이 팽팽하고 미끄러짐이 없으므로, 도르래의 등가 관성 질량(equivalent inertial mass)은 I/R²=(1/2)M_p=0.60 kg입니다. 두 물체와 도르래의 회전 방정식을 연립하면 다음과 같습니다.
a ≈ 0.847 m/s²
v1 ≈ 1.59 m/s
v2 ≈ 1.18 m/s
...
착지 후에는 B의 속도가 지면과의 충돌로 변화하고, A는 여전히 경사면 상방으로의 속도를 가지며, 도르래도 회전을 계속할 가능성이 있습니다. 하지만 문제문에서 실이 즉시 느슨해진다고 명시되어 있으므로, v_A=v_B=Rω는 더 이상 사용할 수 없습니다. 이후에는 A만을 해석해야 합니다.
v2² = v1² - 2g(sinθ + μ_k cosθ)d
1/2 m_A v2² = 1/2 kx² + m_A g(sinθ + μ_k cosθ)x
GPT-5.6-SOL은 차원 정합성(dimensional consistency), 스프링이 없을 때의 정지 거리, 스프링 에너지와 마찰·중력 손실의 합까지 확인하였으며, 수치적으로도 일치했습니다. Kimi는 첫 시도에서 가시적인 답변을 내놓지 못했기 때문에 중간 모델링 품질은 비교할 수 없었습니다.
이 문제는 optimize_release_plan(items, capacity_by_day, dependencies)를 구현해야 하며, 일별 용량, 설정되지 않은 날의 용량은 0, 직접·간접 의존성의 폐쇄(closure), 유효하지 않은 의존성 및 순환(cycle) 탐지, 나아가 value → risk → 정렬된 id 목록의 3단계 타이브레이크(tie-break)를 다루어야 합니다. items <= 18이므로, 비트마스크(bitmask) 전수 조사는 타당한 베이스라인입니다.
GPT-5.6-SOL은 의존성 폐쇄 캐시와 2^n 부분집합 열거를 사용했습니다. 코드를 추출하여 Python 3.11에서 독립 검사를 수행한 결과, 의존성 폐쇄, 다일(multi-day) 용량 샘플, value/risk/id의 3단계 타이브레이크, 설정되지 않은 날의 용량, 의존성 없는 케이스, 순환 의존성 등 6개 세트 모두를 통과했습니다.
다만, 모델이 코드 끝에 붙인 첫 번째 assert는 실패했습니다. 거기서는 A -> B -> C를 전제로 하면서 가치(value)가 11인 X도 포함했습니다. 주어진 용량에서 B + C + X의 총 가치는 13으로, A + B + C의 12보다 크기 때문에 함수가 ['B', 'C', 'X']를 반환하는 것이 정답입니다. ['A', 'B', 'C']라고 적힌 assert는 테스트 픽스처(test fixture)의 오류입니다.
이 점은 상당히 시사하는 바가 큽니다. 코드 문제는 함수 본체만 보면 되는 것도 아니며, 반대로 "8개의 assert가 붙어 있으니 테스트도 올바르다"라고 단정할 수도 없습니다. 모델이 생성한 테스트 데이터 또한 수작업 또는 참조 구현 (reference implementation)을 통해 검증해야 합니다. Kimi K3의 프로그래밍 요청은 약 245초 후에 read timeout이 발생하여 완전한 코드를 얻을 수 없었습니다.
| 관점 | kimi-k3 | gpt-5.6-sol |
|---|---|---|
| 수학적 완전성 | 6500/10000 토큰 모두 중간에 종료되어 검수 불가 | 기대값, 이차 모멘트 (second moment), 분산, sanity check가 모두 갖춰져 있음 |
| 물리 모델링 | 첫 시도에서 중간 종료 | 도르래 관성, 실의 느슨함, 스프링 단계를 올바르게 처리 |
| 프로그래밍 납품 | 이번에는 timeout 발생 | 코드 본체는 독립 검사를 통과했으나, 부속된 assert에 오류가 있음 |
| 출력 안정성 | 추론 (reasoning) 소비가 커서 가시적인 답변을 얻기 어려움 | 3문제 모두 순차 재시도(retry)를 통해 stop |
| 응답 속도 | 약 187–246s이며, 중간 종료/timeout 발생 | 성공한 요청은 약 88–236s; 병렬 첫 시도는 408s까지 발생 |
더 정확히 말하자면, 결론은 "어느 한쪽이 절대적으로 똑똑하다"는 이야기가 아닙니다.
- 이번 라우팅(routing)과 예산(budget) 조건에서는 GPT-5.6-SOL이 복잡한 추론을 최종 답안까지 정리하기 더 쉬우며, 즉시 읽을 수 있는 도출 과정이나 코드가 필요한 워크플로우에 적합합니다.
- Kimi K3의 주요 과제는 추론 예산을 가시적인 출력으로 변환하는 효율성입니다. 수학 문제에서
10000토큰으로 늘렸음에도 불구하고 여전히 완료되지 않았습니다. - GPT-5.6-SOL의 코드 또한 맹신은 금물입니다. 함수 로직은 독립 검사를 통과했더라도, 부속된 테스트 픽스처 (test fixture)에 가치 계산 실수가 있었습니다.
- 실제 도입을 위한 선정 시에는
finish_reason, reasoning token, 지연 시간 (latency), 로컬 테스트 결과를 병기하여 기록해야 하며, 마지막 문장이 "답이 맞다"라는 것만으로는 불충분합니다.
이번 테스트 스크립트와 순차 재시도 결과는 아래에 저장되어 있습니다 (병렬 첫 시도의 요약도 스크립트 출력에 포함되어 있습니다).
.tmp/kimi_k3_vs_gpt56sol_test.py
.tmp/kimi-k3-vs-gpt56sol-results.json
.tmp/retry-gpt56sol-math.json
...
재측정 시에는 모델 ID, 프롬프트 (prompt), temperature, max_tokens, 병렬도를 고정하고, 매번의 출력을 별도 파일로 저장하는 것을 권장합니다. 상류의 부하, 캐시 히트 (cache hit), 속도 제한 (rate limit) 상태는 지연 시간에 영향을 미칩니다. 본 기사에서는 HTTP 408, length, read timeout을 모두 테스트 결과의 일부로 기록하였으며, 의도적으로 숨기지 않았습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기