
Kimi K3 API 레퍼런스: OpenAI 호환 엔드포인트 사용법 및 구현 패턴 모음
요약
Moonshot AI가 출시한 Kimi K3 모델의 API 사용법과 구현 패턴을 다룹니다. OpenAI 호환 엔드포인트를 통해 기존 라이브러리를 그대로 사용할 수 있으며, 100만 토큰의 컨텍스트 윈도우와 캐싱 최적화 전략을 제공합니다.
핵심 포인트
- OpenAI 호환 API를 지원하여 기존 라이브러리 활용 가능
- 100만 토큰의 대규모 컨텍스트 윈도우로 프로젝트 전체 분석 가능
- 캐시된 입력 사용 시 비용을 대폭 절감하는 최적화 방법 제시
- 네이티브 비전 기능 및 Function Calling 지원
2026년 7월 16일, Moonshot AI가 Kimi K3를 출시했습니다. 2.8조 개의 파라미터, 100만 토큰의 컨텍스트 윈도우 (Context Window), GDPval-AA v2에서 1,687점(Opus 4.8의 1,600점을 상회)을 달성한 오픈 소스 모델입니다. 7월 27일에 웨이트 (Weights)가 공개될 예정입니다.
이 기사에서는 API의 기본적인 사용법부터 구현 패턴까지 정리합니다.
Kimi K3의 API는 OpenAI 호환입니다. 기존의 OpenAI 라이브러리를 그대로 사용할 수 있습니다.
from openai import OpenAI
client = OpenAI(
api_key="your-kimi-api-key",
...
| 종류 | 요금 (MTok당) |
|---|---|
| 캐시된 입력 (Cached Input) | $0.30 |
| ... | |
| 코딩 워크로드 (Coding Workload)에서는 90%의 캐시 히트율 (Cache Hit Rate)을 달성하므로, 실효 입력 비용은 혼합 시 약 $0.57/MTok가 됩니다. |
response = client.chat.completions.create(
model="kimi-k3",
messages=[
...
실시간 애플리케이션용:
stream = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "FastAPI에서 WebSocket을 사용한 실시간 채팅 구현을 설명해 주세요."}],
...
K3의 최대 특징은 100만 토큰의 컨텍스트 윈도우 (Context Window)입니다. 프로젝트 전체를 투입하여 분석할 수 있습니다.
from pathlib import Path
def load_project(directory, exts=(".py", ".ts", ".go")):
parts = []
...
return "\n\n".join(parts)
codebase = load_project("./my-project")
response = client.chat.completions.create(
...
**주의 사항:** 100만 토큰을 모두 사용할 경우, 응답 시간 (Response Time)이 길어집니다. 스트리밍 (Streaming)을 병행하는 것을 권장합니다.
K3는 네이티브로 비전 (Vision) 기능을 탑재하고 있습니다. MathVision에서 94.3점을 달성하였으며, 수식이나 도표 이해에 뛰어납니다.
import base64
def encode_image(path):
with open(path, "rb") as f:
...
API 답변을 JSON 형식으로 받는 경우:
response = client.chat.completions.create(
model="kimi-k3",
messages=[
...
K3는 OpenAI 호환 Function Calling을 지원합니다:
tools = [{
"type": "function",
"function": {
...
K3의 캐시된 입력 (Cached Input)은 $0.30/MTok (미캐시 데이터의 1/10)입니다. 캐시 히트율을 높이기 위해서는:
-
**시스템 프롬프트 (System Prompt)를 고정할 것**— 동일한 시스템 내용이라면 캐시가 적용됩니다 -
**대화 이력을 유지할 것**— 이전 턴이 캐시되므로, 멀티 턴 (Multi-turn) 대화에서는 비용을 대폭 절감할 수 있습니다 -
**배치 처리 (Batch Processing)보다 순차 처리**— 동일 세션 내에서 연속적인 요청을 보냄으로써 캐시 히트율이 향상됩니다
| 유스케이스 (Use Case) | 권장 temperature |
|---|---|
| 코드 생성 | 0.0 - 0.3 |
| ... |
K3의 코딩 성능은 다음과 같습니다:
| 벤치마크 (Benchmark) | Kimi K3 | GPT-5.6 Sol | Fable 5 |
|---|---|---|---|
| Terminal-Bench 2.1 | 88.3 | 88.8 | ~87 |
| SWE Marathon | 42.0 | ~39 | ~41 |
| Program Bench | 77.8 | ~75 | ~76 |
SWE Marathon과 Program Bench에서 모든 모델 중 1위를 차지했습니다. 장시간의 코딩 태스크 (Coding Task)에 특히 강한 이유는 100만 토큰 컨텍스트 (Context)와 KDA (Kimi Delta Attention)를 통한 안정적인 어텐션 메커니즘 (Attention Mechanism) 덕분입니다.
Kimi K3의 API는 OpenAI 호환성이라는 낮은 도입 장벽과 100만 토큰 컨텍스트, 네이티브 멀티모달 (Native Multimodal)이라는 높은 한계를 동시에 실현하고 있습니다. 7월 27일 가중치 (Weights) 공개 이후에는 셀프 호스팅 (Self-hosting)도 가능해지므로, 우선은 API로 평가를 시작하는 것을 권장합니다.
아키텍처 (Architecture)의 상세 내용 (KDA, AttnRes, MoE 프레임워크)에 대해서는 Hashnode의 기술 해설을, 벤치마크 (Benchmark)의 상세한 비교는 Velog의 분석 기사를 참고하시기 바랍니다.
Kimi K3의 전체적인 모습에 대해서는 이 포괄적인 레퍼런스 (Reference)를 확인해 주세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기