Kimi K3 출시일: API 런칭과 오픈 가중치 공개
2026년 7월 16일 Moonshot AI는 Kimi App, Kimi Work, Kimi Code, API를 통해 Kimi K3를 출시했습니다. 같은 날 Artificial Analysis가 독립 리뷰를 발표했습니다. 7월 27일에는 Hugging Face에 전체 모델 가중치(Modified MIT)와 기술 보고서(아키텍처, 학습, 평가)가 공개됩니다.
결론부터 말하면 K3는 Fable 5를 대체하는 모델이 아닙니다. AA Intelligence Index 57.1로 189개 모델 중 3위이며 Claude Fable 5(59.9)와 GPT-5.6 Sol(58.9)에 뒤집니다. 다만 비용은 약 1/3 수준의 프론티어급 인접 성능을 제공하며, 폐쇄형 모델이 줄 수 없는 두 가지를 갖춥니다. 다운로드 가능한 오픈 가중치와 100만 token 컨텍스트입니다.
| 날짜 | 이벤트 |
|---|---|
| 2026-07-16 | K3 API 및 Kimi 제품군 출시, Artificial Analysis 벤치마크 공개 |
| 2026-07-17 | 상하이 WAIC 개막, 국영 매체가 K3를 국가 AI 마일스톤으로 보도 |
| 2026-07-27 | Hugging Face 전체 가중치(Modified MIT) + 기술 보고서 |
API는 지금 이용 가능: platform.kimi.ai 모델 ID kimi-k3 — 가중치 공개를 기다리지 않고 바로 개발을 시작할 수 있습니다.
가중치 ≠ 즉시 로컬 실행: KDA와 prefix caching용 vLLM 지원은 가중치 공개와 함께 제공되며, Ollama·GGUF 빌드는 K2 시리즈처럼 커뮤니티 포팅이 이어질 것으로 예상됩니다.
드문 정직한 벤더 태도: Moonshot은 종합 성능에서 Fable 5·Sol에 뒤진다고 공개적으로 인정하며, harness 민감도와 모호한 프롬프트에서의 과도한 행동을 원인으로 지적했습니다.
지정학적 맥락: 출시 시점이 WAIC와 맞물립니다. 6월 미국 규제 당국이 Anthropic Fable/Mythos 모델을 일시 중단했다가 7월 1일 복구한 사건은, 규제가 폐쇄 API는 막을 수 있지만 공개된 오픈 가중치는 막기 어렵다는 내러티브를 강화했습니다.
Moonshot 재기: 2025년 초 DeepSeek R1로 시장 점유율이 급감(국내 순위 7위까지 하락)한 뒤, K2 → K2.5 → K3 오픈 가중치 로드맵으로 신뢰를 회복했습니다.
Kimi K3란? 핵심 사양 한눈에
K3는 Stable LatentMoE를 사용합니다. 896개 전문가 중 16개를 토큰당 활성화(희소도 약 1.8%)합니다. 어텐션 스택은 Kimi Delta Attention(KDA, 하이브리드 선형 어텐션) + Attention Residuals(AttnRes) + Gated MLA로 구성됩니다. 가중치는 MXFP4, 활성은 MXFP8(네이티브 저정밀 학습)로 제공됩니다. 확장 효율은 K2 대비 약 2.5배, KDA는 100만 token에서 최대 6.3배 디코딩 가속을 제공합니다.
| 사양 | 값 |
|---|---|
| 총 파라미터 | 2.8조 — 현재까지 최대 오픈 가중치 모델 |
| 아키텍처 | 희소 MoE: Stable LatentMoE, 896 전문가 / 토큰당 16 활성 |
| 어텐션 | KDA + AttnRes + Gated MLA |
| 컨텍스트 | 1,048,576 tokens(100만) |
| 모달리티 | 네이티브 비전(텍스트+이미지, 제품 내 영상), 텍스트 출력 |
| 가중치 형식 | MXFP4 가중치 + MXFP8 활성 |
| 학습 안정성 | Quantile Balancing, Per-Head Muon optimizer, SiTU activation |
| 라이선스(7/27) | Modified MIT — 출시일 LICENSE 원문 확인 필수 |
헤드라인에는 오픈 가중치(open weights)를 쓰고 오픈소스(open source)와 혼동하지 마십시오. r/LocalLLaMA와 Hacker News에서 이 구분은 엄격하며, "kimi k3 open weights" 고의도 검색어와도 맞습니다.
Kimi K3 벤치마크: Claude Fable 5·GPT-5.6 Sol 비교
데이터는 Artificial Analysis(7월 16일)와 Moonshot 출시 자료를 교차 검증했습니다. 벤치마크는 harness마다 다르게 측정되므로 점수 비교 시 출처와 날짜를 반드시 명시하십시오.
| 모델 | AA Intelligence Index | 순위 |
|---|---|---|
| Claude Fable 5 | 59.9 | #1 |
| GPT-5.6 Sol | 58.9 | #2 |
| Kimi K3 | 57.1 | #3 / 189 |
K3가 앞서거나 동등한 영역:
Frontend Code Arena: #1 — UI 코드에 대한 블라인드 개발자 선호도에서 Fable·Sol을 앞섬
Automation Bench, SpreadsheetBench 2: #1
BrowseComp: 91.2(#1) — 100만 token 무압축 전략에서 90.4+
SWE Marathon: 42.0 — GPT-5.5·GLM-5.2가 10대대로 급락하는 가운데 크게 앞섬
Terminal Bench 2.1: 88.3 — Sol(88.8)과 거의 동등
Program Bench: 77.8 — Sol(77.6)을 소폭 앞섬
FrontierSWE: 81.2 — Sol(71.3)을 이기고 Fable 5(86.6)에는 뒤짐
K3가 아직 뒤처지는 영역:
GDPval v2 Elo: 1668–1687 vs Fable 5(1760), Sol(1748) — 장기 판단은 여전히 Fable 영역
DeepSWE: 67.5 vs Sol 73.0
환각률 K2.6 대비 상승(벤더 인정), Reddit에서는 셀프호스트 앱에서 상위 폐쇄형 모델보다 환각이 많다는 보고
대화 완성도와 세션 편차가 Fable 5·Sol보다 낮음
| 차원 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Intelligence Index | 57.1(#3) | 59.9(#1) | 58.9(#2) |
| 태스크당 비용(AA) | $0.94 | ~$2.75 | ~$1.04 |
| vs Fable 5 | 65.8% 저렴, Sol 대비 9.4% 저렴 | ||
| 오픈 가중치 | 7월 27일 | 폐쇄 | 폐쇄 |
| 컨텍스트 | 100만 tokens | ~200K급 | 티어별 128K–1M |
Kimi K3 API 요금과 7월 27일 출시 체크리스트
요금은 서구 품질 티어 API와 맞춰져 중국 벤더 중 최고 수준이지만, Claude Opus 4.8 태스크당 비용보다는 훨씬 낮습니다. 코딩 워크로드는 90% 이상 캐시 적중률이 보고되어 실효 비용이 크게 줄어듭니다.
| 항목 | 가격(100만 tokens당) |
|---|---|
| 입력(캐시 미스) | $3.00 |
| 입력(캐시 적중, 자동) | $0.30 |
| 출력 | $15.00 |
7월 27일에 일어나는 일:
전체 2.8T 가중치가 Moonshot Hugging Face 조직에 Modified MIT로 공개(조항 확정 대기)
기술 보고서 — 아키텍처, 학습, 평가 상세
vLLM 생태계 — KDA + prefix caching 지원이 가중치와 함께 제공
커뮤니티 후속 — K2 시리즈처럼 Ollama, GGUF 양자화 빌드 예상
LICENSE 원문 확인 — 출시일 상업적 재배포 범위 검토
독립 장문 컨텍스트 재검증 — 커뮤니티 벤치마크와 공식 수치 교차 확인
출처: kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis(7월 16일), VentureBeat, Northflank 셀프호스팅 분석, r/LocalLLaMA, Hacker News.
Kimi K3를 로컬에서 실행할 수 있나요? 하드웨어 요구와 업계 영향
소비자급 하드웨어에서는 불가능합니다. 4-bit 가중치는 약 1.4TB입니다. Moonshot은 전문가 병렬과 텐서 병렬을 갖춘 64장 이상 가속기 초노드 배포를 권장합니다. 참고로 K2.7 Code(1T 파라미터)는 INT4에서 약 577GB VRAM이 필요했으며, K3는 그 2.8배 규모입니다.
대부분의 팀에게 답은 API($3/$15)입니다. 셀프호스팅은 데이터 거주 요건, 독점 데이터 파인튜닝, 또는 자체 하드웨어가 클라우드 추론 비용을 이기는 대량 시나리오에서만 의미가 있습니다.
2.8T 파라미터, 896 전문가 / 16 활성, 100만 token — 핵심 한 줄 요약
4-bit 약 1.4TB, 64+ 가속기 권장 — "노트북에서 실행" 헤드라인은 클릭베이트입니다
Frontend Code Arena #1, SWE Marathon 42.0 — 장시간 코딩 세션에서 폐쇄형 경쟁 모델을 앞섬
업계 영향(네 가지 관점):
오픈 vs 폐쇄 격차가 프론티어에서 거의 좁혀짐 — 퍼센트포인트 격차에서 2–3 인덱스 포인트로 축소, 성능만으로 폐쇄형 프리미엄을 정당화하기 어려워짐
규제 내러티브 — 공개된 가중치는 API 금지보다 오래 존속
중국 벤더 웨이브 — GLM-5.2, DeepSeek V4 Pro, MiniMax가 추격, K3는 파라미터 정점
Moonshot 전략 재정비 — DeepSeek R1 충격 이후 오픈 가중치 출시 주기
64 GPU 추론 클러스터를 유지하면 전력, 네트워킹, 버전 고정, 온콜 등 숨은 운영 비용이 따릅니다. iOS CI/CD와 AI Agent 오케스트레이션용 Mac 호스트가 필요하고 K3는 API로 호출하는 팀이라면, MESHLAUNCH Mac Mini 클라우드 대여가 일반적으로 더 나은 프로덕션 경로입니다. 전용 Apple Silicon, 7×24 가동, 일·주·월 유연 계약을 제공합니다.
2026년 7월 27일 Moonshot Hugging Face에서 공개됩니다. API는 7월 16일부터 이용 가능하며, 다운로드와 호출은 서로 다른 마일스톤입니다.
7월 27일 공개는 오픈 가중치이며 완전한 오픈소스(학습 코드·데이터 미포함)가 아닙니다. Modified MIT 조항은 출시일 반드시 확인하십시오. 아키텍처 심층은 Kimi K3 리뷰를 참고하십시오.
입력 $3/M, 캐시 적중 $0.30/M, 출력 $15/M tokens입니다. AA 테스트 기준 태스크당 약 $0.94입니다. Agent 개발 환경 상세는 대여 가격 페이지를 참고하십시오.
불가능합니다. 4-bit 약 1.4TB는 데이터센터급 GPU 클러스터가 필요합니다. 더 작은 footprint가 필요하면 커뮤니티 GGUF 빌드를 기다려야 하며, 성능은 크게 희생됩니다.
종합 인덱스 기준으로는 아닙니다(#3). 코딩·자동화 벤치마크에서는 종종 앞섭니다. 장기 추론과 안정성은 Fable/Sol 영역입니다. Moonshot도 이를 공개적으로 밝혔습니다. 하이브리드 구성 가이드는 고객 센터를 참고하십시오.
전체 가중치는 Modified MIT이며, Hugging Face 출시일 LICENSE 원문에서 상업적 재배포 범위를 확인해야 합니다.