Kimi K3 リリース日程:API 公開とオープンウェイト公開の二段構え
2026 年 7 月 16 日、Moonshot は Kimi App、Kimi Work、Kimi Code、API 経由で Kimi K3 を提供開始しました。同日、Artificial Analysis が独立レビューを公開しています。7 月 27 日には、完全モデルウェイト(Modified MIT)と技術レポート(アーキテクチャ、学習、評価)が Hugging Face で公開されます。
結論として、K3 は Fable 5 キラーではありません。AA Intelligence Index 57.1 は 189 モデル中 #3 で、Claude Fable 5(59.9)と GPT-5.6 Sol(58.9)に次ぎます。一方で、フロンティア級に近い能力を約 1/3 のコストで提供し、クローズドモデルにはない ダウンロード可能なオープンウェイトと 100万 token コンテキストの二点を実現しています。
| 日付 | イベント |
|---|---|
| 2026-07-16 | K3 API と Kimi プロダクト群の公開。Artificial Analysis ベンチマーク公開 |
| 2026-07-17 | 上海で WAIC 開幕。国営メディアが K3 を国家 AI マイルストーンとして位置づけ |
| 2026-07-27 | Hugging Face で完全ウェイト公開(Modified MIT)+技術レポート |
API はすでに利用可能: platform.kimi.ai のモデル ID kimi-k3 で、ウェイト公開を待たずに開発を始められます。
ウェイト公開 ≠ 即ローカル実行: KDA とプレフィックスキャッシュの vLLM サポートはウェイト公開と同時に提供されます。Ollama や GGUF ビルドは K2 系列と同様にコミュニティ移植が続く見込みです。
異例の正直なベンダー姿勢: Moonshot は Fable 5 と Sol に総合で劣ることを公言し、ハーネス感度と曖昧プロンプトへの過剰反応を理由に挙げています。
地政学的文脈: 公開タイミングは WAIC と重なります。6 月に米規制当局が Anthropic Fable/Mythos モデルを一時停止(7 月 1 日復旧)したことも、規制当局はクローズド API を止められても公開済みオープンウェイトは止められないというナラティブを強めています。
Moonshot の巻き返し: 2025 年初頭の DeepSeek R1 ショックで国内シェア順位が #7 まで落ちた後、K2 → K2.5 → K3 のオープンウェイト路線で信頼を再構築しています。
Kimi K3 とは?主要スペック一覧
K3 は Stable LatentMoE を採用しています。896 エキスパートのうち 16 を token あたり活性化(スパース率約 1.8%)。アテンションスタックは Kimi Delta Attention(KDA、ハイブリッド線形アテンション)+ Attention Residuals(AttnRes)+ Gated MLA です。ウェイトは MXFP4、活性化は MXFP8(ネイティブ低精度学習)で提供されます。スケーリング効率は K2 比約 2.5 倍。KDA は 100万 token コンテキストで最大 6.3 倍のデコード高速化を実現します。
| 項目 | 値 |
|---|---|
| 総パラメータ数 | 2.8 兆 — 現時点で最大のオープンウェイトモデル |
| アーキテクチャ | スパース MoE:Stable LatentMoE、896 エキスパート / token あたり 16 活性化 |
| アテンション | KDA + AttnRes + Gated MLA |
| コンテキスト | 1,048,576 token(100万) |
| モダリティ | ネイティブビジョン(テキスト+画像、プロダクトでは動画)、テキスト出力 |
| ウェイト形式 | MXFP4 ウェイト + MXFP8 活性化 |
| 学習安定性 | Quantile Balancing、Per-Head Muon オプティマイザ、SiTU 活性化 |
| ライセンス(7/27) | Modified MIT — リリース当日に LICENSE 本文を確認 |
見出しでは オープンウェイト と表記し、オープンソースとは区別してください。この区別は r/LocalLLaMA や Hacker News でも重要視されており、「kimi k3 open weights」という高意図クエリにも対応します。
Kimi K3 ベンチマーク:Claude Fable 5 と GPT-5.6 Sol との比較
データは Artificial Analysis(7 月 16 日)と Moonshot 公開資料を相互参照しています。ベンチマークはハーネスごとに異なるため、スコア比較時は必ず出典と日付を明記してください。
| モデル | AA Intelligence Index | 順位 |
|---|---|---|
| Claude Fable 5 | 59.9 | #1 |
| GPT-5.6 Sol | 58.9 | #2 |
| Kimi K3 | 57.1 | #3 / 189 |
K3 が勝つ、または同等の領域:
Frontend Code Arena: #1 — UI コード生成で Fable と Sol を上回るブラインド開発者選好
Automation Bench、SpreadsheetBench 2: #1
BrowseComp: 91.2(#1) — 100万 token 非圧縮戦略で 90.4 以上
SWE Marathon: 42.0 — 大幅リード(GPT-5.5 / GLM-5.2 は 10 台前半に崩落)
Terminal Bench 2.1: 88.3 — Sol(88.8)にほぼ同等
Program Bench: 77.8 — Sol(77.6)をわずかに上回る
FrontierSWE: 81.2 — Sol(71.3)を上回り、Fable 5(86.6)には及ばず
K3 が依然として劣る領域:
GDPval v2 Elo: 1668–1687 vs Fable 5(1760)、Sol(1748) — 長期判断は依然 Fable の領域
DeepSWE: 67.5 vs Sol 73.0
幻覚率は K2.6 比で上昇(ベンダー公表)。Reddit ではセルフホストアプリで上位クローズドモデルより幻覚が多いとの報告も
会話の洗練度とセッション間分散は Fable 5 / Sol に及ばない
| 観点 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Intelligence Index | 57.1(#3) | 59.9(#1) | 58.9(#2) |
| タスクあたりコスト(AA) | $0.94 | 約 $2.75 | 約 $1.04 |
| Fable 5 比 | 65.8% 安い。Sol 比 9.4% 安 | ||
| オープンウェイト | 7 月 27 日 | クローズド | クローズド |
| コンテキスト | 100万 token | 約 200K クラス | 128K–100万(ティア依存) |
Kimi K3 API 料金と 7 月 27 日リリース当日チェックリスト
料金は欧米の品質ティア API と同水準で、中国ベンダー中では最高水準ですが、Claude Opus 4.8 のタスクあたりコストには依然として大きく下回ります。コーディングワークロードでは 90% 超のキャッシュヒット率が報告され、実効コストが大幅に下がります。
| 項目 | 料金(100万 token あたり) |
|---|---|
| 入力(キャッシュミス) | $3.00 |
| 入力(キャッシュヒット、自動) | $0.30 |
| 出力 | $15.00 |
7 月 27 日に起こること:
完全 2.8T ウェイトが Moonshot Hugging Face 組織で Modified MIT 下に公開(条項は当日確認)
技術レポート — アーキテクチャ、学習、評価の詳細
vLLM エコシステム — KDA + プレフィックスキャッシュサポートがウェイトと同時提供
コミュニティフォロー — K2 系列同様、Ollama・GGUF 量子化ビルドが期待される
LICENSE 本文の確認 — 商用再配布の範囲をリリース当日に検証
独立長コンテキスト再検証 — コミュニティベンチマークと公式数値のクロスチェック
出典: kimi.com/en/blog/kimi-k3、platform.kimi.ai、Artificial Analysis(7 月 16 日)、VentureBeat、Northflank セルフホスト分析、r/LocalLLaMA、Hacker News。
Kimi K3 をローカル実行できるか?ハード要件と業界への意味
コンシューマーハードウェアでは不可能です。 4-bit 量子化ウェイトは約 1.4 TB です。Moonshot は 64 台以上のアクセラレータを備えたスーパーノード展開と、エキスパート並列+テンソル並列を推奨しています。参考として、K2.7 Code(1T パラメータ)は INT4 で約 577 GB VRAM が必要でした。K3 は 2.8 倍の規模です。
ほとんどのチームにとって答えは API($3/$15) です。セルフホストが意味を持つのは、厳格なデータ residency 要件、独自データでのファインチューニング、または所有ハードがクラウド推論費を上回るボリュームの場合に限られます。
2.8T パラメータ、896 エキスパート / 16 活性化、100万 token コンテキスト — クイックリファレンス
4-bit で約 1.4 TB、64 台以上のアクセラレータ推奨 — 「ノート PC で動く」見出しはクリックベイトです
Frontend Code Arena #1、SWE Marathon 42.0 — 長セッションコーディングでクローズド競合を上回る
業界への影響(四つの角度):
オープンとクローズドのギャップがフロンティアでほぼ閉じた — 数ポイント差から 2–3 インデックスポイント差へ。能力だけでクローズドモデルのプレミアムを正当化しにくくなっています
規制ナラティブ — 公開済みウェイトは API 禁止を生き延びる
中国ベンダーの波 — GLM-5.2、DeepSeek V4 Pro、MiniMax が追い上げ。K3 はパラメータ数のピーク
Moonshot の戦略的リセット — DeepSeek R1 ショック後のオープンウェイト定期公開
64 GPU 推論クラスタの維持には、電力、ネットワーク、バージョン固定、オンコールといった隠れオペコストがあります。iOS CI/CD と AI Agent オーケストレーション用の安定 Mac ホストを維持しつつ K3 を API 経由で呼び出す場合、MESHLAUNCH の Mac Mini クラウドレンタルが通常はより優れた本番パスです。専有 Apple Silicon、7×24 稼働、日/週/月の柔軟契約が可能です。
2026 年 7 月 27 日に Moonshot Hugging Face で公開されます。API は 7 月 16 日から利用可能です。ダウンロードと API 呼び出しは別のマイルストーンです。
7 月 27 日に公開されるのは オープンウェイトであり、完全なオープンソース(学習コード・データなし)ではありません。Modified MIT 条項はリリース当日に確認してください。アーキテクチャの詳細はKimi K3 徹底レビューをご覧ください。
入力 $3/M、キャッシュ入力 $0.30/M、出力 $15/M です。AA テストではタスクあたり約 $0.94。Agent 開発環境の詳細はレンタル料金ページをご覧ください。
できません。4-bit で約 1.4 TB のため、データセンター規模の GPU クラスタが必要です。より小さいフットプリントが必要な場合は、コミュニティ蒸留 GGUF ビルドを待つ必要がありますが、能力は大きく犠牲になります。
総合インデックスではいいえ(#3)です。コーディングと自動化ベンチではしばしば優れています。長期推論と安定性は依然 Fable/Sol の領域です。Moonshot 自身も公言しています。ハイブリッド構成のガイドはヘルプセンターをご覧ください。
完全ウェイトは Modified MIT ライセンスです。商用再配布の範囲は Hugging Face 公開当日の LICENSE ファイルで確認してください。