Kimi K3 とは?2.8 兆パラメータ オープンソース LLM の核心仕様
2026 年 7 月 16 日、Moonshot AI は Kimi K3 を公開しました。2.8 兆(2.8T)パラメータのスパース Mixture-of-Experts(MoE)モデルで、従来の記録保持者 DeepSeek V4 Pro(1.6T)を約 75% 上回り、小米のオープンモデル(1.02T)の 2.7 倍、アリババ(397B)の 7 倍以上の規模です。派手なローンチイベントはなく、技術ブログ・料金ページ・即座に呼び出せるモデル ID kimi-k3 という静かな公開でした。
K3 は 896 個のエキスパートのうち推論ごとに 16 個を活性化(スパース度 1.8%)します。100 万 token の超長コンテキスト(長編小説 5 冊分相当)とネイティブな視覚理解を備え、複雑なプログラミング、長文推論、ナレッジワーク向けに設計されています。ひと言で言えば、オープンソースで画像・動画をネイティブ理解でき、超長期メモリを持つ重量級プログラミング AI です。Claude Opus 4.8 より 40% 安く、完全ウェイトは 7 月 27 日にオープンソース公開予定です。
規模の衝撃:DeepSeek 台頭後に Moonshot のシェアが大きく縮小した中、K3 は戦略的反撃です。過去 12 か月の Kimi シリーズのうち 9 か月、オープンモデルの規模上限を占めていました。
公開タイミング:2026 世界人工知能大会(WAIC)開幕前夜の 7 月 16 日。7 月 17–20 日には追加発表が予想されます。
商用化の加速:2026 年 6 月時点で ARR は 3 億ドルを突破。年内に第 6 ラウンド調達を完了し、投前評価額 315 億ドル。API 収入が 7 割超、海外有料ユーザーは 400% 増加しています。
長コンテキストの課題:従来のフルアテンションでは 100 万 token 規模で KV キャッシュのメモリが爆発的に増大します。K3 の KDA メカニズムはこの問題に対応するために設計されています。
プログラミング Agent の需要:SWE Marathon など長時間のコードタスクでは、数時間のセッションでコンテキストの一貫性が求められます。1M ウィンドウと 90% 超のキャッシュヒット率が中核の訴求点です。
| 項目 | 数値 |
|---|---|
| 総パラメータ数 | 2.8 兆(世界最大のオープンソースモデル) |
| アーキテクチャ | KDA + AttnRes + Stable LatentMoE |
| 活性化エキスパート | 16 / 896(スパース MoE、1.8%) |
| コンテキストウィンドウ | 1,048,576 tokens(1M) |
| 入力モダリティ | テキスト、画像、動画 |
| 推論モード | Always-on max effort(low / high は今後追加) |
| オープンウェイト | 2026 年 7 月 27 日 Hugging Face |
Kimi K3 のアーキテクチャ革新とベンチマーク:KDA、AttnRes、Stable LatentMoE
Kimi Delta Attention(KDA)はハイブリッド線形アテンション機構です。3:1 の比率で線形アテンション層とフルアテンション層を交互に配置し、3 つの線形層が局所構造を低コストで処理し、1 つのフルアテンション層がグローバルな情報流を保持します。結果として KV キャッシュメモリは最大 75% 削減、100 万 token コンテキストでのデコード速度は最大 6.3 倍向上し、短・長コンテキストおよび強化学習スケールの各シナリオで純粋なフルアテンション基線を上回ります。
Attention Residuals(AttnRes)は深度方向の残差接続を再設計します。標準的な残差接続は初期層の重要な表現を薄めがちですが、AttnRes は選択的リトリーバルを導入し、モデルがより浅い層の高価値表現を深度を跨いで直接参照できます。訓練効率は約 25% 向上し、追加計算コストは 2% 未満です。
Stable LatentMoEは 896 エキスパート / 16 活性化という極端なスパース度でも安定訓練を可能にします。関連技術は次のとおりです。
| 技術 | 役割 |
|---|---|
| Quantile Balancing | ルータースコアの分位数からエキスパート割当を直接導出し、ヒューリスティックなハイパーパラメータを排除 |
| Per-Head Muon | 各アテンションヘッドを独立最適化し、大規模訓練をより適応的に |
| Sigmoid Tanh Unit(SiTU) | 活性化関数の制御を改善 |
| Gated MLA | アテンションの選択性を向上 |
これらを総合すると、K3 は Kimi K2 比で全体のスケール効率が約 2.5 倍向上しています。以下は Moonshot AI 自社報告のベンチマークです(各モデルは独自の推論 harness を使用しており、独立した第三者再現は進行中です)。
| ベンチマーク | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro(視覚) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench | 91.1 | 89.8 | 85.8 | 87.9 | — |
SWE Marathon は持続的な長時間コード作業を測定するベンチマークです。K3 は 42.0 で大差トップ。Artificial Analysis Intelligence Index v4.1 では K3 が 57.1 点で 4 位、Claude Fable 5(59.9)と GPT-5.6 Sol(58.9)に続き、差はわずか 2.8 点です。
Kimi K3 の料金はいくら?Claude、GPT、DeepSeek とのコスト比較
K3 の標準料金は Claude Sonnet 5 と同水準($3/$15 per 1M tokens)ですが、コンテキストウィンドウは 5 倍(1M vs 200K)です。キャッシュヒット時の入力は $0.30/M(標準の 1/10)まで下がり、Moonshot はプログラミングシナリオでキャッシュヒット率 90% 超を報告しています。OpenRouter の 7 日加重平均でも実効入力コストは約 $0.55/M と確認されています。
| モデル | 入力($/M) | 出力($/M) | キャッシュヒット入力 | コンテキスト |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00(プロモ $2) | $15.00(プロモ $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
Claude Opus 4.8 と比べると、K3 は複数ベンチマークで優位ながら入力コストは 60%、出力コストは 40% です。国内 API 料金は入力 ¥20/M、出力 ¥100/M、キャッシュヒット ¥2/M。コンシューマー版は Kimi.com の無料アカウントで利用でき、プリペイドプランは ¥199 から(割引は 8 月 11 日まで)です。
Kimi K3 を今すぐ使うには?4 つの接続方法と 6 ステップ Runbook
Kimi Web / App(最も簡単):kimi.com にアクセスし、アカウントを登録します(Google アカウント対応)。K3 はデフォルトで最大推論モードで動作し、クレジットカードは不要です。
API Key の取得:platform.kimi.ai で開発者アカウントを登録し、API Key を作成してチャージします。
OpenAI 互換クライアントの設定:base_url="https://api.moonshot.ai/v1" を指定し、モデル ID は kimi-k3 です。
OpenRouter 経由:モデル ID は moonshotai/kimi-k3。Moonshot 公式料金に追加マージンはなく、1M コンテキストが利用できます。
Prompt Caching の有効化:プログラミングワークフローで会話ルーティング用キャッシュキーを設定し、90% 超のキャッシュヒット率で実効入力コストを約 $0.55/M まで下げます。
7 月 27 日をカレンダーに:完全なモデルウェイトが Hugging Face で公開されます。MXFP4 / NVFP4 量子化版と vLLM、SGLang の Day-0 対応が見込まれます。本番デプロイには 64 枚以上の加速カードを備えたスーパーノードが必要です。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "このコードを分析してください..."}]
)
オープンソーススケジュール:7 月 17–20 日の WAIC で追加発表が予想されます → 7 月 27 日に K3 完全ウェイトが公開され、2 兆パラメータ超のダウンロード可能なオープンウェイトとして初の到達点になります。
Kimi K3 はどう選ぶ?シナリオマトリクスと引用可能な技術データ
| シナリオ | 推奨モデル | 理由 |
|---|---|---|
| 持続的な長時間コードタスク | Kimi K3 | SWE Marathon ベンチマーク 1 位、1M コンテキストが最長 |
| 複雑な Repo 規模のバグ修正 | Claude Fable 5 | FrontierSWE 86.6 で大差リード |
| ターミナル / ツールチェーン集約型 Agent | GPT-5.6 Sol | Terminal Bench 2.1 と Coding Agent Index で先行 |
| 超長文 / マルチモーダル理解 | Kimi K3 | OmniDocBench 91.1 で 1 位、ネイティブ視覚 + 1M コンテキスト |
| コスト重視 | DeepSeek V4 Pro | 出力 $3.48/M と K3 を大きく下回る |
| オープンソース自前デプロイ(7/27 以降) | Kimi K3 | 最強のオープンウェイト、MXFP4 量子化に適合 |
パラメータ規模:2.8T。DeepSeek V4 Pro(1.6T)を約 75% 上回り、7/27 以降ダウンロード可能な最大オープンソースモデルです。
KDA 効率:KV キャッシュ -75%、100 万 token デコード +6.3 倍、訓練スケール効率 +2.5 倍(K2 比)。
Intelligence Index:Artificial Analysis v4.1 で 57.1 点。オープンソースモデル中最高で、クローズドソース旗艦との差は 2.8 点です。
注意:上記ベンチマークは Moonshot AI 自社報告です。K3 は Kimi Code、GPT は Codex、Claude は Claude Code それぞれの harness を使用しています。独立した第三者再現は進行中のため、方向性の参考としてご覧ください。
Kimi K3 はパラメータ数を積み上げただけの見せかけではありません。KDA、AttnRes、Stable LatentMoE は実際のエンジニアリング革新であり、プログラミング長タスクや文書理解の分野で一部のクローズドソース旗艦に匹敵、あるいは上回る位置にあります。API 単体でもすぐに始められますが、ローカル Mac では長時間の Kimi Code Agent ループでメモリ圧迫や IDE 常駐オーバーヘッドに直面しやすく、クラウド VM 案は Metal 互換性のロスが出ます。7×24 でプログラミング Agent、並列 dev server、推論常駐を安定運用するエンジニアリングチームには、MESHLAUNCH の Mac Mini クラウドベアメタルレンタルがより適した選択です。Apple Silicon 専有、日/週/月の柔軟契約で、高頻度 Agent 開発と iOS CI/CD 自動化に向いています。容量と申込は レンタル料金、手順は ヘルプセンター をご参照ください。
参考:Moonshot AI 公式ブログ · Kimi API Platform ドキュメント · Artificial Analysis · OpenRouter 料金ページ · VentureBeat · SCMP
はい。kimi.com で無料アカウントを登録すれば K3 を利用できます。デフォルトで最大推論モードで動作します。API 呼び出しは有料($3/$15 per 1M tokens)です。予算計画は レンタル料金ページ もご参照ください。
完全ウェイトは 2026 年 7 月 27 日に Hugging Face で公開されます。本番級デプロイには 64 枚以上の加速カードを備えたスーパーノードが必要で、コンシューマー向けローカルデプロイは現実的ではありません。モデルは MXFP4 ウェイト + MXFP8 活性化で訓練され、量子化に適しています。
K3 はパラメータ数が約 2 倍、コンテキストが 8 倍、プログラミングと文書理解ベンチマークも優れています。DeepSeek V4 Pro は出力 $3.48/M と低コストで、予算重視のシナリオに向きます。詳細は ヘルプセンター の関連記事もご覧ください。
コードベース全体の一括分析、長大な法律・研究文書の処理、多段 Agent の長期メモリなどで非常に有用です。フラット料金で長さ追加料金がなく、90% 超のキャッシュヒット率と合わせて実コストを抑えやすい設計です。
Moonshot AI によると low と high モードは今後のアップデートで提供予定で、現時点では max モードのみ利用可能です。