Kimi K3 徹底レビュー
2.8 兆パラメータ、オープンソース LLM 新記録

KDA アーキテクチャ · 100 万 token コンテキスト · ベンチマーク全表 · 料金比較 · API 接続 · 7/27 オープンウェイト

Kimi K3 2.8兆パラメータ オープンソース大規模言語モデル 徹底レビュー 2026
2026 年 7 月 16 日深夜、Moonshot AI(月之暗面)は API ドキュメントの冒頭に「Kimi K3 提供開始」を静かに掲載しました。大規模な発表会はありませんでしたが、世界最大規模のオープンソース AI モデル(2.8 兆パラメータ)が登場しています。チームでプログラミング Agent を選定中の方、Claude Fable 5 や GPT-5.6 Sol との比較を進めている方、最強のオープンウェイト公開を待っている方に向け、本稿では次の三点を整理します。① K3 の KDA / AttnRes / Stable LatentMoE が解決する課題、② SWE Marathon や OmniDocBench など主要ベンチマークでの位置づけ、③ $3/$15 料金・4 つの接続方法・7 月 27 日の完全ウェイト公開の意味です。
01

Kimi K3 とは?2.8 兆パラメータ オープンソース LLM の核心仕様

2026 年 7 月 16 日、Moonshot AI は Kimi K3 を公開しました。2.8 兆(2.8T)パラメータのスパース Mixture-of-Experts(MoE)モデルで、従来の記録保持者 DeepSeek V4 Pro(1.6T)を約 75% 上回り、小米のオープンモデル(1.02T)の 2.7 倍、アリババ(397B)の 7 倍以上の規模です。派手なローンチイベントはなく、技術ブログ・料金ページ・即座に呼び出せるモデル ID kimi-k3 という静かな公開でした。

K3 は 896 個のエキスパートのうち推論ごとに 16 個を活性化(スパース度 1.8%)します。100 万 token の超長コンテキスト(長編小説 5 冊分相当)とネイティブな視覚理解を備え、複雑なプログラミング、長文推論、ナレッジワーク向けに設計されています。ひと言で言えば、オープンソースで画像・動画をネイティブ理解でき、超長期メモリを持つ重量級プログラミング AI です。Claude Opus 4.8 より 40% 安く、完全ウェイトは 7 月 27 日にオープンソース公開予定です。

01

規模の衝撃:DeepSeek 台頭後に Moonshot のシェアが大きく縮小した中、K3 は戦略的反撃です。過去 12 か月の Kimi シリーズのうち 9 か月、オープンモデルの規模上限を占めていました。

02

公開タイミング:2026 世界人工知能大会(WAIC)開幕前夜の 7 月 16 日。7 月 17–20 日には追加発表が予想されます。

03

商用化の加速:2026 年 6 月時点で ARR は 3 億ドルを突破。年内に第 6 ラウンド調達を完了し、投前評価額 315 億ドル。API 収入が 7 割超、海外有料ユーザーは 400% 増加しています。

04

長コンテキストの課題:従来のフルアテンションでは 100 万 token 規模で KV キャッシュのメモリが爆発的に増大します。K3 の KDA メカニズムはこの問題に対応するために設計されています。

05

プログラミング Agent の需要:SWE Marathon など長時間のコードタスクでは、数時間のセッションでコンテキストの一貫性が求められます。1M ウィンドウと 90% 超のキャッシュヒット率が中核の訴求点です。

項目数値
総パラメータ数2.8 兆(世界最大のオープンソースモデル)
アーキテクチャKDA + AttnRes + Stable LatentMoE
活性化エキスパート16 / 896(スパース MoE、1.8%)
コンテキストウィンドウ1,048,576 tokens(1M)
入力モダリティテキスト、画像、動画
推論モードAlways-on max effort(low / high は今後追加)
オープンウェイト2026 年 7 月 27 日 Hugging Face
02

Kimi K3 のアーキテクチャ革新とベンチマーク:KDA、AttnRes、Stable LatentMoE

Kimi Delta Attention(KDA)はハイブリッド線形アテンション機構です。3:1 の比率で線形アテンション層とフルアテンション層を交互に配置し、3 つの線形層が局所構造を低コストで処理し、1 つのフルアテンション層がグローバルな情報流を保持します。結果として KV キャッシュメモリは最大 75% 削減、100 万 token コンテキストでのデコード速度は最大 6.3 倍向上し、短・長コンテキストおよび強化学習スケールの各シナリオで純粋なフルアテンション基線を上回ります。

Attention Residuals(AttnRes)は深度方向の残差接続を再設計します。標準的な残差接続は初期層の重要な表現を薄めがちですが、AttnRes は選択的リトリーバルを導入し、モデルがより浅い層の高価値表現を深度を跨いで直接参照できます。訓練効率は約 25% 向上し、追加計算コストは 2% 未満です。

Stable LatentMoEは 896 エキスパート / 16 活性化という極端なスパース度でも安定訓練を可能にします。関連技術は次のとおりです。

技術役割
Quantile Balancingルータースコアの分位数からエキスパート割当を直接導出し、ヒューリスティックなハイパーパラメータを排除
Per-Head Muon各アテンションヘッドを独立最適化し、大規模訓練をより適応的に
Sigmoid Tanh Unit(SiTU)活性化関数の制御を改善
Gated MLAアテンションの選択性を向上

これらを総合すると、K3 は Kimi K2 比で全体のスケール効率が約 2.5 倍向上しています。以下は Moonshot AI 自社報告のベンチマークです(各モデルは独自の推論 harness を使用しており、独立した第三者再現は進行中です)。

ベンチマークKimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GLM-5.2
DeepSWE67.570.073.059.046.2
Program Bench77.876.877.671.963.7
Terminal Bench 2.188.384.688.884.682.7
FrontierSWE81.286.671.366.767.3
SWE Marathon42.035.039.040.013.0
BrowseComp91.288.090.484.3
Automation Bench30.829.129.727.212.9
GPQA-Diamond93.592.694.191.091.2
MMMU-Pro(視覚)81.681.283.078.9
OmniDocBench91.189.885.887.9

SWE Marathon は持続的な長時間コード作業を測定するベンチマークです。K3 は 42.0 で大差トップ。Artificial Analysis Intelligence Index v4.1 では K3 が 57.1 点で 4 位、Claude Fable 5(59.9)と GPT-5.6 Sol(58.9)に続き、差はわずか 2.8 点です。

03

Kimi K3 の料金はいくら?Claude、GPT、DeepSeek とのコスト比較

K3 の標準料金は Claude Sonnet 5 と同水準($3/$15 per 1M tokens)ですが、コンテキストウィンドウは 5 倍(1M vs 200K)です。キャッシュヒット時の入力は $0.30/M(標準の 1/10)まで下がり、Moonshot はプログラミングシナリオでキャッシュヒット率 90% 超を報告しています。OpenRouter の 7 日加重平均でも実効入力コストは約 $0.55/M と確認されています。

モデル入力($/M)出力($/M)キャッシュヒット入力コンテキスト
Kimi K3$3.00$15.00$0.301M
Claude Sonnet 5$3.00(プロモ $2)$15.00(プロモ $10)200K
Claude Opus 4.8$5.00$25.00200K
GPT-5.5$5.00$30.00400K
DeepSeek V4 Pro$1.74$3.48$0.145128K
Kimi K2.6$0.95$4.00$0.16256K

Claude Opus 4.8 と比べると、K3 は複数ベンチマークで優位ながら入力コストは 60%、出力コストは 40% です。国内 API 料金は入力 ¥20/M、出力 ¥100/M、キャッシュヒット ¥2/M。コンシューマー版は Kimi.com の無料アカウントで利用でき、プリペイドプランは ¥199 から(割引は 8 月 11 日まで)です。

04

Kimi K3 を今すぐ使うには?4 つの接続方法と 6 ステップ Runbook

01

Kimi Web / App(最も簡単):kimi.com にアクセスし、アカウントを登録します(Google アカウント対応)。K3 はデフォルトで最大推論モードで動作し、クレジットカードは不要です。

02

API Key の取得:platform.kimi.ai で開発者アカウントを登録し、API Key を作成してチャージします。

03

OpenAI 互換クライアントの設定:base_url="https://api.moonshot.ai/v1" を指定し、モデル ID は kimi-k3 です。

04

OpenRouter 経由:モデル ID は moonshotai/kimi-k3。Moonshot 公式料金に追加マージンはなく、1M コンテキストが利用できます。

05

Prompt Caching の有効化:プログラミングワークフローで会話ルーティング用キャッシュキーを設定し、90% 超のキャッシュヒット率で実効入力コストを約 $0.55/M まで下げます。

06

7 月 27 日をカレンダーに:完全なモデルウェイトが Hugging Face で公開されます。MXFP4 / NVFP4 量子化版と vLLM、SGLang の Day-0 対応が見込まれます。本番デプロイには 64 枚以上の加速カードを備えたスーパーノードが必要です。

Python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "このコードを分析してください..."}]
)

オープンソーススケジュール:7 月 17–20 日の WAIC で追加発表が予想されます → 7 月 27 日に K3 完全ウェイトが公開され、2 兆パラメータ超のダウンロード可能なオープンウェイトとして初の到達点になります。

05

Kimi K3 はどう選ぶ?シナリオマトリクスと引用可能な技術データ

シナリオ推奨モデル理由
持続的な長時間コードタスクKimi K3SWE Marathon ベンチマーク 1 位、1M コンテキストが最長
複雑な Repo 規模のバグ修正Claude Fable 5FrontierSWE 86.6 で大差リード
ターミナル / ツールチェーン集約型 AgentGPT-5.6 SolTerminal Bench 2.1 と Coding Agent Index で先行
超長文 / マルチモーダル理解Kimi K3OmniDocBench 91.1 で 1 位、ネイティブ視覚 + 1M コンテキスト
コスト重視DeepSeek V4 Pro出力 $3.48/M と K3 を大きく下回る
オープンソース自前デプロイ(7/27 以降)Kimi K3最強のオープンウェイト、MXFP4 量子化に適合
A

パラメータ規模:2.8T。DeepSeek V4 Pro(1.6T)を約 75% 上回り、7/27 以降ダウンロード可能な最大オープンソースモデルです。

B

KDA 効率:KV キャッシュ -75%、100 万 token デコード +6.3 倍、訓練スケール効率 +2.5 倍(K2 比)。

C

Intelligence Index:Artificial Analysis v4.1 で 57.1 点。オープンソースモデル中最高で、クローズドソース旗艦との差は 2.8 点です。

注意:上記ベンチマークは Moonshot AI 自社報告です。K3 は Kimi Code、GPT は Codex、Claude は Claude Code それぞれの harness を使用しています。独立した第三者再現は進行中のため、方向性の参考としてご覧ください。

Kimi K3 はパラメータ数を積み上げただけの見せかけではありません。KDA、AttnRes、Stable LatentMoE は実際のエンジニアリング革新であり、プログラミング長タスクや文書理解の分野で一部のクローズドソース旗艦に匹敵、あるいは上回る位置にあります。API 単体でもすぐに始められますが、ローカル Mac では長時間の Kimi Code Agent ループでメモリ圧迫や IDE 常駐オーバーヘッドに直面しやすく、クラウド VM 案は Metal 互換性のロスが出ます。7×24 でプログラミング Agent、並列 dev server、推論常駐を安定運用するエンジニアリングチームには、MESHLAUNCH の Mac Mini クラウドベアメタルレンタルがより適した選択です。Apple Silicon 専有、日/週/月の柔軟契約で、高頻度 Agent 開発と iOS CI/CD 自動化に向いています。容量と申込は レンタル料金、手順は ヘルプセンター をご参照ください。

参考:Moonshot AI 公式ブログ · Kimi API Platform ドキュメント · Artificial Analysis · OpenRouter 料金ページ · VentureBeat · SCMP

よくある質問

はい。kimi.com で無料アカウントを登録すれば K3 を利用できます。デフォルトで最大推論モードで動作します。API 呼び出しは有料($3/$15 per 1M tokens)です。予算計画は レンタル料金ページ もご参照ください。

完全ウェイトは 2026 年 7 月 27 日に Hugging Face で公開されます。本番級デプロイには 64 枚以上の加速カードを備えたスーパーノードが必要で、コンシューマー向けローカルデプロイは現実的ではありません。モデルは MXFP4 ウェイト + MXFP8 活性化で訓練され、量子化に適しています。

K3 はパラメータ数が約 2 倍、コンテキストが 8 倍、プログラミングと文書理解ベンチマークも優れています。DeepSeek V4 Pro は出力 $3.48/M と低コストで、予算重視のシナリオに向きます。詳細は ヘルプセンター の関連記事もご覧ください。

コードベース全体の一括分析、長大な法律・研究文書の処理、多段 Agent の長期メモリなどで非常に有用です。フラット料金で長さ追加料金がなく、90% 超のキャッシュヒット率と合わせて実コストを抑えやすい設計です。

Moonshot AI によると low と high モードは今後のアップデートで提供予定で、現時点では max モードのみ利用可能です。