Kimi K3 是什麼?2.8 萬億參數開源大模型核心規格
2026 年 7 月 16 日,月之暗面發布 Kimi K3——2.8 萬億(2.8T)參數的稀疏混合專家(MoE)模型,超越此前紀錄保持者 DeepSeek V4 Pro(1.6T)近 75%,是小米開源模型(1.02T)的 2.7 倍,是阿里(397B)的 7 倍有餘。低調上線與巨大體量形成鮮明對比:一份技術部落格、一個定價頁面、一個可立刻呼叫的模型 ID kimi-k3。
K3 採用 896 個專家、每次推理啟用 16 個(稀疏度 1.8%);配合 100 萬 token 超長上下文(約等於一次性讀完 5 本《紅樓夢》全文)及原生視覺理解,專為複雜程式設計、長文件推理與知識工作設計。一句話總結:開源的、可原生理解圖像與影片的、擁有超長記憶的重量級程式設計 AI,價格比 Claude Opus 4.8 便宜 40%,完整權重將於 7 月 27 日對外開源。
規模衝擊:DeepSeek 崛起後月之暗面市場份額一度大幅縮水,K3 是戰略反擊——過去 12 個月 Kimi 系列有 9 個月佔據開源模型規模上限。
發布時機:恰在 2026 世界人工智慧大會(WAIC)開幕前夜,7 月 17–20 日預計更多發布。
商業化爆發:截至 2026 年 6 月 ARR 突破 3 億美元,今年內完成第 6 輪融資,投前估值 315 億美元;API 收入佔七成以上,海外付費使用者成長 400%。
長上下文痛點:傳統全注意力在百萬 token 下 KV 快取記憶體呈毀滅性成長,K3 的 KDA 機制正是為此而生。
程式設計 Agent 需求:SWE Marathon 等長時程程式碼任務需要模型在數小時工作階段中保持上下文連貫,1M 視窗 + 快取命中 90%+ 是核心賣點。
| 參數 | 數值 |
|---|---|
| 總參數量 | 2.8 萬億(全球最大開源模型) |
| 架構 | KDA + AttnRes + Stable LatentMoE |
| 啟用專家 | 16 / 896(稀疏 MoE,1.8%) |
| 上下文視窗 | 1,048,576 tokens(1M) |
| 輸入模態 | 文字、圖像、影片 |
| 推理模式 | Always-on max effort(low/high 後續更新) |
| 開源權重 | 2026 年 7 月 27 日 Hugging Face |
Kimi K3 架構創新與基準測試:KDA、AttnRes 與 Stable LatentMoE
Kimi Delta Attention(KDA)是混合線性注意力機制:以 3:1 比例交替線性注意力層與全注意力層——3 個線性層處理局部結構(計算廉價),1 個全注意力層保留全域資訊流。結果:KV 快取記憶體減少高達 75%,百萬 token 上下文下解碼速度提升高達 6.3 倍,短/長上下文與強化學習擴展場景均超越純全注意力基線。
Attention Residuals(AttnRes)改造深度維度殘差連接:標準殘差會稀釋早期層關鍵表徵;AttnRes 引入選擇性檢索,模型可跨越深度直接拉取更早層高價值表徵,帶來約 25% 訓練效率提升,額外計算開銷不足 2%。
Stable LatentMoE在 896 專家 / 16 啟用的極端稀疏度下穩定訓練,配套技術如下:
| 技術 | 作用 |
|---|---|
| Quantile Balancing | 從路由器得分分位數直接推導專家分配,消除啟發式超參 |
| Per-Head Muon | 針對每個注意力頭獨立最佳化,使大規模訓練更自適應 |
| Sigmoid Tanh Unit(SiTU) | 改進啟用函數控制 |
| Gated MLA | 提升注意力選擇性 |
綜合以上創新,K3 相較 Kimi K2 整體擴展效率提升約 2.5 倍。月之暗面自報基準數據如下(不同模型使用各自推理 harness,獨立第三方復現仍在進行):
| 基準測試 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro(視覺) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench | 91.1 | 89.8 | 85.8 | 87.9 | — |
SWE Marathon 專門測試持續性長程式碼工作——K3 以 42.0 大幅領先排名第一;Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,緊隨 Claude Fable 5(59.9)與 GPT-5.6 Sol(58.9)之後,差距僅 2.8 分。
Kimi K3 定價多少?與 Claude、GPT、DeepSeek 成本對比
K3 標準價與 Claude Sonnet 5 持平($3/$15 per 1M tokens),但提供 5 倍上下文視窗(1M vs 200K)。快取命中價格低至 $0.30/M(標準價 1/10),月之暗面報告程式設計場景快取命中率超過 90%,實際有效輸入成本極低;OpenRouter 7 日加權平均證實有效輸入成本約 $0.55/M。
| 模型 | 輸入($/M) | 輸出($/M) | 快取命中輸入 | 上下文 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00(促銷 $2) | $15.00(促銷 $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
相較 Claude Opus 4.8,K3 在多項基準上更優,輸入成本僅 60%、輸出成本僅 40%。中國大陸 API 定價:輸入 ¥20/M、輸出 ¥100/M、快取命中 ¥2/M;消費者版在 Kimi.com 免費帳號即可使用,預付費方案 ¥199 起(優惠截至 8 月 11 日)。
如何立即使用 Kimi K3?四種接入方式與六步 Runbook
Kimi 網頁/App(最簡單):造訪 kimi.com,註冊帳號(支援 Google 帳號),K3 預設以最大推理力度執行,無需信用卡。
取得 API Key:在 platform.kimi.ai 註冊開發者帳號,建立 API Key 並儲值。
設定 OpenAI 相容用戶端:設定 base_url="https://api.moonshot.ai/v1",模型 ID 為 kimi-k3。
OpenRouter 接入:模型 ID moonshotai/kimi-k3,Moonshot 官方定價無額外加價,完整 1M 上下文。
啟用 Prompt Caching:程式設計工作流設定對話路由快取鍵,利用 90%+ 快取命中率降低實際輸入成本至約 $0.55/M。
標記 7 月 27 日:完整模型權重將在 Hugging Face 開放,MXFP4/NVFP4 量化版與 vLLM、SGLang 預計 Day-0 支援;生產部署需 64+ 加速卡超節點。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "幫我分析這段程式碼..."}]
)
開源時間表:7 月 17–20 日 WAIC 預計更多發布 → 7 月 27 日 K3 完整權重開源,將成為首個超 2 萬億參數級別的可下載開源權重。
Kimi K3 怎麼選?場景矩陣與可引用技術數據
| 場景 | 推薦模型 | 原因 |
|---|---|---|
| 持續性長程式碼任務 | Kimi K3 | SWE Marathon 基準第一,1M 上下文最長 |
| 複雜 Repo 級別修 Bug | Claude Fable 5 | FrontierSWE 86.6 大幅領先 |
| 終端/工具鏈密集型 Agent | GPT-5.6 Sol | Terminal Bench 2.1 與 Coding Agent Index 領先 |
| 超長文件/多模態理解 | Kimi K3 | OmniDocBench 91.1 第一,原生視覺 + 1M 上下文 |
| 成本敏感場景 | DeepSeek V4 Pro | 輸出僅 $3.48/M,遠低於 K3 |
| 開源自部署(7/27 後) | Kimi K3 | 最強開源權重,MXFP4 量化友好 |
參數量級:2.8T,超越 DeepSeek V4 Pro(1.6T)近 75%,迄今最大可下載開源模型(7/27 後)。
KDA 效率:KV 快取 -75%、百萬 token 解碼 +6.3×、訓練擴展效率 +2.5×(vs K2)。
Intelligence Index:Artificial Analysis v4.1 得分 57.1,開源模型中最高,與閉源旗艦差距 2.8 分。
注意:上述基準為月之暗面自報數據,K3 用 Kimi Code、GPT 用 Codex、Claude 用 Claude Code 各自 harness;獨立第三方復現仍在進行中,請作方向性參考。
Kimi K3 不是參數堆砌的面子工程——KDA、AttnRes、Stable LatentMoE 是真實工程創新,在程式設計長任務與文件理解等賽道對標乃至超越部分閉源旗艦。純 API 呼叫雖可快速起步,但本地 Mac 在長時間 Kimi Code Agent 迴圈中常遇記憶體壓力與 IDE 常駐開銷;雲端虛擬機又存在 Metal 相容性損耗。對於需要 7×24 穩定執行程式設計 Agent、並行 dev server 與推理常駐的工程團隊,MESHLAUNCH 的 Mac Mini 雲端裸金屬租用通常是更優解:獨占 Apple Silicon、按天/週/月彈性下單,更適合 iOS CI/CD 與 AI Agent 自動化生產環境。
參考資料:Moonshot AI 官方部落格 · Kimi API Platform 文件 · Artificial Analysis · OpenRouter 定價頁 · VentureBeat · SCMP
可以。在 kimi.com 註冊免費帳號即可使用 K3。API 呼叫需付費($3/$15 per 1M tokens)。預算規劃可參考 租賃價格頁。
完整權重將於 2026 年 7 月 27 日在 Hugging Face 開放。生產級部署需要 64 張以上加速卡的超節點,消費級本地部署不現實。模型以 MXFP4 權重 + MXFP8 啟用訓練,量化友好。
K3 參數量近兩倍、上下文大 8 倍、程式設計與文件理解基準更強;DeepSeek V4 Pro 輸出僅 $3.48/M,成本敏感場景更優。詳見 幫助中心 相關說明。
對一次性分析完整程式碼庫、處理長篇法律/研究文件、以及多輪 Agent 長記憶場景非常實用;flat 定價無長度附加費,配合 90%+ 快取命中率實際成本可控。
月之暗面表示 low 和 high 力度模式將在後續更新中推出,目前僅 max 模式可用。