Kimi K3 深度評測
2.8 萬億參數開源大模型新紀錄

KDA 架構創新 · 百萬 token 上下文 · 基準全表 · 定價對比 · API 接入 · 7/27 開源權重

Kimi K3 2.8 萬億參數開源大模型深度評測 2026
2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文件頂部悄然掛出「Kimi K3 已上線!」——沒有大型發布會,卻發布了目前全球參數規模最大的開源 AI 模型(2.8 萬億)。如果你正為團隊選型程式設計 Agent、對比 Claude Fable 5 與 GPT-5.6 Sol,或等待最強開源權重落地,本文將回答:① K3 的 KDA/AttnRes/Stable LatentMoE 架構創新到底解決了什麼;② 在 SWE Marathon、OmniDocBench 等關鍵基準上表現如何;③ $3/$15 定價與四種接入方式,以及 7 月 27 日完整權重開源意味著什麼。
01

Kimi K3 是什麼?2.8 萬億參數開源大模型核心規格

2026 年 7 月 16 日,月之暗面發布 Kimi K3——2.8 萬億(2.8T)參數的稀疏混合專家(MoE)模型,超越此前紀錄保持者 DeepSeek V4 Pro(1.6T)近 75%,是小米開源模型(1.02T)的 2.7 倍,是阿里(397B)的 7 倍有餘。低調上線與巨大體量形成鮮明對比:一份技術部落格、一個定價頁面、一個可立刻呼叫的模型 ID kimi-k3

K3 採用 896 個專家、每次推理啟用 16 個(稀疏度 1.8%);配合 100 萬 token 超長上下文(約等於一次性讀完 5 本《紅樓夢》全文)及原生視覺理解,專為複雜程式設計、長文件推理與知識工作設計。一句話總結:開源的、可原生理解圖像與影片的、擁有超長記憶的重量級程式設計 AI,價格比 Claude Opus 4.8 便宜 40%,完整權重將於 7 月 27 日對外開源。

01

規模衝擊:DeepSeek 崛起後月之暗面市場份額一度大幅縮水,K3 是戰略反擊——過去 12 個月 Kimi 系列有 9 個月佔據開源模型規模上限。

02

發布時機:恰在 2026 世界人工智慧大會(WAIC)開幕前夜,7 月 17–20 日預計更多發布。

03

商業化爆發:截至 2026 年 6 月 ARR 突破 3 億美元,今年內完成第 6 輪融資,投前估值 315 億美元;API 收入佔七成以上,海外付費使用者成長 400%。

04

長上下文痛點:傳統全注意力在百萬 token 下 KV 快取記憶體呈毀滅性成長,K3 的 KDA 機制正是為此而生。

05

程式設計 Agent 需求:SWE Marathon 等長時程程式碼任務需要模型在數小時工作階段中保持上下文連貫,1M 視窗 + 快取命中 90%+ 是核心賣點。

參數數值
總參數量2.8 萬億(全球最大開源模型)
架構KDA + AttnRes + Stable LatentMoE
啟用專家16 / 896(稀疏 MoE,1.8%)
上下文視窗1,048,576 tokens(1M)
輸入模態文字、圖像、影片
推理模式Always-on max effort(low/high 後續更新)
開源權重2026 年 7 月 27 日 Hugging Face
02

Kimi K3 架構創新與基準測試:KDA、AttnRes 與 Stable LatentMoE

Kimi Delta Attention(KDA)是混合線性注意力機制:以 3:1 比例交替線性注意力層與全注意力層——3 個線性層處理局部結構(計算廉價),1 個全注意力層保留全域資訊流。結果:KV 快取記憶體減少高達 75%,百萬 token 上下文下解碼速度提升高達 6.3 倍,短/長上下文與強化學習擴展場景均超越純全注意力基線。

Attention Residuals(AttnRes)改造深度維度殘差連接:標準殘差會稀釋早期層關鍵表徵;AttnRes 引入選擇性檢索,模型可跨越深度直接拉取更早層高價值表徵,帶來約 25% 訓練效率提升,額外計算開銷不足 2%。

Stable LatentMoE在 896 專家 / 16 啟用的極端稀疏度下穩定訓練,配套技術如下:

技術作用
Quantile Balancing從路由器得分分位數直接推導專家分配,消除啟發式超參
Per-Head Muon針對每個注意力頭獨立最佳化,使大規模訓練更自適應
Sigmoid Tanh Unit(SiTU)改進啟用函數控制
Gated MLA提升注意力選擇性

綜合以上創新,K3 相較 Kimi K2 整體擴展效率提升約 2.5 倍。月之暗面自報基準數據如下(不同模型使用各自推理 harness,獨立第三方復現仍在進行):

基準測試Kimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GLM-5.2
DeepSWE67.570.073.059.046.2
Program Bench77.876.877.671.963.7
Terminal Bench 2.188.384.688.884.682.7
FrontierSWE81.286.671.366.767.3
SWE Marathon42.035.039.040.013.0
BrowseComp91.288.090.484.3
Automation Bench30.829.129.727.212.9
GPQA-Diamond93.592.694.191.091.2
MMMU-Pro(視覺)81.681.283.078.9
OmniDocBench91.189.885.887.9

SWE Marathon 專門測試持續性長程式碼工作——K3 以 42.0 大幅領先排名第一;Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,緊隨 Claude Fable 5(59.9)與 GPT-5.6 Sol(58.9)之後,差距僅 2.8 分。

03

Kimi K3 定價多少?與 Claude、GPT、DeepSeek 成本對比

K3 標準價與 Claude Sonnet 5 持平($3/$15 per 1M tokens),但提供 5 倍上下文視窗(1M vs 200K)。快取命中價格低至 $0.30/M(標準價 1/10),月之暗面報告程式設計場景快取命中率超過 90%,實際有效輸入成本極低;OpenRouter 7 日加權平均證實有效輸入成本約 $0.55/M。

模型輸入($/M)輸出($/M)快取命中輸入上下文
Kimi K3$3.00$15.00$0.301M
Claude Sonnet 5$3.00(促銷 $2)$15.00(促銷 $10)200K
Claude Opus 4.8$5.00$25.00200K
GPT-5.5$5.00$30.00400K
DeepSeek V4 Pro$1.74$3.48$0.145128K
Kimi K2.6$0.95$4.00$0.16256K

相較 Claude Opus 4.8,K3 在多項基準上更優,輸入成本僅 60%、輸出成本僅 40%。中國大陸 API 定價:輸入 ¥20/M、輸出 ¥100/M、快取命中 ¥2/M;消費者版在 Kimi.com 免費帳號即可使用,預付費方案 ¥199 起(優惠截至 8 月 11 日)。

04

如何立即使用 Kimi K3?四種接入方式與六步 Runbook

01

Kimi 網頁/App(最簡單):造訪 kimi.com,註冊帳號(支援 Google 帳號),K3 預設以最大推理力度執行,無需信用卡。

02

取得 API Key:platform.kimi.ai 註冊開發者帳號,建立 API Key 並儲值。

03

設定 OpenAI 相容用戶端:設定 base_url="https://api.moonshot.ai/v1",模型 ID 為 kimi-k3

04

OpenRouter 接入:模型 ID moonshotai/kimi-k3,Moonshot 官方定價無額外加價,完整 1M 上下文。

05

啟用 Prompt Caching:程式設計工作流設定對話路由快取鍵,利用 90%+ 快取命中率降低實際輸入成本至約 $0.55/M。

06

標記 7 月 27 日:完整模型權重將在 Hugging Face 開放,MXFP4/NVFP4 量化版與 vLLM、SGLang 預計 Day-0 支援;生產部署需 64+ 加速卡超節點。

Python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "幫我分析這段程式碼..."}]
)

開源時間表:7 月 17–20 日 WAIC 預計更多發布 → 7 月 27 日 K3 完整權重開源,將成為首個超 2 萬億參數級別的可下載開源權重。

05

Kimi K3 怎麼選?場景矩陣與可引用技術數據

場景推薦模型原因
持續性長程式碼任務Kimi K3SWE Marathon 基準第一,1M 上下文最長
複雜 Repo 級別修 BugClaude Fable 5FrontierSWE 86.6 大幅領先
終端/工具鏈密集型 AgentGPT-5.6 SolTerminal Bench 2.1 與 Coding Agent Index 領先
超長文件/多模態理解Kimi K3OmniDocBench 91.1 第一,原生視覺 + 1M 上下文
成本敏感場景DeepSeek V4 Pro輸出僅 $3.48/M,遠低於 K3
開源自部署(7/27 後)Kimi K3最強開源權重,MXFP4 量化友好
A

參數量級:2.8T,超越 DeepSeek V4 Pro(1.6T)近 75%,迄今最大可下載開源模型(7/27 後)。

B

KDA 效率:KV 快取 -75%、百萬 token 解碼 +6.3×、訓練擴展效率 +2.5×(vs K2)。

C

Intelligence Index:Artificial Analysis v4.1 得分 57.1,開源模型中最高,與閉源旗艦差距 2.8 分。

注意:上述基準為月之暗面自報數據,K3 用 Kimi Code、GPT 用 Codex、Claude 用 Claude Code 各自 harness;獨立第三方復現仍在進行中,請作方向性參考。

Kimi K3 不是參數堆砌的面子工程——KDA、AttnRes、Stable LatentMoE 是真實工程創新,在程式設計長任務與文件理解等賽道對標乃至超越部分閉源旗艦。純 API 呼叫雖可快速起步,但本地 Mac 在長時間 Kimi Code Agent 迴圈中常遇記憶體壓力與 IDE 常駐開銷;雲端虛擬機又存在 Metal 相容性損耗。對於需要 7×24 穩定執行程式設計 Agent、並行 dev server 與推理常駐的工程團隊,MESHLAUNCH 的 Mac Mini 雲端裸金屬租用通常是更優解:獨占 Apple Silicon、按天/週/月彈性下單,更適合 iOS CI/CD 與 AI Agent 自動化生產環境。

參考資料:Moonshot AI 官方部落格 · Kimi API Platform 文件 · Artificial Analysis · OpenRouter 定價頁 · VentureBeat · SCMP

常見問題

可以。在 kimi.com 註冊免費帳號即可使用 K3。API 呼叫需付費($3/$15 per 1M tokens)。預算規劃可參考 租賃價格頁

完整權重將於 2026 年 7 月 27 日在 Hugging Face 開放。生產級部署需要 64 張以上加速卡的超節點,消費級本地部署不現實。模型以 MXFP4 權重 + MXFP8 啟用訓練,量化友好。

K3 參數量近兩倍、上下文大 8 倍、程式設計與文件理解基準更強;DeepSeek V4 Pro 輸出僅 $3.48/M,成本敏感場景更優。詳見 幫助中心 相關說明。

對一次性分析完整程式碼庫、處理長篇法律/研究文件、以及多輪 Agent 長記憶場景非常實用;flat 定價無長度附加費,配合 90%+ 快取命中率實際成本可控。

月之暗面表示 low 和 high 力度模式將在後續更新中推出,目前僅 max 模式可用。