Kimi K3 全面開源:為什麼這次發布值得關注
Kimi K3 是一個擁有 2.8 萬億總參數的混合專家(MoE)模型,啟用參數約 1040 億,支援 100 萬 token 上下文視窗,具備原生視覺理解能力。權重檔在 Hugging Face 上體積約 1.56TB,上線半小時內即登頂趨勢榜第一。這次開源距離 K3 在 kimi.com 與 API 端首發,只過去了 11 天。
7 月 16 日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 以及 Kimi API 首發,但僅限線上呼叫,模型權重尚未公開。官方技術部落格標題為《Kimi K3: Open Frontier Intelligence》。
7 月 17 日:業界開始密集分析其架構,新華社報導稱其為「目前全球參數最大的開源模型」。
7 月 22 日–23 日:中美「模型蒸餾」爭端升級。美國白宮科技顧問 Michael Kratsios 指控月之暗面對 Anthropic 的 Fable 模型進行「大規模、隱蔽的工業化蒸餾」;美國財政部長 Scott Bessent 隨後表示將考慮對相關中國企業實施制裁及「實體清單」限制。
7 月 27 日晚 23 點:月之暗面正式發布 K3 完整模型權重、技術報告,並開源 MoonEP、AgentEnv(FlashKDA 此前已開源)。
7 月 28 日:中國商務部就中美 AI 爭端公開回應,指責美方搞「AI 霸權主義」並威脅採取反制措施;國內多家媒體跟進報導本次開源細節。
三天後,阿里巴巴(月之暗面的投資方之一)發布了 24 萬億參數的 Qwen3.8-Max-Preview,被外界普遍解讀為對 K3 的直接回應,國產大模型的競爭正式進入「3T 俱樂部」階段。
Kimi K3 核心參數與跑分:和 GPT-5.6、Claude 比一比
不同機構、不同評測框架給出的數字差異較大,以下優先引用獨立第三方複測資料,廠商自報數據會單獨標註。
| 項目 | Kimi K3 | 備註 |
|---|---|---|
| 總參數量 | 2.8 萬億(2.8T) | 全球首個完整開放的 3T 級模型 |
| 啟用參數量 | 約 1040 億 | MoE 稀疏啟用 |
| 專家配置 | 896 路由專家,每 token 啟用 16 個 | 稀疏度約 1.8% |
| 上下文視窗 | 100 萬 token | KDA + Gated MLA 混合注意力 |
| 權重體積 | 約 1.56TB | MXFP4 權重 + MXFP8 啟用 |
| License | 自訂授權條款 | 官方稱「open weight」而非「open source」 |
SWE-bench Verified(獨立複測,Vals AI,截至 2026 年 7 月)
| 模型 | 分數 | 發布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Kimi K3 是開源陣營裡能力天花板最高的選項,而不是性價比最高的選項——Artificial Analysis 智慧指數全球第 3、開源模型第 1,但每任務成本約 $0.95,高於 GLM-5.2 的約 $0.47/任務。
KDA、AttnRes、Per-Head Muon 與三大開源 Infra 技術
Kimi K3 在架構上重構了深度學習沿用多年的三大傳統元件——注意力機制、殘差連接、最佳化器,這也是它區別於「單純堆參數」的關鍵。
Kimi Delta Attention(KDA)把傳統 Gated DeltaNet 的標量級遺忘門改成逐通道級別:每一個特徵維度都擁有自己獨立的衰減率,採用 chunkwise 的 DPLR 公式實現線性時間遞迴。K3 將 KDA 與少量全域注意力層(Gated MLA)交替混合使用,支撐 100 萬 token 上下文的同時把 KV Cache 開銷壓到極低。
Attention Residuals(AttnRes)把殘差連接從「雨露均霑」改成選擇性、依據輸入動態聚合前面所有層的輸出——每層只需新增一個 RMSNorm 和一個偽查詢向量,帶來約 25% 的訓練效率提升,代價不到 2%。
Per-Head Muon讓每個注意力頭獨立學習,擁有更自適應的收斂路徑。配合 Stable LatentMoE(896 選 16 的稀疏路由 + Quantile Balancing 均衡策略),從數學上證明了每個計算節點冗餘專家數的理論上界。
| 技術 | 定位 | 關鍵能力 |
|---|---|---|
| MoonEP | 超大規模細粒度 MoE 通訊庫 | 臨時複製過載專家,保證每個計算節點獲得均等 token 數;證明冗餘專家數理論上界 |
| FlashKDA | 基於 CUTLASS 的 KDA 高效能算子 | H20 上 prefill 速度提升 1.72–2.22 倍;可作為 chunk_kda 直接替代後端 |
| AgentEnv | Firecracker microVM 智慧體沙箱 | checkpoint 延遲低至 133ms、恢復 49ms、記憶體超分最高 6.5 倍(官方數據,尚未第三方複現) |
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
提示:月之暗面這次沒有只發一份權重檔,而是把支撐 K3 訓練效率與穩定性的三項關鍵基礎設施技術也一併開源,這也是本次發布在開發者社群獲得較高評價的重要原因。
Kimi K3 接入與部署:六步 Runbook
確認接入路徑:評估團隊是需要 API 呼叫、OpenRouter 第三方託管,還是 64 卡以上超節點自部署。對個人開發者與多數中小團隊,API 或 OpenRouter 是現實路徑。
註冊 Moonshot API:在 https://api.moonshot.ai/v1 取得 API Key,模型 ID 為 kimi-k3,相容 OpenAI SDK,多數現有專案只需改 base URL 與密鑰。
設定快取策略:Mooncake 分離式推理架構在典型程式設計類工作負載上快取命中率可達 90% 以上,實際成本更接近輸入 $0.30/M(快取命中)而非 $3.00/M(快取未命中)。
自部署評估(可選):若需本地權重,從 Hugging Face moonshotai/Kimi-K3 下載約 1.56TB 權重,準備 64 卡及以上超節點,設定專家並行與張量並行。
審閱授權條款:確認你的業務是否觸發 Model-as-a-Service 年收入 2000 萬美元門檻,或月活 1 億/月收入 2000 萬美元的展示門檻。
整合 Infra 工具鏈:若使用 KDA 算子,將 flash-linear-attention 函式庫的 chunk_kda 後端切換為 FlashKDA;大規模 Agent RL 訓練可評估 AgentEnv 沙箱整合。
授權兩道商業門檻與 API 定價硬數據
開放權重 vs 開源:月之暗面官方材料從未使用「open source」,一直採用「open weight」表述。依 OSI 標準,K3 只公開了權重檔、技術報告與推理相關 Infra 工具,訓練資料與完整訓練程式碼並未公開。
Model-as-a-Service 收入門檻:若營運 MaaS 業務且連續 12 個月累計收入超過 2000 萬美元,必須與月之暗面另行簽署商業協議。
API 定價(每百萬 token):輸入快取命中 $0.30、快取未命中 $3.00、輸出(含推理過程)$15.00。Artificial Analysis 實測單任務成本約 $0.95,比 Claude Fable 5(約 $2.4/任務)便宜約 60%。
注意:2.8 萬億參數、896 個專家的規模決定了 K3 幾乎不可能在消費級硬體上執行。OpenRouter 等第三方平台目前已有 7 家服務商上線 K3,定價大多與官方一致。
若你的團隊需要在本地 Mac 上執行 Agent 編排、CI/CD 流水線或長期駐留的 Gateway 程序,消費級 GPU 自部署 K3 並不現實;而本地 Mac 的休眠、更新彈窗與記憶體瓶頸同樣會打斷長程 Agent 任務。對於需要 7×24 穩定執行 iOS CI/CD 與 AI Agent 自動化的生產環境,MESHLAUNCH 的 Mac Mini 雲端租用通常是更優解:獨占 Apple Silicon、按天/週/月彈性下單,把推理交給 API、把編排與建置留在穩定的雲端 Mac 節點上。
嚴格來說不是。它屬於「開放權重(open weight)」模型:訓練完成的權重檔、技術報告與部分 Infra 工具是公開的,但訓練資料與完整訓練程式碼並未公開,不符合 OSI 標準下的「開源」定義。
可以,絕大多數商業場景不受限制。但若你營運的是「模型即服務」業務且年收入超過 2000 萬美元,或產品月活超過 1 億/月收入超過 2000 萬美元,需額外滿足授權條款中的特定條件。詳情可見 價格頁了解雲端開發環境方案。
官方建議部署在 64 卡及以上的超節點叢集。個人與多數企業使用者更現實的方式是透過官方 API 或 OpenRouter 等第三方平台呼叫。建議先查看 幫助中心了解雲端 Mac 開發環境設定。
在開源模型陣營中綜合能力最強,Artificial Analysis 智慧指數全球第 3,僅次於 Claude Fable 5 與 GPT-5.6 Sol;但成本高於同為開源的 GLM-5.2。K3 目前在 Arena.ai 的 Frontend Code Arena 榜單上排名第一。
K3 參數規模是 K2.5 的約 3 倍,架構上新增了 Attention Residuals 與 Per-Head Muon,上下文視窗與多模態能力也大幅提升;授權方面 K3 新增了 Model-as-a-Service 收入門檻,商業限制比 K2 系列更細化。