Kimi K3 全面開源
2.8 萬億參數、百萬上下文

11 天從 API 到完整權重 · KDA/AttnRes/MoE 架構 · 授權條款與跑分全解析

Kimi K3 全面開源:2.8 萬億參數、百萬上下文
7 月 27 日晚 23 點左右,月之暗面(Moonshot AI)正式發布 Kimi K3 完整模型權重與技術報告,並同步開源 MoonEP、FlashKDA、AgentEnv 三項核心基礎設施——這是全球首個被完整開放的 3 萬億參數級別模型。本文面向正在評估 K3 接入與商用合規的技術團隊,整理 11 天時間線、架構創新解讀、第三方跑分對比、授權兩道商業門檻,以及 API 與自部署的六步 Runbook。
01

Kimi K3 全面開源:為什麼這次發布值得關注

Kimi K3 是一個擁有 2.8 萬億總參數的混合專家(MoE)模型,啟用參數約 1040 億,支援 100 萬 token 上下文視窗,具備原生視覺理解能力。權重檔在 Hugging Face 上體積約 1.56TB,上線半小時內即登頂趨勢榜第一。這次開源距離 K3 在 kimi.com 與 API 端首發,只過去了 11 天。

01

7 月 16 日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 以及 Kimi API 首發,但僅限線上呼叫,模型權重尚未公開。官方技術部落格標題為《Kimi K3: Open Frontier Intelligence》。

02

7 月 17 日:業界開始密集分析其架構,新華社報導稱其為「目前全球參數最大的開源模型」。

03

7 月 22 日–23 日:中美「模型蒸餾」爭端升級。美國白宮科技顧問 Michael Kratsios 指控月之暗面對 Anthropic 的 Fable 模型進行「大規模、隱蔽的工業化蒸餾」;美國財政部長 Scott Bessent 隨後表示將考慮對相關中國企業實施制裁及「實體清單」限制。

04

7 月 27 日晚 23 點:月之暗面正式發布 K3 完整模型權重、技術報告,並開源 MoonEP、AgentEnv(FlashKDA 此前已開源)。

05

7 月 28 日:中國商務部就中美 AI 爭端公開回應,指責美方搞「AI 霸權主義」並威脅採取反制措施;國內多家媒體跟進報導本次開源細節。

三天後,阿里巴巴(月之暗面的投資方之一)發布了 24 萬億參數的 Qwen3.8-Max-Preview,被外界普遍解讀為對 K3 的直接回應,國產大模型的競爭正式進入「3T 俱樂部」階段。

02

Kimi K3 核心參數與跑分:和 GPT-5.6、Claude 比一比

不同機構、不同評測框架給出的數字差異較大,以下優先引用獨立第三方複測資料,廠商自報數據會單獨標註。

項目Kimi K3備註
總參數量2.8 萬億(2.8T)全球首個完整開放的 3T 級模型
啟用參數量約 1040 億MoE 稀疏啟用
專家配置896 路由專家,每 token 啟用 16 個稀疏度約 1.8%
上下文視窗100 萬 tokenKDA + Gated MLA 混合注意力
權重體積約 1.56TBMXFP4 權重 + MXFP8 啟用
License自訂授權條款官方稱「open weight」而非「open source」

SWE-bench Verified(獨立複測,Vals AI,截至 2026 年 7 月)

模型分數發布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Kimi K3 是開源陣營裡能力天花板最高的選項,而不是性價比最高的選項——Artificial Analysis 智慧指數全球第 3、開源模型第 1,但每任務成本約 $0.95,高於 GLM-5.2 的約 $0.47/任務。

03

KDA、AttnRes、Per-Head Muon 與三大開源 Infra 技術

Kimi K3 在架構上重構了深度學習沿用多年的三大傳統元件——注意力機制、殘差連接、最佳化器,這也是它區別於「單純堆參數」的關鍵。

Kimi Delta Attention(KDA)把傳統 Gated DeltaNet 的標量級遺忘門改成逐通道級別:每一個特徵維度都擁有自己獨立的衰減率,採用 chunkwise 的 DPLR 公式實現線性時間遞迴。K3 將 KDA 與少量全域注意力層(Gated MLA)交替混合使用,支撐 100 萬 token 上下文的同時把 KV Cache 開銷壓到極低。

Attention Residuals(AttnRes)把殘差連接從「雨露均霑」改成選擇性、依據輸入動態聚合前面所有層的輸出——每層只需新增一個 RMSNorm 和一個偽查詢向量,帶來約 25% 的訓練效率提升,代價不到 2%。

Per-Head Muon讓每個注意力頭獨立學習,擁有更自適應的收斂路徑。配合 Stable LatentMoE(896 選 16 的稀疏路由 + Quantile Balancing 均衡策略),從數學上證明了每個計算節點冗餘專家數的理論上界。

技術定位關鍵能力
MoonEP超大規模細粒度 MoE 通訊庫臨時複製過載專家,保證每個計算節點獲得均等 token 數;證明冗餘專家數理論上界
FlashKDA基於 CUTLASS 的 KDA 高效能算子H20 上 prefill 速度提升 1.72–2.22 倍;可作為 chunk_kda 直接替代後端
AgentEnvFirecracker microVM 智慧體沙箱checkpoint 延遲低至 133ms、恢復 49ms、記憶體超分最高 6.5 倍(官方數據,尚未第三方複現)
Python · OpenAI SDK 相容
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)

提示:月之暗面這次沒有只發一份權重檔,而是把支撐 K3 訓練效率與穩定性的三項關鍵基礎設施技術也一併開源,這也是本次發布在開發者社群獲得較高評價的重要原因。

04

Kimi K3 接入與部署:六步 Runbook

01

確認接入路徑:評估團隊是需要 API 呼叫、OpenRouter 第三方託管,還是 64 卡以上超節點自部署。對個人開發者與多數中小團隊,API 或 OpenRouter 是現實路徑。

02

註冊 Moonshot API:https://api.moonshot.ai/v1 取得 API Key,模型 ID 為 kimi-k3,相容 OpenAI SDK,多數現有專案只需改 base URL 與密鑰。

03

設定快取策略:Mooncake 分離式推理架構在典型程式設計類工作負載上快取命中率可達 90% 以上,實際成本更接近輸入 $0.30/M(快取命中)而非 $3.00/M(快取未命中)。

04

自部署評估(可選):若需本地權重,從 Hugging Face moonshotai/Kimi-K3 下載約 1.56TB 權重,準備 64 卡及以上超節點,設定專家並行與張量並行。

05

審閱授權條款:確認你的業務是否觸發 Model-as-a-Service 年收入 2000 萬美元門檻,或月活 1 億/月收入 2000 萬美元的展示門檻。

06

整合 Infra 工具鏈:若使用 KDA 算子,將 flash-linear-attention 函式庫的 chunk_kda 後端切換為 FlashKDA;大規模 Agent RL 訓練可評估 AgentEnv 沙箱整合。

05

授權兩道商業門檻與 API 定價硬數據

A

開放權重 vs 開源:月之暗面官方材料從未使用「open source」,一直採用「open weight」表述。依 OSI 標準,K3 只公開了權重檔、技術報告與推理相關 Infra 工具,訓練資料與完整訓練程式碼並未公開。

B

Model-as-a-Service 收入門檻:若營運 MaaS 業務且連續 12 個月累計收入超過 2000 萬美元,必須與月之暗面另行簽署商業協議。

C

API 定價(每百萬 token):輸入快取命中 $0.30、快取未命中 $3.00、輸出(含推理過程)$15.00。Artificial Analysis 實測單任務成本約 $0.95,比 Claude Fable 5(約 $2.4/任務)便宜約 60%。

注意:2.8 萬億參數、896 個專家的規模決定了 K3 幾乎不可能在消費級硬體上執行。OpenRouter 等第三方平台目前已有 7 家服務商上線 K3,定價大多與官方一致。

若你的團隊需要在本地 Mac 上執行 Agent 編排、CI/CD 流水線或長期駐留的 Gateway 程序,消費級 GPU 自部署 K3 並不現實;而本地 Mac 的休眠、更新彈窗與記憶體瓶頸同樣會打斷長程 Agent 任務。對於需要 7×24 穩定執行 iOS CI/CD 與 AI Agent 自動化的生產環境,MESHLAUNCH 的 Mac Mini 雲端租用通常是更優解:獨占 Apple Silicon、按天/週/月彈性下單,把推理交給 API、把編排與建置留在穩定的雲端 Mac 節點上。

常見問題

嚴格來說不是。它屬於「開放權重(open weight)」模型:訓練完成的權重檔、技術報告與部分 Infra 工具是公開的,但訓練資料與完整訓練程式碼並未公開,不符合 OSI 標準下的「開源」定義。

可以,絕大多數商業場景不受限制。但若你營運的是「模型即服務」業務且年收入超過 2000 萬美元,或產品月活超過 1 億/月收入超過 2000 萬美元,需額外滿足授權條款中的特定條件。詳情可見 價格頁了解雲端開發環境方案。

官方建議部署在 64 卡及以上的超節點叢集。個人與多數企業使用者更現實的方式是透過官方 API 或 OpenRouter 等第三方平台呼叫。建議先查看 幫助中心了解雲端 Mac 開發環境設定。

在開源模型陣營中綜合能力最強,Artificial Analysis 智慧指數全球第 3,僅次於 Claude Fable 5 與 GPT-5.6 Sol;但成本高於同為開源的 GLM-5.2。K3 目前在 Arena.ai 的 Frontend Code Arena 榜單上排名第一。

K3 參數規模是 K2.5 的約 3 倍,架構上新增了 Attention Residuals 與 Per-Head Muon,上下文視窗與多模態能力也大幅提升;授權方面 K3 新增了 Model-as-a-Service 收入門檻,商業限制比 K2 系列更細化。