Kimi K3 開源權重 7 月 27 日發布
2.8 兆參數 · 百萬上下文 · 閉源溢價還守得住嗎?

7/16 API 上線 · 7/27 Modified MIT 權重 · 跑分對比 · 真實 API 成本 · 1.4TB 部署真相 · 發布日清單

Kimi K3 開源權重 7 月 27 日發布 2.8 兆參數
月之暗面(Moonshot AI)將於 2026 年 7 月 27 日在 Hugging Face 公開 Kimi K3 完整 2.8 兆參數權重(Modified MIT 授權條款),同步發布技術報告。API 已於 7 月 16 日上線。若你正等待「史上最大開源權重模型」落地、對比 Kimi K3 深度評測與閉源旗艦的差距,或評估自部署 vs API 的真實成本,本文將回答:① 7/16 與 7/27 兩個日期分別意味著什麼;② AA Intelligence Index 57.1(第 3/189)與全項基準表;③ $3/$15 定價、快取命中與單任務 $0.94 的真實帳單;④ 1.4TB 4-bit 權重為何跑不進你的筆電,以及發布日六步核對清單。
01

Kimi K3 開源權重 7 月 27 日發布:事件核心與時間線

7 月 16 日,月之暗面透過 Kimi App、Kimi Work、Kimi Code 及 API 上線 Kimi K3;Artificial Analysis 同日發布獨立評測。7 月 27 日,計畫公開完整模型權重(Modified MIT 授權條款)並發布技術報告(架構、訓練、評估細節)。這是全球首個 3 兆參數級(實際 2.8T)開源權重模型,被普遍視為對閉源模型溢價定價的直接衝擊。

關鍵結論:K3 不是「Fable 5 殺手」——AA Intelligence Index 57.1,排名第 3(共 189 個模型),落後 Claude Fable 5 的 59.9 和 GPT-5.6 Sol 的 58.9。但以約 1/3 的成本達到「接近前沿」的能力,且擁有閉源模型給不了的兩樣東西:開源權重 + 100 萬 token 上下文(1,048,576 tokens)。

日期事件
2026-07-16Kimi K3 透過 API / Kimi 全家桶上線;Artificial Analysis 發布獨立評測
2026-07-17上海世界人工智慧大會(WAIC)開幕;新華社將 K3 發布定調為「國家級里程碑」
2026-07-27完整權重公開下載(Hugging Face,Modified MIT 授權條款)+ 技術報告發布
01

API 已可用:模型 ID kimi-k3 已在 platform.kimi.ai 開放,不必等到 7/27 即可呼叫。

02

權重 ≠ 即刻可跑:7/27 放出的是權重檔案,vLLM 對 KDA / prefix caching 的支援將隨權重一起落地,Ollama / GGUF 量化版本預計像 K2 系列一樣陸續跟進。

03

官方誠實態度:月之暗面罕見地主動承認綜合性能仍落後 Fable 5 和 GPT-5.6 Sol,並列出已知短板(對 harness 傳回推理內容敏感、意圖模糊時過於主動等)。

04

地緣背景:發布趕在 WAIC 前;一個月前美國政府曾短暫下架 Anthropic 的 Fable/Mythos 模型(7 月 1 日恢復)——「監管可以關掉閉源模型,但關不掉已發布的開源權重」成為開源敘事的新論據。

05

月之暗面翻身:2025 年初被 DeepSeek R1 衝擊後排名跌至國內第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 的開源路線重建地位。

02

Kimi K3 是什麼?2.8T 參數規格與 KDA 架構一覽

Kimi K3 採用稀疏 MoE 架構 Stable LatentMoE:896 個專家中每 token 啟用 16 個(稀疏度約 1.8%)。注意力機制為 Kimi Delta Attention(KDA,混合線性注意力)+ Attention Residuals(AttnRes)+ Gated MLA。權重格式為 MXFP4 權重 + MXFP8 啟用(原生低精度訓練,4-bit 量化接近訓練精度)。官方稱擴展效率比 K2 提升約 2.5 倍;KDA 在百萬 token 上下文中最高可達 6.3 倍解碼加速

項目資料
總參數量2.8 兆(2.8T),史上最大開源權重模型
架構稀疏 MoE:Stable LatentMoE,896 專家 / 每 token 啟用 16 個
注意力KDA + AttnRes + Gated MLA
上下文視窗1,048,576 tokens(約 100 萬)
模態原生視覺理解(文字 + 影像,產品端還支援影片),輸出為文字
權重格式MXFP4 權重 + MXFP8 啟用
訓練穩定性Quantile Balancing(專家路由)、Per-Head Muon 優化器、SiTU 啟用函數
授權條款(7/27)Modified MIT(具體條款以發布日 LICENSE 原文為準)

open weights(開源權重)≠ fully open source(含訓練程式碼與資料)。7/27 發布的是前者——這對企業微調與私有部署已足夠,但 Reddit / HN 讀者會嚴格區分二者。

中國廠商梯隊亦在集體逼近:DeepSeek V4 Pro(1.6T)、Z.ai GLM-5.2(程式設計對標 Opus 4.8、價格約 1/5)、MiniMax 等——K3 是這波浪潮的參數規模最高點。

03

Kimi K3 跑分對比:Claude Fable 5 與 GPT-5.6 Sol 誰更強?

以下資料交叉引用 Artificial Analysis(7 月 16 日)與官方發布材料。不同 harness 跑分存在偏差,引用時須標註評測日期與來源——這是 E-E-A-T 信號,也是 r/LocalLLaMA 社群審視的重點。

模型AA Intelligence Index排名
Claude Fable 559.9第 1
GPT-5.6 Sol58.9第 2
Kimi K357.1第 3 / 189

K3 領先或打平的項目:

Frontend Code Arena:第 1——盲測中開發者偏好其 UI 程式碼超過 Fable 和 Sol

Automation Bench、SpreadsheetBench 2:第 1

BrowseComp:91.2(第 1)——配合 1M 上下文無壓縮策略可達 90.4+

SWE Marathon(超長程式設計會話):42.0——明顯領先(GPT-5.5 / GLM-5.2 在此崩到十幾分)

Terminal Bench 2.1:88.3——與 GPT-5.6 Sol 的 88.8 基本打平

Program Bench:77.8——微超 Sol 的 77.6

FrontierSWE:81.2——大幅超 Sol 的 71.3(但落後 Fable 5 的 86.6)

K3 仍落後的項目:

GDPval v2 Elo:1668–1687 vs Fable 5 的 1760、Sol 的 1748——長程判斷力仍是 Fable 的天下

DeepSWE:67.5 vs Sol 的 73.0

幻覺率較 K2.6 有所上升(官方承認);Reddit 有使用者回饋接入自建應用後「幻覺明顯多於頂級閉源模型」

對話打磨度、穩定性(單次會話方差)仍遜於 Fable 5 / Sol

維度Kimi K3Claude Fable 5GPT-5.6 Sol
綜合智能 Index57.1(#3)59.9(#1)58.9(#2)
單任務成本(AA 實測)$0.94~$2.75~$1.04
vs Fable 5 成本差K3 低 65.8%;比 Sol 低 9.4%
開源權重7/27 發布閉源閉源
上下文1M tokens200K 級128K–1M 視版本
04

Kimi K3 API 價格與 7 月 27 日權重發布落地清單

K3 定價刻意對齊西方標準(走「品質牌」而非「低價牌」),是目前中國大模型廠商 API 中最高的,但仍顯著低於 Claude Opus 4.8 的單任務成本。程式設計類工作負載快取命中率據稱超 90%,實際成本遠低於表面單價。

項目價格(每百萬 tokens)
輸入(快取未命中)$3.00
輸入(快取命中,自動快取)$0.30
輸出$15.00

7 月 27 日開源發布具體會發生什麼:

01

完整 2.8T 權重上架 Moonshot 的 Hugging Face 組織,Modified MIT 授權條款(具體條款待發布日確認)

02

同步發布技術報告——架構、訓練、評估細節全文公開

03

vLLM 生態對齊——KDA / prefix caching 支援隨權重落地;官方正與推理夥伴和開源維護者對齊

04

預期後續——Ollama、GGUF 量化版本會像 K2 系列一樣陸續跟進

05

發布日核對 LICENSE 原文——Modified MIT 的商用範圍、再分發限制須逐條確認

06

獨立長上下文複測——社群首批獨立 benchmark 與官方資料交叉驗證,更新本文 benchmarks 段落(持續更新 = 持續排名信號)

信源清單:官方 kimi.com/en/blog/kimi-k3、platform.kimi.ai;獨立評測 Artificial Analysis(7/16);深度報導 VentureBeat、Northflank;社群 r/LocalLLaMA、Hacker News。

05

Kimi K3 本地部署記憶體需求與業界意義:1.4TB 權重真相

不是消費級硬體能跑的。4-bit 權重約 1.4 TB,官方建議 64+ 加速器的「超節點」部署,需要專家並行 + 張量並行的分散式推理。參照:上一代 1T 參數的 K2.7 Code,INT4 也要約 577 GB 記憶體;K3 是它的 2.8 倍。

對絕大多數人正確答案是 API($3/$15)。自部署只在三種場景成立:嚴格資料駐留 / 離線要求、需要在自有資料上微調、呼叫量大到自建硬體反而便宜。

A

2.8T 總參數,896 專家啟用 16 個,1M token 上下文——規格速查第一行

B

4-bit 權重約 1.4 TB;官方建議 64+ 加速器——任何「筆電跑 K3」標題都是標題黨

C

Frontend Code Arena 第 1;SWE Marathon 42.0——長會話程式設計顯著領先閉源競品

業界意義(四條評論角度):

1

開源與閉源的能力差距在前沿基本閉合——差距從「數百分」縮到「兩三分」,閉源廠商很難再純靠能力證明溢價

2

地緣與監管敘事——「監管可以關掉閉源模型,但關不掉已發布的開源權重」

3

中國廠商梯隊集體逼近——GLM-5.2、DeepSeek V4 Pro、MiniMax 與 K3 形成組合拳

4

月之暗面戰略翻身——從 DeepSeek R1 衝擊後的國內第七,到 K2→K2.5→K3 連續開源路線重建地位

注意:7/27 當天須在 2 小時內更新本文:把「scheduled for release」改為「now available」,加入 Hugging Face 直連與 LICENSE 原文——這是搶「K3 權重下載」搜尋流量的關鍵窗口。

若你的團隊需要在 Mac 上跑 Agent 編排、iOS CI/CD 與本地工具鏈除錯,而非維護 64 卡超節點,自建 K3 推理叢集的隱性成本(維運、電力、網路、版本釘選)往往被低估。對於更穩定、更適合 iOS CI/CD 與 AI Agent 自動化的生產環境,MESHLAUNCH 的 Mac Mini 雲端租用通常是更優解:獨占 Apple Silicon、7×24 線上、按天/週/月彈性下單,把大模型推理留給 API、把編譯與 Agent 宿主交給雲 Mac。

常見問題

完整 2.8T 權重計畫於 2026 年 7 月 27 日上架 Moonshot AI 的 Hugging Face 組織。API 已於 7 月 16 日上線,兩者是不同里程碑——前者供下載與微調,後者供即時呼叫。

7/27 發布的是 open weights(開源權重),不含訓練程式碼與資料,因此不是 fully open source。Modified MIT 授權條款的具體範圍以發布日 LICENSE 為準。詳見 Kimi K3 深度評測中的架構章節。

API 不免費:輸入 $3/M、快取命中 $0.30/M、輸出 $15/M tokens。AA 實測單任務約 $0.94,比 Fable 5 低 65.8%。kimi.com 註冊帳號可免費體驗產品端。企業批量呼叫方案見 租賃價格頁旁的 Agent 開發環境選型。

不能。4-bit 權重約 1.4 TB,需 64+ 加速器超節點。消費級單卡或小型工作站無法承載完整推理。若需私有部署,須評估資料中心級 GPU 叢集成本,或等待社群 GGUF 蒸餾小版本(性能會顯著縮水)。

K3 參數量近兩倍(2.8T vs 1.6T)、上下文大 8 倍(1M vs 128K),綜合 Index 與程式設計長會話更強;DeepSeek V4 Pro 輸出價更低(約 $0.87/M),成本敏感場景更優。建議先查看 幫助中心了解雲 Mac 與 API 組合部署方案。