Kimi K3 开源权重 7 月 27 日发布
2.8 万亿参数 · 百万上下文 · 闭源溢价还守得住吗?

7/16 API 上线 · 7/27 Modified MIT 权重 · 跑分对比 · 真实 API 成本 · 1.4TB 部署真相 · 发布日清单

Kimi K3 开源权重 7 月 27 日发布 2.8 万亿参数
月之暗面(Moonshot AI)将于 2026 年 7 月 27 日在 Hugging Face 公开 Kimi K3 完整 2.8 万亿参数权重(Modified MIT 许可),同步发布技术报告。API 已于 7 月 16 日上线。若你正等待「史上最大开源权重模型」落地、对比 Kimi K3 深度评测与闭源旗舰的差距,或评估自部署 vs API 的真实成本,本文将回答:① 7/16 与 7/27 两个日期分别意味着什么;② AA Intelligence Index 57.1(第 3/189)与全项基准表;③ $3/$15 定价、缓存命中与单任务 $0.94 的真实账单;④ 1.4TB 4-bit 权重为何跑不进你的笔记本,以及发布日六步核对清单。
01

Kimi K3 开源权重 7 月 27 日发布:事件核心与时间线

7 月 16 日,月之暗面通过 Kimi App、Kimi Work、Kimi Code 及 API 上线 Kimi K3;Artificial Analysis 同日发布独立评测。7 月 27 日,计划公开完整模型权重(Modified MIT 许可证)并发布技术报告(架构、训练、评估细节)。这是全球首个 3 万亿参数级(实际 2.8T)开源权重模型,被普遍视为对闭源模型溢价定价的直接冲击。

关键结论:K3 不是「Fable 5 杀手」——AA Intelligence Index 57.1,排名第 3(共 189 个模型),落后 Claude Fable 5 的 59.9 和 GPT-5.6 Sol 的 58.9。但以约 1/3 的成本达到「接近前沿」的能力,且拥有闭源模型给不了的两样东西:开源权重 + 100 万 token 上下文(1,048,576 tokens)。

日期事件
2026-07-16Kimi K3 通过 API / Kimi 全家桶上线;Artificial Analysis 发布独立评测
2026-07-17上海世界人工智能大会(WAIC)开幕;新华社将 K3 发布定调为「国家级里程碑」
2026-07-27完整权重公开下载(Hugging Face,Modified MIT 许可)+ 技术报告发布
01

API 已可用:模型 ID kimi-k3 已在 platform.kimi.ai 开放,不必等到 7/27 即可调用。

02

权重 ≠ 即刻可跑:7/27 放出的是权重文件,vLLM 对 KDA / prefix caching 的支持将随权重一起落地,Ollama / GGUF 量化版本预计像 K2 系列一样陆续跟进。

03

官方诚实态度:月之暗面罕见地主动承认综合性能仍落后 Fable 5 和 GPT-5.6 Sol,并列出已知短板(对 harness 传回推理内容敏感、意图模糊时过于主动等)。

04

地缘背景:发布赶在 WAIC 前;一个月前美国政府曾短暂下架 Anthropic 的 Fable/Mythos 模型(7 月 1 日恢复)——「监管可以关掉闭源模型,但关不掉已发布的开源权重」成为开源叙事的新论据。

05

月之暗面翻身:2025 年初被 DeepSeek R1 冲击后排名跌至国内第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 的开源路线重建地位。

02

Kimi K3 是什么?2.8T 参数规格与 KDA 架构一览

Kimi K3 采用稀疏 MoE 架构 Stable LatentMoE:896 个专家中每 token 激活 16 个(稀疏度约 1.8%)。注意力机制为 Kimi Delta Attention(KDA,混合线性注意力)+ Attention Residuals(AttnRes)+ Gated MLA。权重格式为 MXFP4 权重 + MXFP8 激活(原生低精度训练,4-bit 量化接近训练精度)。官方称扩展效率比 K2 提升约 2.5 倍;KDA 在百万 token 上下文中最高可达 6.3 倍解码加速

项目数据
总参数量2.8 万亿(2.8T),史上最大开源权重模型
架构稀疏 MoE:Stable LatentMoE,896 专家 / 每 token 激活 16 个
注意力KDA + AttnRes + Gated MLA
上下文窗口1,048,576 tokens(约 100 万)
模态原生视觉理解(文本 + 图像,产品端还支持视频),输出为文本
权重格式MXFP4 权重 + MXFP8 激活
训练稳定性Quantile Balancing(专家路由)、Per-Head Muon 优化器、SiTU 激活函数
许可(7/27)Modified MIT(具体条款以发布日 LICENSE 原文为准)

open weights(开源权重)≠ fully open source(含训练代码与数据)。7/27 发布的是前者——这对企业微调与私有部署已足够,但 Reddit / HN 读者会严格区分二者。

中国厂商梯队亦在集体逼近:DeepSeek V4 Pro(1.6T)、Z.ai GLM-5.2(编码对标 Opus 4.8、价格约 1/5)、MiniMax 等——K3 是这波浪潮的参数规模最高点。

03

Kimi K3 跑分对比:Claude Fable 5 与 GPT-5.6 Sol 谁更强?

以下数据交叉引用 Artificial Analysis(7 月 16 日)与官方发布材料。不同 harness 跑分存在偏差,引用时须标注评测日期与来源——这是 E-E-A-T 信号,也是 r/LocalLLaMA 社区审视的重点。

模型AA Intelligence Index排名
Claude Fable 559.9第 1
GPT-5.6 Sol58.9第 2
Kimi K357.1第 3 / 189

K3 领先或打平的项目:

Frontend Code Arena:第 1——盲测中开发者偏好其 UI 代码超过 Fable 和 Sol

Automation Bench、SpreadsheetBench 2:第 1

BrowseComp:91.2(第 1)——配合 1M 上下文无压缩策略可达 90.4+

SWE Marathon(超长编码会话):42.0——明显领先(GPT-5.5 / GLM-5.2 在此崩到十几分)

Terminal Bench 2.1:88.3——与 GPT-5.6 Sol 的 88.8 基本打平

Program Bench:77.8——微超 Sol 的 77.6

FrontierSWE:81.2——大幅超 Sol 的 71.3(但落后 Fable 5 的 86.6)

K3 仍落后的项目:

GDPval v2 Elo:1668–1687 vs Fable 5 的 1760、Sol 的 1748——长程判断力仍是 Fable 的天下

DeepSWE:67.5 vs Sol 的 73.0

幻觉率较 K2.6 有所上升(官方承认);Reddit 有用户反馈接入自建应用后「幻觉明显多于顶级闭源模型」

对话打磨度、稳定性(单次会话方差)仍逊于 Fable 5 / Sol

维度Kimi K3Claude Fable 5GPT-5.6 Sol
综合智能 Index57.1(#3)59.9(#1)58.9(#2)
单任务成本(AA 实测)$0.94~$2.75~$1.04
vs Fable 5 成本差K3 低 65.8%;比 Sol 低 9.4%
开源权重7/27 发布闭源闭源
上下文1M tokens200K 级128K–1M 视版本
04

Kimi K3 API 价格与 7 月 27 日权重发布落地清单

K3 定价刻意对齐西方标准(走「质量牌」而非「低价牌」),是目前中国大模型厂商 API 中最高的,但仍显著低于 Claude Opus 4.8 的单任务成本。编码类工作负载缓存命中率据称超 90%,实际成本远低于表面单价。

项目价格(每百万 tokens)
输入(缓存未命中)$3.00
输入(缓存命中,自动缓存)$0.30
输出$15.00

7 月 27 日开源发布具体会发生什么:

01

完整 2.8T 权重上架 Moonshot 的 Hugging Face 组织,Modified MIT 许可证(具体条款待发布日确认)

02

同步发布技术报告——架构、训练、评估细节全文公开

03

vLLM 生态对齐——KDA / prefix caching 支持随权重落地;官方正与推理伙伴和开源维护者对齐

04

预期后续——Ollama、GGUF 量化版本会像 K2 系列一样陆续跟进

05

发布日核对 LICENSE 原文——Modified MIT 的商用范围、再分发限制须逐条确认

06

独立长上下文复测——社区首批独立 benchmark 与官方数据交叉验证,更新本文 benchmarks 段落(持续更新 = 持续排名信号)

信源清单:官方 kimi.com/en/blog/kimi-k3、platform.kimi.ai;独立评测 Artificial Analysis(7/16);深度报道 VentureBeat、Northflank;社区 r/LocalLLaMA、Hacker News。

05

Kimi K3 本地部署显存要求与行业意义:1.4TB 权重真相

不是消费级硬件能跑的。4-bit 权重约 1.4 TB,官方建议 64+ 加速器的「超节点」部署,需要专家并行 + 张量并行的分布式推理。参照:上一代 1T 参数的 K2.7 Code,INT4 也要约 577 GB 显存;K3 是它的 2.8 倍。

对绝大多数人正确答案是 API($3/$15)。自部署只在三种场景成立:严格数据驻留 / 离线要求、需要在自有数据上微调、调用量大到自建硬件反而便宜。

A

2.8T 总参数,896 专家激活 16 个,1M token 上下文——规格速查第一行

B

4-bit 权重约 1.4 TB;官方建议 64+ 加速器——任何「笔记本跑 K3」标题都是标题党

C

Frontend Code Arena 第 1;SWE Marathon 42.0——长会话编码显著领先闭源竞品

行业意义(四条评论角度):

1

开源与闭源的能力差距在前沿基本闭合——差距从「数百分」缩到「两三分」,闭源厂商很难再纯靠能力证明溢价

2

地缘与监管叙事——「监管可以关掉闭源模型,但关不掉已发布的开源权重」

3

中国厂商梯队集体逼近——GLM-5.2、DeepSeek V4 Pro、MiniMax 与 K3 形成组合拳

4

月之暗面战略翻身——从 DeepSeek R1 冲击后的国内第七,到 K2→K2.5→K3 连续开源路线重建地位

注意:7/27 当天须在 2 小时内更新本文:把「scheduled for release」改为「now available」,加入 Hugging Face 直链与 LICENSE 原文——这是抢「K3 权重下载」搜索流量的关键窗口。

若你的团队需要在 Mac 上跑 Agent 编排、iOS CI/CD 与本地工具链调试,而非维护 64 卡超节点,自建 K3 推理集群的隐性成本(运维、电力、网络、版本钉扎)往往被低估。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,MESHLAUNCH 的 Mac Mini 云端租赁通常是更优解:独占 Apple Silicon、7×24 在线、按天/周/月弹性下单,把大模型推理留给 API、把编译与 Agent 宿主交给云 Mac。

常见问题

完整 2.8T 权重计划于 2026 年 7 月 27 日上架 Moonshot AI 的 Hugging Face 组织。API 已于 7 月 16 日上线,两者是不同里程碑——前者供下载与微调,后者供即时调用。

7/27 发布的是 open weights(开源权重),不含训练代码与数据,因此不是 fully open source。Modified MIT 许可的具体范围以发布日 LICENSE 为准。详见 Kimi K3 深度评测中的架构章节。

API 不免费:输入 $3/M、缓存命中 $0.30/M、输出 $15/M tokens。AA 实测单任务约 $0.94,比 Fable 5 低 65.8%。kimi.com 注册账号可免费体验产品端。企业批量调用方案见 租赁价格页旁的 Agent 开发环境选型。

不能。4-bit 权重约 1.4 TB,需 64+ 加速器超节点。消费级单卡或小型工作站无法承载完整推理。若需私有部署,须评估数据中心级 GPU 集群成本,或等待社区 GGUF 蒸馏小版本(性能会显著缩水)。

K3 参数量近两倍(2.8T vs 1.6T)、上下文大 8 倍(1M vs 128K),综合 Index 与编码长会话更强;DeepSeek V4 Pro 输出价更低(约 $0.87/M),成本敏感场景更优。建议先查看 帮助中心了解云 Mac 与 API 组合部署方案。