Kimi K3 开源权重 7 月 27 日发布:事件核心与时间线
7 月 16 日,月之暗面通过 Kimi App、Kimi Work、Kimi Code 及 API 上线 Kimi K3;Artificial Analysis 同日发布独立评测。7 月 27 日,计划公开完整模型权重(Modified MIT 许可证)并发布技术报告(架构、训练、评估细节)。这是全球首个 3 万亿参数级(实际 2.8T)开源权重模型,被普遍视为对闭源模型溢价定价的直接冲击。
关键结论:K3 不是「Fable 5 杀手」——AA Intelligence Index 57.1,排名第 3(共 189 个模型),落后 Claude Fable 5 的 59.9 和 GPT-5.6 Sol 的 58.9。但以约 1/3 的成本达到「接近前沿」的能力,且拥有闭源模型给不了的两样东西:开源权重 + 100 万 token 上下文(1,048,576 tokens)。
| 日期 | 事件 |
|---|---|
| 2026-07-16 | Kimi K3 通过 API / Kimi 全家桶上线;Artificial Analysis 发布独立评测 |
| 2026-07-17 | 上海世界人工智能大会(WAIC)开幕;新华社将 K3 发布定调为「国家级里程碑」 |
| 2026-07-27 | 完整权重公开下载(Hugging Face,Modified MIT 许可)+ 技术报告发布 |
API 已可用:模型 ID kimi-k3 已在 platform.kimi.ai 开放,不必等到 7/27 即可调用。
权重 ≠ 即刻可跑:7/27 放出的是权重文件,vLLM 对 KDA / prefix caching 的支持将随权重一起落地,Ollama / GGUF 量化版本预计像 K2 系列一样陆续跟进。
官方诚实态度:月之暗面罕见地主动承认综合性能仍落后 Fable 5 和 GPT-5.6 Sol,并列出已知短板(对 harness 传回推理内容敏感、意图模糊时过于主动等)。
地缘背景:发布赶在 WAIC 前;一个月前美国政府曾短暂下架 Anthropic 的 Fable/Mythos 模型(7 月 1 日恢复)——「监管可以关掉闭源模型,但关不掉已发布的开源权重」成为开源叙事的新论据。
月之暗面翻身:2025 年初被 DeepSeek R1 冲击后排名跌至国内第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 的开源路线重建地位。
Kimi K3 是什么?2.8T 参数规格与 KDA 架构一览
Kimi K3 采用稀疏 MoE 架构 Stable LatentMoE:896 个专家中每 token 激活 16 个(稀疏度约 1.8%)。注意力机制为 Kimi Delta Attention(KDA,混合线性注意力)+ Attention Residuals(AttnRes)+ Gated MLA。权重格式为 MXFP4 权重 + MXFP8 激活(原生低精度训练,4-bit 量化接近训练精度)。官方称扩展效率比 K2 提升约 2.5 倍;KDA 在百万 token 上下文中最高可达 6.3 倍解码加速。
| 项目 | 数据 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T),史上最大开源权重模型 |
| 架构 | 稀疏 MoE:Stable LatentMoE,896 专家 / 每 token 激活 16 个 |
| 注意力 | KDA + AttnRes + Gated MLA |
| 上下文窗口 | 1,048,576 tokens(约 100 万) |
| 模态 | 原生视觉理解(文本 + 图像,产品端还支持视频),输出为文本 |
| 权重格式 | MXFP4 权重 + MXFP8 激活 |
| 训练稳定性 | Quantile Balancing(专家路由)、Per-Head Muon 优化器、SiTU 激活函数 |
| 许可(7/27) | Modified MIT(具体条款以发布日 LICENSE 原文为准) |
open weights(开源权重)≠ fully open source(含训练代码与数据)。7/27 发布的是前者——这对企业微调与私有部署已足够,但 Reddit / HN 读者会严格区分二者。
中国厂商梯队亦在集体逼近:DeepSeek V4 Pro(1.6T)、Z.ai GLM-5.2(编码对标 Opus 4.8、价格约 1/5)、MiniMax 等——K3 是这波浪潮的参数规模最高点。
Kimi K3 跑分对比:Claude Fable 5 与 GPT-5.6 Sol 谁更强?
以下数据交叉引用 Artificial Analysis(7 月 16 日)与官方发布材料。不同 harness 跑分存在偏差,引用时须标注评测日期与来源——这是 E-E-A-T 信号,也是 r/LocalLLaMA 社区审视的重点。
| 模型 | AA Intelligence Index | 排名 |
|---|---|---|
| Claude Fable 5 | 59.9 | 第 1 |
| GPT-5.6 Sol | 58.9 | 第 2 |
| Kimi K3 | 57.1 | 第 3 / 189 |
K3 领先或打平的项目:
Frontend Code Arena:第 1——盲测中开发者偏好其 UI 代码超过 Fable 和 Sol
Automation Bench、SpreadsheetBench 2:第 1
BrowseComp:91.2(第 1)——配合 1M 上下文无压缩策略可达 90.4+
SWE Marathon(超长编码会话):42.0——明显领先(GPT-5.5 / GLM-5.2 在此崩到十几分)
Terminal Bench 2.1:88.3——与 GPT-5.6 Sol 的 88.8 基本打平
Program Bench:77.8——微超 Sol 的 77.6
FrontierSWE:81.2——大幅超 Sol 的 71.3(但落后 Fable 5 的 86.6)
K3 仍落后的项目:
GDPval v2 Elo:1668–1687 vs Fable 5 的 1760、Sol 的 1748——长程判断力仍是 Fable 的天下
DeepSWE:67.5 vs Sol 的 73.0
幻觉率较 K2.6 有所上升(官方承认);Reddit 有用户反馈接入自建应用后「幻觉明显多于顶级闭源模型」
对话打磨度、稳定性(单次会话方差)仍逊于 Fable 5 / Sol
| 维度 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| 综合智能 Index | 57.1(#3) | 59.9(#1) | 58.9(#2) |
| 单任务成本(AA 实测) | $0.94 | ~$2.75 | ~$1.04 |
| vs Fable 5 成本差 | K3 低 65.8%;比 Sol 低 9.4% | ||
| 开源权重 | 7/27 发布 | 闭源 | 闭源 |
| 上下文 | 1M tokens | 200K 级 | 128K–1M 视版本 |
Kimi K3 API 价格与 7 月 27 日权重发布落地清单
K3 定价刻意对齐西方标准(走「质量牌」而非「低价牌」),是目前中国大模型厂商 API 中最高的,但仍显著低于 Claude Opus 4.8 的单任务成本。编码类工作负载缓存命中率据称超 90%,实际成本远低于表面单价。
| 项目 | 价格(每百万 tokens) |
|---|---|
| 输入(缓存未命中) | $3.00 |
| 输入(缓存命中,自动缓存) | $0.30 |
| 输出 | $15.00 |
7 月 27 日开源发布具体会发生什么:
完整 2.8T 权重上架 Moonshot 的 Hugging Face 组织,Modified MIT 许可证(具体条款待发布日确认)
同步发布技术报告——架构、训练、评估细节全文公开
vLLM 生态对齐——KDA / prefix caching 支持随权重落地;官方正与推理伙伴和开源维护者对齐
预期后续——Ollama、GGUF 量化版本会像 K2 系列一样陆续跟进
发布日核对 LICENSE 原文——Modified MIT 的商用范围、再分发限制须逐条确认
独立长上下文复测——社区首批独立 benchmark 与官方数据交叉验证,更新本文 benchmarks 段落(持续更新 = 持续排名信号)
信源清单:官方 kimi.com/en/blog/kimi-k3、platform.kimi.ai;独立评测 Artificial Analysis(7/16);深度报道 VentureBeat、Northflank;社区 r/LocalLLaMA、Hacker News。
Kimi K3 本地部署显存要求与行业意义:1.4TB 权重真相
不是消费级硬件能跑的。4-bit 权重约 1.4 TB,官方建议 64+ 加速器的「超节点」部署,需要专家并行 + 张量并行的分布式推理。参照:上一代 1T 参数的 K2.7 Code,INT4 也要约 577 GB 显存;K3 是它的 2.8 倍。
对绝大多数人正确答案是 API($3/$15)。自部署只在三种场景成立:严格数据驻留 / 离线要求、需要在自有数据上微调、调用量大到自建硬件反而便宜。
2.8T 总参数,896 专家激活 16 个,1M token 上下文——规格速查第一行
4-bit 权重约 1.4 TB;官方建议 64+ 加速器——任何「笔记本跑 K3」标题都是标题党
Frontend Code Arena 第 1;SWE Marathon 42.0——长会话编码显著领先闭源竞品
行业意义(四条评论角度):
开源与闭源的能力差距在前沿基本闭合——差距从「数百分」缩到「两三分」,闭源厂商很难再纯靠能力证明溢价
地缘与监管叙事——「监管可以关掉闭源模型,但关不掉已发布的开源权重」
中国厂商梯队集体逼近——GLM-5.2、DeepSeek V4 Pro、MiniMax 与 K3 形成组合拳
月之暗面战略翻身——从 DeepSeek R1 冲击后的国内第七,到 K2→K2.5→K3 连续开源路线重建地位
注意:7/27 当天须在 2 小时内更新本文:把「scheduled for release」改为「now available」,加入 Hugging Face 直链与 LICENSE 原文——这是抢「K3 权重下载」搜索流量的关键窗口。
若你的团队需要在 Mac 上跑 Agent 编排、iOS CI/CD 与本地工具链调试,而非维护 64 卡超节点,自建 K3 推理集群的隐性成本(运维、电力、网络、版本钉扎)往往被低估。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,MESHLAUNCH 的 Mac Mini 云端租赁通常是更优解:独占 Apple Silicon、7×24 在线、按天/周/月弹性下单,把大模型推理留给 API、把编译与 Agent 宿主交给云 Mac。
完整 2.8T 权重计划于 2026 年 7 月 27 日上架 Moonshot AI 的 Hugging Face 组织。API 已于 7 月 16 日上线,两者是不同里程碑——前者供下载与微调,后者供即时调用。
7/27 发布的是 open weights(开源权重),不含训练代码与数据,因此不是 fully open source。Modified MIT 许可的具体范围以发布日 LICENSE 为准。详见 Kimi K3 深度评测中的架构章节。
API 不免费:输入 $3/M、缓存命中 $0.30/M、输出 $15/M tokens。AA 实测单任务约 $0.94,比 Fable 5 低 65.8%。kimi.com 注册账号可免费体验产品端。企业批量调用方案见 租赁价格页旁的 Agent 开发环境选型。
不能。4-bit 权重约 1.4 TB,需 64+ 加速器超节点。消费级单卡或小型工作站无法承载完整推理。若需私有部署,须评估数据中心级 GPU 集群成本,或等待社区 GGUF 蒸馏小版本(性能会显著缩水)。
K3 参数量近两倍(2.8T vs 1.6T)、上下文大 8 倍(1M vs 128K),综合 Index 与编码长会话更强;DeepSeek V4 Pro 输出价更低(约 $0.87/M),成本敏感场景更优。建议先查看 帮助中心了解云 Mac 与 API 组合部署方案。