Kimi K3 全面开源:为什么这次发布值得关注
Kimi K3 是一个拥有 2.8 万亿总参数的混合专家(MoE)模型,激活参数约 1040 亿,支持 100 万 token 上下文窗口,具备原生视觉理解能力。权重文件在 Hugging Face 上体积约 1.56TB,上线半小时内即登顶趋势榜第一。这次开源距离 K3 在 kimi.com 和 API 端首发,只过去了 11 天。
7 月 16 日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 以及 Kimi API 首发,但仅限在线调用,模型权重尚未公开。官方技术博客标题为《Kimi K3: Open Frontier Intelligence》。
7 月 17 日:行业开始密集分析其架构,新华社报道称其为"目前全球参数最大的开源模型"。
7 月 22 日–23 日:中美"模型蒸馏"争端升级。美国白宫科技顾问 Michael Kratsios 指控月之暗面对 Anthropic 的 Fable 模型进行"大规模、隐蔽的工业化蒸馏";美国财政部长 Scott Bessent 随后表示将考虑对相关中国企业实施制裁及"实体清单"限制。
7 月 27 日晚 23 点:月之暗面正式发布 K3 完整模型权重、技术报告,并开源 MoonEP、AgentEnv(FlashKDA 此前已开源)。
7 月 28 日:中国商务部就中美 AI 争端公开回应,指责美方搞"AI 霸权主义"并威胁采取反制措施;国内多家媒体跟进报道本次开源细节。
三天后,阿里巴巴(月之暗面的投资方之一)发布了 24 万亿参数的 Qwen3.8-Max-Preview,被外界普遍解读为对 K3 的直接回应,国产大模型的竞争正式进入"3T 俱乐部"阶段。
Kimi K3 核心参数与跑分:和 GPT-5.6、Claude 比一比
不同机构、不同评测框架给出的数字差异较大,以下优先引用独立第三方复测数据,厂商自报数据会单独标注。
| 项目 | Kimi K3 | 备注 |
|---|---|---|
| 总参数量 | 2.8 万亿(2.8T) | 全球首个完整开放的 3T 级模型 |
| 激活参数量 | 约 1040 亿 | MoE 稀疏激活 |
| 专家配置 | 896 路由专家,每 token 激活 16 个 | 稀疏度约 1.8% |
| 上下文窗口 | 100 万 token | KDA + Gated MLA 混合注意力 |
| 权重体积 | 约 1.56TB | MXFP4 权重 + MXFP8 激活 |
| License | 自定义许可证 | 官方称"open weight"而非"open source" |
SWE-bench Verified(独立复测,Vals AI,截至 2026 年 7 月)
| 模型 | 分数 | 发布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Kimi K3 是开源阵营里能力天花板最高的选项,而不是性价比最高的选项——Artificial Analysis 智能指数全球第 3、开源模型第 1,但每任务成本约 $0.95,高于 GLM-5.2 的约 $0.47/任务。
KDA、AttnRes、Per-Head Muon 与三大开源 Infra 技术
Kimi K3 在架构上重构了深度学习沿用多年的三大传统组件——注意力机制、残差连接、优化器,这也是它区别于"简单堆参数"的关键。
Kimi Delta Attention(KDA)把传统 Gated DeltaNet 的标量级遗忘门改成逐通道级别:每一个特征维度都拥有自己独立的衰减率,采用 chunkwise 的 DPLR 公式实现线性时间递归。K3 将 KDA 与少量全局注意力层(Gated MLA)交替混合使用,支撑 100 万 token 上下文的同时把 KV Cache 开销压到极低。
Attention Residuals(AttnRes)把残差连接从"雨露均沾"改成选择性、依据输入动态聚合前面所有层的输出——每层只需新增一个 RMSNorm 和一个伪查询向量,带来约 25% 的训练效率提升,代价不到 2%。
Per-Head Muon让每个注意力头独立学习,拥有更自适应的收敛路径。配合 Stable LatentMoE(896 选 16 的稀疏路由 + Quantile Balancing 均衡策略),从数学上证明了每个计算节点冗余专家数的理论上界。
| 技术 | 定位 | 关键能力 |
|---|---|---|
| MoonEP | 超大规模细粒度 MoE 通信库 | 临时复制过载专家,保证每个计算节点获得均等 token 数;证明冗余专家数理论上界 |
| FlashKDA | 基于 CUTLASS 的 KDA 高性能算子 | H20 上 prefill 速度提升 1.72–2.22 倍;可作为 chunk_kda 直接替代后端 |
| AgentEnv | Firecracker microVM 智能体沙箱 | checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5 倍(官方数据,尚未第三方复现) |
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
提示:月之暗面这次没有只发一份权重文件,而是把支撑 K3 训练效率与稳定性的三项关键基础设施技术也一并开源,这也是本次发布在开发者社区获得较高评价的重要原因。
Kimi K3 接入与部署:六步 Runbook
确认接入路径:评估团队是需要 API 调用、OpenRouter 第三方托管,还是 64 卡以上超节点自部署。对个人开发者和大部分中小团队,API 或 OpenRouter 是现实路径。
注册 Moonshot API:在 https://api.moonshot.ai/v1 获取 API Key,模型 ID 为 kimi-k3,兼容 OpenAI SDK,大部分现有项目只需改 base URL 和密钥。
配置缓存策略:Mooncake 分离式推理架构在典型编程类工作负载上缓存命中率可达 90% 以上,实际成本更接近输入 $0.30/M(缓存命中)而非 $3.00/M(缓存未命中)。
自部署评估(可选):若需本地权重,从 Hugging Face moonshotai/Kimi-K3 下载约 1.56TB 权重,准备 64 卡及以上超节点,配置专家并行与张量并行。
审阅许可证:确认你的业务是否触发 Model-as-a-Service 年收入 2000 万美元门槛,或月活 1 亿/月收入 2000 万美元的展示门槛。
集成 Infra 工具链:若使用 KDA 算子,将 flash-linear-attention 库的 chunk_kda 后端切换为 FlashKDA;大规模 Agent RL 训练可评估 AgentEnv 沙箱集成。
许可证两道商业门槛与 API 定价硬数据
开放权重 vs 开源:月之暗面官方材料从未使用"open source",一直采用"open weight"表述。按 OSI 标准,K3 只公开了权重文件、技术报告和推理相关 Infra 工具,训练数据和完整训练代码并未公开。
Model-as-a-Service 收入门槛:若运营 MaaS 业务且连续 12 个月累计收入超过 2000 万美元,必须与月之暗面另行签署商业协议。
API 定价(每百万 token):输入缓存命中 $0.30、缓存未命中 $3.00、输出(含推理过程)$15.00。Artificial Analysis 实测单任务成本约 $0.95,比 Claude Fable 5(约 $2.4/任务)便宜约 60%。
注意:2.8 万亿参数、896 个专家的规模决定了 K3 几乎不可能在消费级硬件上运行。OpenRouter 等第三方平台目前已有 7 家服务商上线 K3,定价大多与官方一致。
若你的团队需要在本地 Mac 上运行 Agent 编排、CI/CD 流水线或长期驻留的 Gateway 进程,消费级 GPU 自部署 K3 并不现实;而本地 Mac 的休眠、更新弹窗与内存瓶颈同样会打断长程 Agent 任务。对于需要 7×24 稳定运行 iOS CI/CD 与 AI Agent 自动化的生产环境,MESHLAUNCH 的 Mac Mini 云端租赁通常是更优解:独占 Apple Silicon、按天/周/月弹性下单,把推理交给 API、把编排与构建留在稳定的云端 Mac 节点上。
严格来说不是。它属于"开放权重(open weight)"模型:训练完成的权重文件、技术报告和部分 Infra 工具是公开的,但训练数据和完整训练代码没有公开,不符合 OSI 标准下的"开源"定义。
可以,绝大多数商业场景不受限制。但如果你运营的是"模型即服务"业务且年收入超过 2000 万美元,或产品月活超过 1 亿/月收入超过 2000 万美元,需要额外满足许可证中的特定条款。详情可见 价格页了解云端开发环境方案。
官方建议部署在 64 卡及以上的超节点集群。个人和大部分企业用户更现实的方式是通过官方 API 或 OpenRouter 等第三方平台调用。建议先查看 帮助中心了解云端 Mac 开发环境配置。
在开源模型阵营中综合能力最强,Artificial Analysis 智能指数全球第 3,仅次于 Claude Fable 5 和 GPT-5.6 Sol;但成本高于同为开源的 GLM-5.2。K3 目前在 Arena.ai 的 Frontend Code Arena 榜单上排名第一。
K3 参数规模是 K2.5 的约 3 倍,架构上新增了 Attention Residuals 和 Per-Head Muon,上下文窗口和多模态能力也大幅提升;许可证方面 K3 新增了 Model-as-a-Service 收入门槛,商业限制比 K2 系列更细化。