Kimi K3 全面开源
2.8万亿参数、百万上下文

11 天从 API 到完整权重 · KDA/AttnRes/MoE 架构 · 许可证与跑分全解析

Kimi K3 全面开源:2.8万亿参数、百万上下文
7 月 27 日晚 23 点左右,月之暗面(Moonshot AI)正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEP、FlashKDA、AgentEnv 三项核心基础设施——这是全球首个被完整开放的 3 万亿参数级别模型。本文面向正在评估 K3 接入与商用合规的技术团队,给出 11 天时间线、架构创新解读、第三方跑分对比、许可证两道商业门槛,以及 API 与自部署的六步 Runbook。
01

Kimi K3 全面开源:为什么这次发布值得关注

Kimi K3 是一个拥有 2.8 万亿总参数的混合专家(MoE)模型,激活参数约 1040 亿,支持 100 万 token 上下文窗口,具备原生视觉理解能力。权重文件在 Hugging Face 上体积约 1.56TB,上线半小时内即登顶趋势榜第一。这次开源距离 K3 在 kimi.com 和 API 端首发,只过去了 11 天。

01

7 月 16 日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 以及 Kimi API 首发,但仅限在线调用,模型权重尚未公开。官方技术博客标题为《Kimi K3: Open Frontier Intelligence》。

02

7 月 17 日:行业开始密集分析其架构,新华社报道称其为"目前全球参数最大的开源模型"。

03

7 月 22 日–23 日:中美"模型蒸馏"争端升级。美国白宫科技顾问 Michael Kratsios 指控月之暗面对 Anthropic 的 Fable 模型进行"大规模、隐蔽的工业化蒸馏";美国财政部长 Scott Bessent 随后表示将考虑对相关中国企业实施制裁及"实体清单"限制。

04

7 月 27 日晚 23 点:月之暗面正式发布 K3 完整模型权重、技术报告,并开源 MoonEP、AgentEnv(FlashKDA 此前已开源)。

05

7 月 28 日:中国商务部就中美 AI 争端公开回应,指责美方搞"AI 霸权主义"并威胁采取反制措施;国内多家媒体跟进报道本次开源细节。

三天后,阿里巴巴(月之暗面的投资方之一)发布了 24 万亿参数的 Qwen3.8-Max-Preview,被外界普遍解读为对 K3 的直接回应,国产大模型的竞争正式进入"3T 俱乐部"阶段。

02

Kimi K3 核心参数与跑分:和 GPT-5.6、Claude 比一比

不同机构、不同评测框架给出的数字差异较大,以下优先引用独立第三方复测数据,厂商自报数据会单独标注。

项目Kimi K3备注
总参数量2.8 万亿(2.8T)全球首个完整开放的 3T 级模型
激活参数量约 1040 亿MoE 稀疏激活
专家配置896 路由专家,每 token 激活 16 个稀疏度约 1.8%
上下文窗口100 万 tokenKDA + Gated MLA 混合注意力
权重体积约 1.56TBMXFP4 权重 + MXFP8 激活
License自定义许可证官方称"open weight"而非"open source"

SWE-bench Verified(独立复测,Vals AI,截至 2026 年 7 月)

模型分数发布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Kimi K3 是开源阵营里能力天花板最高的选项,而不是性价比最高的选项——Artificial Analysis 智能指数全球第 3、开源模型第 1,但每任务成本约 $0.95,高于 GLM-5.2 的约 $0.47/任务。

03

KDA、AttnRes、Per-Head Muon 与三大开源 Infra 技术

Kimi K3 在架构上重构了深度学习沿用多年的三大传统组件——注意力机制、残差连接、优化器,这也是它区别于"简单堆参数"的关键。

Kimi Delta Attention(KDA)把传统 Gated DeltaNet 的标量级遗忘门改成逐通道级别:每一个特征维度都拥有自己独立的衰减率,采用 chunkwise 的 DPLR 公式实现线性时间递归。K3 将 KDA 与少量全局注意力层(Gated MLA)交替混合使用,支撑 100 万 token 上下文的同时把 KV Cache 开销压到极低。

Attention Residuals(AttnRes)把残差连接从"雨露均沾"改成选择性、依据输入动态聚合前面所有层的输出——每层只需新增一个 RMSNorm 和一个伪查询向量,带来约 25% 的训练效率提升,代价不到 2%。

Per-Head Muon让每个注意力头独立学习,拥有更自适应的收敛路径。配合 Stable LatentMoE(896 选 16 的稀疏路由 + Quantile Balancing 均衡策略),从数学上证明了每个计算节点冗余专家数的理论上界。

技术定位关键能力
MoonEP超大规模细粒度 MoE 通信库临时复制过载专家,保证每个计算节点获得均等 token 数;证明冗余专家数理论上界
FlashKDA基于 CUTLASS 的 KDA 高性能算子H20 上 prefill 速度提升 1.72–2.22 倍;可作为 chunk_kda 直接替代后端
AgentEnvFirecracker microVM 智能体沙箱checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5 倍(官方数据,尚未第三方复现)
Python · OpenAI SDK 兼容
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)

提示:月之暗面这次没有只发一份权重文件,而是把支撑 K3 训练效率与稳定性的三项关键基础设施技术也一并开源,这也是本次发布在开发者社区获得较高评价的重要原因。

04

Kimi K3 接入与部署:六步 Runbook

01

确认接入路径:评估团队是需要 API 调用、OpenRouter 第三方托管,还是 64 卡以上超节点自部署。对个人开发者和大部分中小团队,API 或 OpenRouter 是现实路径。

02

注册 Moonshot API:https://api.moonshot.ai/v1 获取 API Key,模型 ID 为 kimi-k3,兼容 OpenAI SDK,大部分现有项目只需改 base URL 和密钥。

03

配置缓存策略:Mooncake 分离式推理架构在典型编程类工作负载上缓存命中率可达 90% 以上,实际成本更接近输入 $0.30/M(缓存命中)而非 $3.00/M(缓存未命中)。

04

自部署评估(可选):若需本地权重,从 Hugging Face moonshotai/Kimi-K3 下载约 1.56TB 权重,准备 64 卡及以上超节点,配置专家并行与张量并行。

05

审阅许可证:确认你的业务是否触发 Model-as-a-Service 年收入 2000 万美元门槛,或月活 1 亿/月收入 2000 万美元的展示门槛。

06

集成 Infra 工具链:若使用 KDA 算子,将 flash-linear-attention 库的 chunk_kda 后端切换为 FlashKDA;大规模 Agent RL 训练可评估 AgentEnv 沙箱集成。

05

许可证两道商业门槛与 API 定价硬数据

A

开放权重 vs 开源:月之暗面官方材料从未使用"open source",一直采用"open weight"表述。按 OSI 标准,K3 只公开了权重文件、技术报告和推理相关 Infra 工具,训练数据和完整训练代码并未公开。

B

Model-as-a-Service 收入门槛:若运营 MaaS 业务且连续 12 个月累计收入超过 2000 万美元,必须与月之暗面另行签署商业协议。

C

API 定价(每百万 token):输入缓存命中 $0.30、缓存未命中 $3.00、输出(含推理过程)$15.00。Artificial Analysis 实测单任务成本约 $0.95,比 Claude Fable 5(约 $2.4/任务)便宜约 60%。

注意:2.8 万亿参数、896 个专家的规模决定了 K3 几乎不可能在消费级硬件上运行。OpenRouter 等第三方平台目前已有 7 家服务商上线 K3,定价大多与官方一致。

若你的团队需要在本地 Mac 上运行 Agent 编排、CI/CD 流水线或长期驻留的 Gateway 进程,消费级 GPU 自部署 K3 并不现实;而本地 Mac 的休眠、更新弹窗与内存瓶颈同样会打断长程 Agent 任务。对于需要 7×24 稳定运行 iOS CI/CD 与 AI Agent 自动化的生产环境,MESHLAUNCH 的 Mac Mini 云端租赁通常是更优解:独占 Apple Silicon、按天/周/月弹性下单,把推理交给 API、把编排与构建留在稳定的云端 Mac 节点上。

常见问题

严格来说不是。它属于"开放权重(open weight)"模型:训练完成的权重文件、技术报告和部分 Infra 工具是公开的,但训练数据和完整训练代码没有公开,不符合 OSI 标准下的"开源"定义。

可以,绝大多数商业场景不受限制。但如果你运营的是"模型即服务"业务且年收入超过 2000 万美元,或产品月活超过 1 亿/月收入超过 2000 万美元,需要额外满足许可证中的特定条款。详情可见 价格页了解云端开发环境方案。

官方建议部署在 64 卡及以上的超节点集群。个人和大部分企业用户更现实的方式是通过官方 API 或 OpenRouter 等第三方平台调用。建议先查看 帮助中心了解云端 Mac 开发环境配置。

在开源模型阵营中综合能力最强,Artificial Analysis 智能指数全球第 3,仅次于 Claude Fable 5 和 GPT-5.6 Sol;但成本高于同为开源的 GLM-5.2。K3 目前在 Arena.ai 的 Frontend Code Arena 榜单上排名第一。

K3 参数规模是 K2.5 的约 3 倍,架构上新增了 Attention Residuals 和 Per-Head Muon,上下文窗口和多模态能力也大幅提升;许可证方面 K3 新增了 Model-as-a-Service 收入门槛,商业限制比 K2 系列更细化。