Kimi K3 是什么?2.8 万亿参数开源大模型核心规格
2026 年 7 月 16 日,月之暗面发布 Kimi K3——2.8 万亿(2.8T)参数的稀疏混合专家(MoE)模型,超越此前纪录保持者 DeepSeek V4 Pro(1.6T)近 75%,是小米开源模型(1.02T)的 2.7 倍,是阿里(397B)的 7 倍有余。低调上线与巨大体量形成鲜明对比:一份技术博客、一个定价页面、一个可立刻调用的模型 ID kimi-k3。
K3 采用 896 个专家、每次推理激活 16 个(稀疏度 1.8%);配合 100 万 token 超长上下文(约等于一次性读完 5 本《红楼梦》全文)及原生视觉理解,专为复杂编程、长文档推理与知识工作设计。一句话总结:开源的、可原生理解图像与视频的、拥有超长记忆的重量级编程 AI,价格比 Claude Opus 4.8 便宜 40%,完整权重将于 7 月 27 日对外开源。
规模冲击:DeepSeek 崛起后月之暗面市场份额一度大幅缩水,K3 是战略反击——过去 12 个月 Kimi 系列有 9 个月占据开源模型规模上限。
发布时机:恰在 2026 世界人工智能大会(WAIC)开幕前夜,7 月 17–20 日预计更多发布。
商业化爆发:截至 2026 年 6 月 ARR 突破 3 亿美元,今年内完成第 6 轮融资,投前估值 315 亿美元;API 收入占七成以上,海外付费用户增长 400%。
长上下文痛点:传统全注意力在百万 token 下 KV 缓存内存呈毁灭性增长,K3 的 KDA 机制正是为此而生。
编程 Agent 需求:SWE Marathon 等长时程代码任务需要模型在数小时会话中保持上下文连贯,1M 窗口 + 缓存命中 90%+ 是核心卖点。
| 参数 | 数值 |
|---|---|
| 总参数量 | 2.8 万亿(全球最大开源模型) |
| 架构 | KDA + AttnRes + Stable LatentMoE |
| 激活专家 | 16 / 896(稀疏 MoE,1.8%) |
| 上下文窗口 | 1,048,576 tokens(1M) |
| 输入模态 | 文本、图像、视频 |
| 推理模式 | Always-on max effort(low/high 后续更新) |
| 开源权重 | 2026 年 7 月 27 日 Hugging Face |
Kimi K3 架构创新与基准测试:KDA、AttnRes 与 Stable LatentMoE
Kimi Delta Attention(KDA)是混合线性注意力机制:以 3:1 比例交替线性注意力层与全注意力层——3 个线性层处理局部结构(计算廉价),1 个全注意力层保留全局信息流。结果:KV 缓存内存减少高达 75%,百万 token 上下文下解码速度提升高达 6.3 倍,短/长上下文与强化学习扩展场景均超越纯全注意力基线。
Attention Residuals(AttnRes)改造深度维度残差连接:标准残差会稀释早期层关键表征;AttnRes 引入选择性检索,模型可跨越深度直接拉取更早层高价值表征,带来约 25% 训练效率提升,额外计算开销不足 2%。
Stable LatentMoE在 896 专家 / 16 激活的极端稀疏度下稳定训练,配套技术如下:
| 技术 | 作用 |
|---|---|
| Quantile Balancing | 从路由器得分分位数直接推导专家分配,消除启发式超参 |
| Per-Head Muon | 针对每个注意力头独立优化,使大规模训练更自适应 |
| Sigmoid Tanh Unit(SiTU) | 改进激活函数控制 |
| Gated MLA | 提升注意力选择性 |
综合以上创新,K3 相较 Kimi K2 整体扩展效率提升约 2.5 倍。月之暗面自报基准数据如下(不同模型使用各自推理 harness,独立第三方复现仍在进行):
| 基准测试 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro(视觉) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench | 91.1 | 89.8 | 85.8 | 87.9 | — |
SWE Marathon 专门测试持续性长代码工作——K3 以 42.0 大幅领先排名第一;Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,紧随 Claude Fable 5(59.9)与 GPT-5.6 Sol(58.9)之后,差距仅 2.8 分。
Kimi K3 定价多少?与 Claude、GPT、DeepSeek 成本对比
K3 标准价与 Claude Sonnet 5 持平($3/$15 per 1M tokens),但提供 5 倍上下文窗口(1M vs 200K)。缓存命中价格低至 $0.30/M(标准价 1/10),月之暗面报告编程场景缓存命中率超过 90%,实际有效输入成本极低;OpenRouter 7 日加权平均证实有效输入成本约 $0.55/M。
| 模型 | 输入($/M) | 输出($/M) | 缓存命中输入 | 上下文 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00(促销 $2) | $15.00(促销 $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
相较 Claude Opus 4.8,K3 在多项基准上更优,输入成本仅 60%、输出成本仅 40%。国内 API 定价:输入 ¥20/M、输出 ¥100/M、缓存命中 ¥2/M;消费者版在 Kimi.com 免费账号即可使用,预付费套餐 ¥199 起(优惠截至 8 月 11 日)。
如何立即使用 Kimi K3?四种接入方式与六步 Runbook
Kimi 网页/App(最简单):访问 kimi.com,注册账号(支持 Google 账号),K3 默认以最大推理力度运行,无需信用卡。
获取 API Key:在 platform.kimi.ai 注册开发者账号,创建 API Key 并充值。
配置 OpenAI 兼容客户端:设置 base_url="https://api.moonshot.ai/v1",模型 ID 为 kimi-k3。
OpenRouter 接入:模型 ID moonshotai/kimi-k3,Moonshot 官方定价无额外加价,完整 1M 上下文。
启用 Prompt Caching:编程工作流设置对话路由缓存键,利用 90%+ 缓存命中率降低实际输入成本至约 $0.55/M。
标记 7 月 27 日:完整模型权重将在 Hugging Face 开放,MXFP4/NVFP4 量化版与 vLLM、SGLang 预计 Day-0 支持;生产部署需 64+ 加速卡超节点。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "帮我分析这段代码..."}]
)
开源时间表:7 月 17–20 日 WAIC 预计更多发布 → 7 月 27 日 K3 完整权重开源,将成为首个超 2 万亿参数级别的可下载开源权重。
Kimi K3 怎么选?场景矩阵与可引用技术数据
| 场景 | 推荐模型 | 原因 |
|---|---|---|
| 持续性长代码任务 | Kimi K3 | SWE Marathon 基准第一,1M 上下文最长 |
| 复杂 Repo 级别修 Bug | Claude Fable 5 | FrontierSWE 86.6 大幅领先 |
| 终端/工具链密集型 Agent | GPT-5.6 Sol | Terminal Bench 2.1 与 Coding Agent Index 领先 |
| 超长文档/多模态理解 | Kimi K3 | OmniDocBench 91.1 第一,原生视觉 + 1M 上下文 |
| 成本敏感场景 | DeepSeek V4 Pro | 输出仅 $3.48/M,远低于 K3 |
| 开源自部署(7/27 后) | Kimi K3 | 最强开源权重,MXFP4 量化友好 |
参数量级:2.8T,超越 DeepSeek V4 Pro(1.6T)近 75%,迄今最大可下载开源模型(7/27 后)。
KDA 效率:KV 缓存 -75%、百万 token 解码 +6.3×、训练扩展效率 +2.5×(vs K2)。
Intelligence Index:Artificial Analysis v4.1 得分 57.1,开源模型中最高,与闭源旗舰差距 2.8 分。
注意:上述基准为月之暗面自报数据,K3 用 Kimi Code、GPT 用 Codex、Claude 用 Claude Code 各自 harness;独立第三方复现仍在进行中,请作方向性参考。
Kimi K3 不是参数堆砌的面子工程——KDA、AttnRes、Stable LatentMoE 是真实工程创新,在编程长任务与文档理解等赛道对标乃至超越部分闭源旗舰。纯 API 调用虽可快速起步,但本地 Mac 在长时间 Kimi Code Agent 循环中常遇内存压力与 IDE 常驻开销;云虚拟机又存在 Metal 兼容性损耗。对于需要 7×24 稳定运行编程 Agent、并行 dev server 与推理常驻的工程团队,MESHLAUNCH 的 Mac Mini 云端裸金属租赁通常是更优解:独占 Apple Silicon、按天/周/月弹性下单,更适合 iOS CI/CD 与 AI Agent 自动化生产环境。
参考资料:Moonshot AI 官方博客 · Kimi API Platform 文档 · Artificial Analysis · OpenRouter 定价页 · VentureBeat · SCMP
可以。在 kimi.com 注册免费账号即可使用 K3。API 调用需付费($3/$15 per 1M tokens)。预算规划可参考 租赁价格页。
完整权重将于 2026 年 7 月 27 日在 Hugging Face 开放。生产级部署需要 64 张以上加速卡的超节点,消费级本地部署不现实。模型以 MXFP4 权重 + MXFP8 激活训练,量化友好。
K3 参数量近两倍、上下文大 8 倍、编程与文档理解基准更强;DeepSeek V4 Pro 输出仅 $3.48/M,成本敏感场景更优。详见 帮助中心 相关说明。
对一次性分析完整代码库、处理长篇法律/研究文档、以及多轮 Agent 长记忆场景非常实用;flat 定价无长度附加费,配合 90%+ 缓存命中率实际成本可控。
月之暗面表示 low 和 high 力度模式将在后续更新中推出,目前仅 max 模式可用。