Kimi K3 深度评测
2.8 万亿参数开源大模型新纪录

KDA 架构创新 · 百万 token 上下文 · 基准全表 · 定价对比 · API 接入 · 7/27 开源权重

Kimi K3 2.8万亿参数开源大模型深度评测 2026
2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文档顶部悄然挂出「🎉 Kimi K3 已上线!」——没有大型发布会,却发布了目前全球参数规模最大的开源 AI 模型(2.8 万亿)。如果你正为团队选型编程 Agent、对比 Claude Fable 5 与 GPT-5.6 Sol,或等待最强开源权重落地,本文将回答:① K3 的 KDA/AttnRes/Stable LatentMoE 架构创新到底解决了什么;② 在 SWE Marathon、OmniDocBench 等关键基准上表现如何;③ $3/$15 定价与四种接入方式,以及 7 月 27 日完整权重开源意味着什么。
01

Kimi K3 是什么?2.8 万亿参数开源大模型核心规格

2026 年 7 月 16 日,月之暗面发布 Kimi K3——2.8 万亿(2.8T)参数的稀疏混合专家(MoE)模型,超越此前纪录保持者 DeepSeek V4 Pro(1.6T)近 75%,是小米开源模型(1.02T)的 2.7 倍,是阿里(397B)的 7 倍有余。低调上线与巨大体量形成鲜明对比:一份技术博客、一个定价页面、一个可立刻调用的模型 ID kimi-k3

K3 采用 896 个专家、每次推理激活 16 个(稀疏度 1.8%);配合 100 万 token 超长上下文(约等于一次性读完 5 本《红楼梦》全文)及原生视觉理解,专为复杂编程、长文档推理与知识工作设计。一句话总结:开源的、可原生理解图像与视频的、拥有超长记忆的重量级编程 AI,价格比 Claude Opus 4.8 便宜 40%,完整权重将于 7 月 27 日对外开源。

01

规模冲击:DeepSeek 崛起后月之暗面市场份额一度大幅缩水,K3 是战略反击——过去 12 个月 Kimi 系列有 9 个月占据开源模型规模上限。

02

发布时机:恰在 2026 世界人工智能大会(WAIC)开幕前夜,7 月 17–20 日预计更多发布。

03

商业化爆发:截至 2026 年 6 月 ARR 突破 3 亿美元,今年内完成第 6 轮融资,投前估值 315 亿美元;API 收入占七成以上,海外付费用户增长 400%。

04

长上下文痛点:传统全注意力在百万 token 下 KV 缓存内存呈毁灭性增长,K3 的 KDA 机制正是为此而生。

05

编程 Agent 需求:SWE Marathon 等长时程代码任务需要模型在数小时会话中保持上下文连贯,1M 窗口 + 缓存命中 90%+ 是核心卖点。

参数数值
总参数量2.8 万亿(全球最大开源模型)
架构KDA + AttnRes + Stable LatentMoE
激活专家16 / 896(稀疏 MoE,1.8%)
上下文窗口1,048,576 tokens(1M)
输入模态文本、图像、视频
推理模式Always-on max effort(low/high 后续更新)
开源权重2026 年 7 月 27 日 Hugging Face
02

Kimi K3 架构创新与基准测试:KDA、AttnRes 与 Stable LatentMoE

Kimi Delta Attention(KDA)是混合线性注意力机制:以 3:1 比例交替线性注意力层与全注意力层——3 个线性层处理局部结构(计算廉价),1 个全注意力层保留全局信息流。结果:KV 缓存内存减少高达 75%,百万 token 上下文下解码速度提升高达 6.3 倍,短/长上下文与强化学习扩展场景均超越纯全注意力基线。

Attention Residuals(AttnRes)改造深度维度残差连接:标准残差会稀释早期层关键表征;AttnRes 引入选择性检索,模型可跨越深度直接拉取更早层高价值表征,带来约 25% 训练效率提升,额外计算开销不足 2%。

Stable LatentMoE在 896 专家 / 16 激活的极端稀疏度下稳定训练,配套技术如下:

技术作用
Quantile Balancing从路由器得分分位数直接推导专家分配,消除启发式超参
Per-Head Muon针对每个注意力头独立优化,使大规模训练更自适应
Sigmoid Tanh Unit(SiTU)改进激活函数控制
Gated MLA提升注意力选择性

综合以上创新,K3 相较 Kimi K2 整体扩展效率提升约 2.5 倍。月之暗面自报基准数据如下(不同模型使用各自推理 harness,独立第三方复现仍在进行):

基准测试Kimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GLM-5.2
DeepSWE67.570.073.059.046.2
Program Bench77.876.877.671.963.7
Terminal Bench 2.188.384.688.884.682.7
FrontierSWE81.286.671.366.767.3
SWE Marathon42.035.039.040.013.0
BrowseComp91.288.090.484.3
Automation Bench30.829.129.727.212.9
GPQA-Diamond93.592.694.191.091.2
MMMU-Pro(视觉)81.681.283.078.9
OmniDocBench91.189.885.887.9

SWE Marathon 专门测试持续性长代码工作——K3 以 42.0 大幅领先排名第一;Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,紧随 Claude Fable 5(59.9)与 GPT-5.6 Sol(58.9)之后,差距仅 2.8 分。

03

Kimi K3 定价多少?与 Claude、GPT、DeepSeek 成本对比

K3 标准价与 Claude Sonnet 5 持平($3/$15 per 1M tokens),但提供 5 倍上下文窗口(1M vs 200K)。缓存命中价格低至 $0.30/M(标准价 1/10),月之暗面报告编程场景缓存命中率超过 90%,实际有效输入成本极低;OpenRouter 7 日加权平均证实有效输入成本约 $0.55/M。

模型输入($/M)输出($/M)缓存命中输入上下文
Kimi K3$3.00$15.00$0.301M
Claude Sonnet 5$3.00(促销 $2)$15.00(促销 $10)200K
Claude Opus 4.8$5.00$25.00200K
GPT-5.5$5.00$30.00400K
DeepSeek V4 Pro$1.74$3.48$0.145128K
Kimi K2.6$0.95$4.00$0.16256K

相较 Claude Opus 4.8,K3 在多项基准上更优,输入成本仅 60%、输出成本仅 40%。国内 API 定价:输入 ¥20/M、输出 ¥100/M、缓存命中 ¥2/M;消费者版在 Kimi.com 免费账号即可使用,预付费套餐 ¥199 起(优惠截至 8 月 11 日)。

04

如何立即使用 Kimi K3?四种接入方式与六步 Runbook

01

Kimi 网页/App(最简单):访问 kimi.com,注册账号(支持 Google 账号),K3 默认以最大推理力度运行,无需信用卡。

02

获取 API Key:platform.kimi.ai 注册开发者账号,创建 API Key 并充值。

03

配置 OpenAI 兼容客户端:设置 base_url="https://api.moonshot.ai/v1",模型 ID 为 kimi-k3

04

OpenRouter 接入:模型 ID moonshotai/kimi-k3,Moonshot 官方定价无额外加价,完整 1M 上下文。

05

启用 Prompt Caching:编程工作流设置对话路由缓存键,利用 90%+ 缓存命中率降低实际输入成本至约 $0.55/M。

06

标记 7 月 27 日:完整模型权重将在 Hugging Face 开放,MXFP4/NVFP4 量化版与 vLLM、SGLang 预计 Day-0 支持;生产部署需 64+ 加速卡超节点。

Python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "帮我分析这段代码..."}]
)

开源时间表:7 月 17–20 日 WAIC 预计更多发布 → 7 月 27 日 K3 完整权重开源,将成为首个超 2 万亿参数级别的可下载开源权重。

05

Kimi K3 怎么选?场景矩阵与可引用技术数据

场景推荐模型原因
持续性长代码任务Kimi K3SWE Marathon 基准第一,1M 上下文最长
复杂 Repo 级别修 BugClaude Fable 5FrontierSWE 86.6 大幅领先
终端/工具链密集型 AgentGPT-5.6 SolTerminal Bench 2.1 与 Coding Agent Index 领先
超长文档/多模态理解Kimi K3OmniDocBench 91.1 第一,原生视觉 + 1M 上下文
成本敏感场景DeepSeek V4 Pro输出仅 $3.48/M,远低于 K3
开源自部署(7/27 后)Kimi K3最强开源权重,MXFP4 量化友好
A

参数量级:2.8T,超越 DeepSeek V4 Pro(1.6T)近 75%,迄今最大可下载开源模型(7/27 后)。

B

KDA 效率:KV 缓存 -75%、百万 token 解码 +6.3×、训练扩展效率 +2.5×(vs K2)。

C

Intelligence Index:Artificial Analysis v4.1 得分 57.1,开源模型中最高,与闭源旗舰差距 2.8 分。

注意:上述基准为月之暗面自报数据,K3 用 Kimi Code、GPT 用 Codex、Claude 用 Claude Code 各自 harness;独立第三方复现仍在进行中,请作方向性参考。

Kimi K3 不是参数堆砌的面子工程——KDA、AttnRes、Stable LatentMoE 是真实工程创新,在编程长任务与文档理解等赛道对标乃至超越部分闭源旗舰。纯 API 调用虽可快速起步,但本地 Mac 在长时间 Kimi Code Agent 循环中常遇内存压力与 IDE 常驻开销;云虚拟机又存在 Metal 兼容性损耗。对于需要 7×24 稳定运行编程 Agent、并行 dev server 与推理常驻的工程团队,MESHLAUNCH 的 Mac Mini 云端裸金属租赁通常是更优解:独占 Apple Silicon、按天/周/月弹性下单,更适合 iOS CI/CD 与 AI Agent 自动化生产环境。

参考资料:Moonshot AI 官方博客 · Kimi API Platform 文档 · Artificial Analysis · OpenRouter 定价页 · VentureBeat · SCMP

常见问题

可以。在 kimi.com 注册免费账号即可使用 K3。API 调用需付费($3/$15 per 1M tokens)。预算规划可参考 租赁价格页

完整权重将于 2026 年 7 月 27 日在 Hugging Face 开放。生产级部署需要 64 张以上加速卡的超节点,消费级本地部署不现实。模型以 MXFP4 权重 + MXFP8 激活训练,量化友好。

K3 参数量近两倍、上下文大 8 倍、编程与文档理解基准更强;DeepSeek V4 Pro 输出仅 $3.48/M,成本敏感场景更优。详见 帮助中心 相关说明。

对一次性分析完整代码库、处理长篇法律/研究文档、以及多轮 Agent 长记忆场景非常实用;flat 定价无长度附加费,配合 90%+ 缓存命中率实际成本可控。

月之暗面表示 low 和 high 力度模式将在后续更新中推出,目前仅 max 模式可用。