Qwen3.8-Max 发布时间线:从预览版到 GA 只用了两周
7 月中下旬国产大模型密集交锋,Qwen3.8-Max 的发布节奏与 Kimi K3、DeepSeek V4-Flash 形成直接对照——理解时间线有助于判断哪些信息已经过第三方验证、哪些仍是厂商口径。
7 月 16 日:月之暗面发布 Kimi K3,2.8 万亿参数(896 专家中激活 16 个),主打独立评测与透明技术报告路线。
7 月 19 日:Qwen3.8-Max 以预览版开放,接入 Token Plan / Qoder / QoderWork,价格为正式价 10%,但未公布激活参数量、未提供跑分表,服务条款禁止自动化生产环境调用。
7 月 27 日:Kimi K3 按承诺开源权重,上线 Hugging Face,并同步开源注意力内核、MoE 通信库等基础设施。
7 月 31 日:DeepSeek 发布 V4-Flash 正式版,参数规模不变,靠架构与训练优化让智能体、代码类基准大幅超过 V4-Pro 预览版。
8 月 3 日:Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」Agent 同步上线。当天阿里港股涨约 7%、美股涨约 4.5%。
预计 8 月 10 日前后,Qwen3.8-Max 及精简版 Qwen3.8-27B 权重计划登陆 Hugging Face 与 ModelScope,但截至发稿具体日期与开源协议条款均未公布。
Qwen3.8-Max 核心参数与 Kimi K3、DeepSeek、Claude 横评
下表优先列出阿里 GA 阶段公开数据;带「阿里自测」标注的基准尚无 Artificial Analysis、Arena.ai 等第三方正式复现。
| 项目 | Qwen3.8-Max | 备注 |
|---|---|---|
| 总参数 / 激活参数 | 2.4 万亿 / 950 亿 | 稀疏 MoE + 混合注意力 |
| 上下文窗口 | 100 万 token | 思考模式约 98.3 万,输出上限 13.1 万 |
| API 定价(每百万 token) | 输入 $2 / 输出 $6 | 国内口径:输入 12 元 / 输出 36 元 |
| Arena 文本竞技场(8/1 快照) | 第 5 名,1496 分 | 标注 Preliminary;前 8 中唯一非 Anthropic |
| SWE-bench Pro(阿里自测) | 67.7 | 落后 Fable 5 的 80.0 |
| 权重开源状态 | 承诺「下周」 | 截至发稿未上线 |
| 模型 | 总参数/激活 | 定价(输入/输出) | 权重开源 | 独立第三方评测 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950 亿 | $2 / $6 | 未开源(承诺中) | 暂无 |
| Kimi K3 | 2.8T / 约 500 亿 | $3 / $15 | 已开源(7/27) | AA Index ≈ 57.11 |
| DeepSeek V4-Flash | 较 V4-Pro 未变 | 未公开完整表 | 已开源 | 9 项智能体/代码基准超 V4-Pro |
| Claude Fable 5 | 未公开 | $10 / $50 | 闭源 | Arena 文本第 1 |
唯一一次可比的独立盲测(269 个文件的真实项目架构任务)中,Kimi K3 得 83 分、Qwen3.8-Max 预览版得 80 分——差距很小,属于「互有胜负」而非「全面碾压」。
2.4 万亿参数背后:MoE 效率、推理档位与 Agent 生态
Qwen3.8-Max 延续 Qwen3.5 的稀疏 MoE 路线:总参数 2.4 万亿,实际激活 950 亿,推理成本更接近千亿级模型而非完整 2.4T。这也是 API 定价能压到 $2/$6、明显低于 Claude Opus 5($5/$25)和 Fable 5($10/$50)的架构基础。
reasoning_effort 三档设计提供 low / medium / xhigh(默认 xhigh),开发者可按任务复杂度调节速度与深度,通过 enable_thinking 或 Anthropic 兼容接口的 reasoning.effort 字段调用。
长程自主任务是核心卖点:阿里案例包括 16 天无人工介入的自主编码、500+ 步芯片设计优化,以及自建 RecreationBench(黑盒环境下仅凭交互与视觉反馈还原真实应用)。部分过程记录在 GitHub qwen-code-dev-bot/oh-my-cli,但并非完整第三方审计。
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_API_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
message = client.messages.create(
model="qwen3.8-max",
max_tokens=8192,
thinking={"type": "enabled", "budget_tokens": 4096},
messages=[{"role": "user", "content": "设计一个三服务微服务架构"}]
)
提示:API 同时兼容 OpenAI 与 Anthropic 协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链,降低迁移成本。
Qwen3.8-Max 评估与接入:六步 Runbook
明确接入路径:区分 API 调用(QwenCloud / DashScope)、等待开源权重(Qwen3.8-27B 更现实),还是通过 OpenClaw 等 Agent 网关间接调用。完整 2.4T 权重需多节点数据中心,不适合本地自部署。
注册并获取 API Key:在阿里云 Model Studio 开通 Qwen3.8-Max,确认账户配额与区域。预览版曾禁止自动化生产调用,GA 后条款以官方最新文档为准。
配置 reasoning_effort:按任务类型选择 low / medium / xhigh。简单分类用 low,复杂 Agent 编排默认 xhigh,平衡延迟与推理深度。
启用缓存策略:隐式缓存命中 $0.25/百万 token、显式缓存读取 $0.17/百万 token,长上下文 Agent 工作流应评估缓存命中率对实际账单的影响。
业务场景 A/B 测试:在迁移生产系统前,用自有数据集与 Kimi K3 / DeepSeek V4-Flash 做盲测对比,不依赖厂商自报跑分。
关注开源落地:预计 8 月 10 日前后检查 Hugging Face / ModelScope 仓库、许可证条款与 Qwen3.8-27B 精简版权重,再决定是否切换自部署路径。
开源标签争议与 2026 中国大模型竞争格局
「Open-Source」标签先于权重:qwen.ai 在 GA 当天已标注开源,但 Hugging Face / ModelScope 尚无仓库与许可证,只有「下周」模糊承诺。
跑分均来自阿里自建框架:PaperBench 93.0、OSWorld-Verified 86.1 等尚无中立平台复现;Arena 1496 分标注为 Preliminary。
Apple Intelligence 中国版:千问模型经压缩至 4GB 以内,已在 iPhone 15 及以上机型本地运行,商业化半径延伸为数亿部 iPhone 的系统级 AI。
注意:2026 年参数竞赛叙事正被「架构效率竞赛」取代——DeepSeek V4-Flash 在不增参数的前提下反超 V4-Pro。Qwen3.8-Max 的「大容量、低激活」设计是同一思路的延续,但「全球第一梯队」结论仍需等开源权重与第三方跑分落地后验证。
若你的团队需要在本地 Mac 上运行 OpenClaw Gateway、Claude Code 或 Qwen Code 等 Agent 编排工具,消费级硬件难以承载 2.4T 级模型的私有化推理;而本地 Mac 的休眠与内存瓶颈同样会打断 16 天级别的长程 Agent 任务。对于需要 7×24 稳定运行 iOS CI/CD 与 AI Agent 自动化的生产环境,MESHLAUNCH 的 Mac Mini 云端租赁通常是更优解:独占 Apple Silicon、按天/周/月弹性下单,把推理交给 API、把编排与构建留在稳定的云端 Mac 节点上。
API 已可通过 QwenCloud 调用,兼容 OpenAI 和 Anthropic 两种接口。权重尚未开源,预计 8 月 10 日前后登陆 Hugging Face 与 ModelScope,具体日期以官方公告为准。详情可见 价格页了解云端开发环境方案。
目前没有权威的统一评测。唯一可比的独立盲测显示两者非常接近(Kimi K3 83 分、Qwen3.8-Max 预览版 80 分)。Kimi K3 优势是已开源、有第三方评测;Qwen3.8-Max 优势是 API 价格更低、多模态更全面。
总参数 2.4 万亿但激活仅 950 亿,API 调用成本接近千亿级模型。本地私有化部署完整版需多节点数据中心;更现实的选择是等待精简版 Qwen3.8-27B 开源。
可作参考但不能当定论。数据均来自阿里自建测试框架,尚无 Artificial Analysis 等中立平台对正式版复现。建议关注后续独立评测,或在自己的业务场景做 A/B 测试。建议先查看 帮助中心了解云端 Mac 开发环境配置。
苹果在中国市场的 Apple Intelligence 功能基于经压缩后的 Qwen 模型本地运行,国内 iPhone 用户将在系统层面直接用到千问系列能力,无需主动选择模型厂商。