阿里Qwen3.8-Max发布
2.4万亿参数冲进Arena全球前五

Arena文本第5 · 950亿激活参数 · 开源承诺与跑分争议全解析

阿里Qwen3.8-Max发布:2.4万亿参数冲进Arena全球前五
2026年8月3日,阿里巴巴正式发布千问 Qwen3.8-Max:总参数 2.4 万亿、激活 950 亿、100 万 token 上下文,同步上线 Agent 产品「千问办公」。Arena 文本竞技场前 8 名中,它是唯一挤进去的非 Anthropic 模型——但所有跑分均为阿里自测,权重「下周」才承诺开源。本文面向正在评估国产旗舰 API 的技术团队,给出两周时间线、与 Kimi K3 / DeepSeek V4 横评、开源标签争议,以及六步接入 Runbook。
01

Qwen3.8-Max 发布时间线:从预览版到 GA 只用了两周

7 月中下旬国产大模型密集交锋,Qwen3.8-Max 的发布节奏与 Kimi K3、DeepSeek V4-Flash 形成直接对照——理解时间线有助于判断哪些信息已经过第三方验证、哪些仍是厂商口径。

01

7 月 16 日:月之暗面发布 Kimi K3,2.8 万亿参数(896 专家中激活 16 个),主打独立评测与透明技术报告路线。

02

7 月 19 日:Qwen3.8-Max 以预览版开放,接入 Token Plan / Qoder / QoderWork,价格为正式价 10%,但未公布激活参数量、未提供跑分表,服务条款禁止自动化生产环境调用。

03

7 月 27 日:Kimi K3 按承诺开源权重,上线 Hugging Face,并同步开源注意力内核、MoE 通信库等基础设施。

04

7 月 31 日:DeepSeek 发布 V4-Flash 正式版,参数规模不变,靠架构与训练优化让智能体、代码类基准大幅超过 V4-Pro 预览版。

05

8 月 3 日:Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」Agent 同步上线。当天阿里港股涨约 7%、美股涨约 4.5%。

预计 8 月 10 日前后,Qwen3.8-Max 及精简版 Qwen3.8-27B 权重计划登陆 Hugging Face 与 ModelScope,但截至发稿具体日期与开源协议条款均未公布。

02

Qwen3.8-Max 核心参数与 Kimi K3、DeepSeek、Claude 横评

下表优先列出阿里 GA 阶段公开数据;带「阿里自测」标注的基准尚无 Artificial Analysis、Arena.ai 等第三方正式复现。

项目Qwen3.8-Max备注
总参数 / 激活参数2.4 万亿 / 950 亿稀疏 MoE + 混合注意力
上下文窗口100 万 token思考模式约 98.3 万,输出上限 13.1 万
API 定价(每百万 token)输入 $2 / 输出 $6国内口径:输入 12 元 / 输出 36 元
Arena 文本竞技场(8/1 快照)第 5 名,1496 分标注 Preliminary;前 8 中唯一非 Anthropic
SWE-bench Pro(阿里自测)67.7落后 Fable 5 的 80.0
权重开源状态承诺「下周」截至发稿未上线
模型总参数/激活定价(输入/输出)权重开源独立第三方评测
Qwen3.8-Max2.4T / 950 亿$2 / $6未开源(承诺中)暂无
Kimi K32.8T / 约 500 亿$3 / $15已开源(7/27)AA Index ≈ 57.11
DeepSeek V4-Flash较 V4-Pro 未变未公开完整表已开源9 项智能体/代码基准超 V4-Pro
Claude Fable 5未公开$10 / $50闭源Arena 文本第 1

唯一一次可比的独立盲测(269 个文件的真实项目架构任务)中,Kimi K3 得 83 分、Qwen3.8-Max 预览版得 80 分——差距很小,属于「互有胜负」而非「全面碾压」。

03

2.4 万亿参数背后:MoE 效率、推理档位与 Agent 生态

Qwen3.8-Max 延续 Qwen3.5 的稀疏 MoE 路线:总参数 2.4 万亿,实际激活 950 亿,推理成本更接近千亿级模型而非完整 2.4T。这也是 API 定价能压到 $2/$6、明显低于 Claude Opus 5($5/$25)和 Fable 5($10/$50)的架构基础。

reasoning_effort 三档设计提供 low / medium / xhigh(默认 xhigh),开发者可按任务复杂度调节速度与深度,通过 enable_thinking 或 Anthropic 兼容接口的 reasoning.effort 字段调用。

长程自主任务是核心卖点:阿里案例包括 16 天无人工介入的自主编码、500+ 步芯片设计优化,以及自建 RecreationBench(黑盒环境下仅凭交互与视觉反馈还原真实应用)。部分过程记录在 GitHub qwen-code-dev-bot/oh-my-cli,但并非完整第三方审计。

Python · Anthropic 兼容接口
from anthropic import Anthropic

client = Anthropic(
    api_key="YOUR_DASHSCOPE_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

message = client.messages.create(
    model="qwen3.8-max",
    max_tokens=8192,
    thinking={"type": "enabled", "budget_tokens": 4096},
    messages=[{"role": "user", "content": "设计一个三服务微服务架构"}]
)

提示:API 同时兼容 OpenAI 与 Anthropic 协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链,降低迁移成本。

04

Qwen3.8-Max 评估与接入:六步 Runbook

01

明确接入路径:区分 API 调用(QwenCloud / DashScope)、等待开源权重(Qwen3.8-27B 更现实),还是通过 OpenClaw 等 Agent 网关间接调用。完整 2.4T 权重需多节点数据中心,不适合本地自部署。

02

注册并获取 API Key:在阿里云 Model Studio 开通 Qwen3.8-Max,确认账户配额与区域。预览版曾禁止自动化生产调用,GA 后条款以官方最新文档为准。

03

配置 reasoning_effort:按任务类型选择 low / medium / xhigh。简单分类用 low,复杂 Agent 编排默认 xhigh,平衡延迟与推理深度。

04

启用缓存策略:隐式缓存命中 $0.25/百万 token、显式缓存读取 $0.17/百万 token,长上下文 Agent 工作流应评估缓存命中率对实际账单的影响。

05

业务场景 A/B 测试:在迁移生产系统前,用自有数据集与 Kimi K3 / DeepSeek V4-Flash 做盲测对比,不依赖厂商自报跑分。

06

关注开源落地:预计 8 月 10 日前后检查 Hugging Face / ModelScope 仓库、许可证条款与 Qwen3.8-27B 精简版权重,再决定是否切换自部署路径。

05

开源标签争议与 2026 中国大模型竞争格局

A

「Open-Source」标签先于权重:qwen.ai 在 GA 当天已标注开源,但 Hugging Face / ModelScope 尚无仓库与许可证,只有「下周」模糊承诺。

B

跑分均来自阿里自建框架:PaperBench 93.0、OSWorld-Verified 86.1 等尚无中立平台复现;Arena 1496 分标注为 Preliminary。

C

Apple Intelligence 中国版:千问模型经压缩至 4GB 以内,已在 iPhone 15 及以上机型本地运行,商业化半径延伸为数亿部 iPhone 的系统级 AI。

注意:2026 年参数竞赛叙事正被「架构效率竞赛」取代——DeepSeek V4-Flash 在不增参数的前提下反超 V4-Pro。Qwen3.8-Max 的「大容量、低激活」设计是同一思路的延续,但「全球第一梯队」结论仍需等开源权重与第三方跑分落地后验证。

若你的团队需要在本地 Mac 上运行 OpenClaw Gateway、Claude Code 或 Qwen Code 等 Agent 编排工具,消费级硬件难以承载 2.4T 级模型的私有化推理;而本地 Mac 的休眠与内存瓶颈同样会打断 16 天级别的长程 Agent 任务。对于需要 7×24 稳定运行 iOS CI/CD 与 AI Agent 自动化的生产环境,MESHLAUNCH 的 Mac Mini 云端租赁通常是更优解:独占 Apple Silicon、按天/周/月弹性下单,把推理交给 API、把编排与构建留在稳定的云端 Mac 节点上。

常见问题

API 已可通过 QwenCloud 调用,兼容 OpenAI 和 Anthropic 两种接口。权重尚未开源,预计 8 月 10 日前后登陆 Hugging Face 与 ModelScope,具体日期以官方公告为准。详情可见 价格页了解云端开发环境方案。

目前没有权威的统一评测。唯一可比的独立盲测显示两者非常接近(Kimi K3 83 分、Qwen3.8-Max 预览版 80 分)。Kimi K3 优势是已开源、有第三方评测;Qwen3.8-Max 优势是 API 价格更低、多模态更全面。

总参数 2.4 万亿但激活仅 950 亿,API 调用成本接近千亿级模型。本地私有化部署完整版需多节点数据中心;更现实的选择是等待精简版 Qwen3.8-27B 开源。

可作参考但不能当定论。数据均来自阿里自建测试框架,尚无 Artificial Analysis 等中立平台对正式版复现。建议关注后续独立评测,或在自己的业务场景做 A/B 测试。建议先查看 帮助中心了解云端 Mac 开发环境配置。

苹果在中国市场的 Apple Intelligence 功能基于经压缩后的 Qwen 模型本地运行,国内 iPhone 用户将在系统层面直接用到千问系列能力,无需主动选择模型厂商。