阿里 Qwen3.8-Max 發布
2.4 萬億參數衝進 Arena 全球前五

Arena 文字第 5 · 950 億啟用參數 · 開源承諾與跑分爭議全解析

阿里 Qwen3.8-Max 發布:2.4 萬億參數衝進 Arena 全球前五
2026 年 8 月 3 日,阿里巴巴正式發布千問 Qwen3.8-Max:總參數 2.4 萬億、啟用 950 億、100 萬 token 上下文,同步上線 Agent 產品「千問辦公」。Arena 文字競技場前 8 名中,它是唯一擠進去的非 Anthropic 模型——但所有跑分均為阿里自測,權重「下週」才承諾開源。本文面向正在評估國產旗艦 API 的技術團隊,給出兩週時間線、與 Kimi K3 / DeepSeek V4 橫評、開源標籤爭議,以及六步接入 Runbook。
01

Qwen3.8-Max 發布時間線:從預覽版到 GA 只用了兩週

7 月中下旬國產大模型密集交鋒,Qwen3.8-Max 的發布節奏與 Kimi K3、DeepSeek V4-Flash 形成直接對照——理解時間線有助於判斷哪些資訊已經過第三方驗證、哪些仍是廠商口徑。

01

7 月 16 日:月之暗面發布 Kimi K3,2.8 萬億參數(896 專家中啟用 16 個),主打獨立評測與透明技術報告路線。

02

7 月 19 日:Qwen3.8-Max 以預覽版開放,接入 Token Plan / Qoder / QoderWork,價格為正式價 10%,但未公布啟用參數量、未提供跑分表,服務條款禁止自動化生產環境呼叫。

03

7 月 27 日:Kimi K3 按承諾開源權重,上線 Hugging Face,並同步開源注意力核心、MoE 通訊函式庫等基礎設施。

04

7 月 31 日:DeepSeek 發布 V4-Flash 正式版,參數規模不變,靠架構與訓練最佳化讓智慧體、程式碼類基準大幅超過 V4-Pro 預覽版。

05

8 月 3 日:Qwen3.8-Max 正式 GA,發布完整跑分表,「千問辦公」Agent 同步上線。當天阿里港股漲約 7%、美股漲約 4.5%。

預計 8 月 10 日前後,Qwen3.8-Max 及精簡版 Qwen3.8-27B 權重計畫登陸 Hugging Face 與 ModelScope,但截至發稿具體日期與開源協定條款均未公布。

02

Qwen3.8-Max 核心參數與 Kimi K3、DeepSeek、Claude 橫評

下表優先列出阿里 GA 階段公開資料;帶「阿里自測」標註的基準尚無 Artificial Analysis、Arena.ai 等第三方正式復現。

項目Qwen3.8-Max備註
總參數 / 啟用參數2.4 萬億 / 950 億稀疏 MoE + 混合注意力
上下文視窗100 萬 token思考模式約 98.3 萬,輸出上限 13.1 萬
API 定價(每百萬 token)輸入 $2 / 輸出 $6國內口徑:輸入 12 元 / 輸出 36 元
Arena 文字競技場(8/1 快照)第 5 名,1496 分標註 Preliminary;前 8 中唯一非 Anthropic
SWE-bench Pro(阿里自測)67.7落後 Fable 5 的 80.0
權重開源狀態承諾「下週」截至發稿未上線
模型總參數/啟用定價(輸入/輸出)權重開源獨立第三方評測
Qwen3.8-Max2.4T / 950 億$2 / $6未開源(承諾中)暫無
Kimi K32.8T / 約 500 億$3 / $15已開源(7/27)AA Index ≈ 57.11
DeepSeek V4-Flash較 V4-Pro 未變未公開完整表已開源9 項智慧體/程式碼基準超 V4-Pro
Claude Fable 5未公開$10 / $50閉源Arena 文字第 1

唯一一次可比的獨立盲測(269 個檔案的真實專案架構任務)中,Kimi K3 得 83 分、Qwen3.8-Max 預覽版得 80 分——差距很小,屬於「互有勝負」而非「全面碾壓」。

03

2.4 萬億參數背後:MoE 效率、推理檔位與 Agent 生態

Qwen3.8-Max 延續 Qwen3.5 的稀疏 MoE 路線:總參數 2.4 萬億,實際啟用 950 億,推理成本更接近千億級模型而非完整 2.4T。這也是 API 定價能壓到 $2/$6、明顯低於 Claude Opus 5($5/$25)和 Fable 5($10/$50)的架構基礎。

reasoning_effort 三檔設計提供 low / medium / xhigh(預設 xhigh),開發者可按任務複雜度調節速度與深度,透過 enable_thinking 或 Anthropic 相容介面的 reasoning.effort 欄位呼叫。

長程自主任務是核心賣點:阿里案例包括 16 天無人工介入的自主編碼、500+ 步晶片設計最佳化,以及自建 RecreationBench(黑盒環境下僅憑互動與視覺回饋還原真實應用)。部分過程記錄在 GitHub qwen-code-dev-bot/oh-my-cli,但並非完整第三方稽核。

Python · Anthropic 相容介面
from anthropic import Anthropic

client = Anthropic(
    api_key="YOUR_DASHSCOPE_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

message = client.messages.create(
    model="qwen3.8-max",
    max_tokens=8192,
    thinking={"type": "enabled", "budget_tokens": 4096},
    messages=[{"role": "user", "content": "設計一個三服務微服務架構"}]
)

提示:API 同時相容 OpenAI 與 Anthropic 協定,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈,降低遷移成本。

04

Qwen3.8-Max 評估與接入:六步 Runbook

01

明確接入路徑:區分 API 呼叫(QwenCloud / DashScope)、等待開源權重(Qwen3.8-27B 更現實),還是透過 OpenClaw 等 Agent 閘道間接呼叫。完整 2.4T 權重需多節點資料中心,不適合本地自部署。

02

註冊並取得 API Key:在阿里雲 Model Studio 開通 Qwen3.8-Max,確認帳戶配額與區域。預覽版曾禁止自動化生產呼叫,GA 後條款以官方最新文件為準。

03

設定 reasoning_effort:按任務類型選擇 low / medium / xhigh。簡單分類用 low,複雜 Agent 編排預設 xhigh,平衡延遲與推理深度。

04

啟用快取策略:隱式快取命中 $0.25/百萬 token、顯式快取讀取 $0.17/百萬 token,長上下文 Agent 工作流程應評估快取命中率對實際帳單的影響。

05

業務場景 A/B 測試:在遷移生產系統前,用自有資料集與 Kimi K3 / DeepSeek V4-Flash 做盲測對比,不依賴廠商自報跑分。

06

關注開源落地:預計 8 月 10 日前後檢查 Hugging Face / ModelScope 儲存庫、授權條款與 Qwen3.8-27B 精簡版權重,再決定是否切換自部署路徑。

05

開源標籤爭議與 2026 中國大模型競爭格局

A

「Open-Source」標籤先於權重:qwen.ai 在 GA 當天已標註開源,但 Hugging Face / ModelScope 尚無儲存庫與授權條款,只有「下週」模糊承諾。

B

跑分均來自阿里自建框架:PaperBench 93.0、OSWorld-Verified 86.1 等尚無中立平台復現;Arena 1496 分標註為 Preliminary。

C

Apple Intelligence 中國版:千問模型經壓縮至 4GB 以內,已在 iPhone 15 及以上機型本地執行,商業化半徑延伸為數億部 iPhone 的系統級 AI。

注意:2026 年參數競賽敘事正被「架構效率競賽」取代——DeepSeek V4-Flash 在不增參數的前提下反超 V4-Pro。Qwen3.8-Max 的「大容量、低啟用」設計是同一思路的延續,但「全球第一梯隊」結論仍需等開源權重與第三方跑分落地後驗證。

若你的團隊需要在本地 Mac 上執行 OpenClaw Gateway、Claude Code 或 Qwen Code 等 Agent 編排工具,消費級硬體難以承載 2.4T 級模型的私有化推理;而本地 Mac 的休眠與記憶體瓶頸同樣會打斷 16 天級別的長程 Agent 任務。對於需要 7×24 穩定執行 iOS CI/CD 與 AI Agent 自動化的生產環境,MESHLAUNCH 的 Mac Mini 雲端租用通常是更優解:獨佔 Apple Silicon、按天/週/月彈性下單,把推理交給 API、把編排與建置留在穩定的雲端 Mac 節點上。

常見問題

API 已可透過 QwenCloud 呼叫,相容 OpenAI 和 Anthropic 兩種介面。權重尚未開源,預計 8 月 10 日前後登陸 Hugging Face 與 ModelScope,具體日期以官方公告為準。詳情可見 價格頁了解雲端開發環境方案。

目前沒有權威的統一評測。唯一可比的獨立盲測顯示兩者非常接近(Kimi K3 83 分、Qwen3.8-Max 預覽版 80 分)。Kimi K3 優勢是已開源、有第三方評測;Qwen3.8-Max 優勢是 API 價格更低、多模態更全面。

總參數 2.4 萬億但啟用僅 950 億,API 呼叫成本接近千億級模型。本地私有化部署完整版需多節點資料中心;更現實的選擇是等待精簡版 Qwen3.8-27B 開源。

可作參考但不能當定論。資料均來自阿里自建測試框架,尚無 Artificial Analysis 等中立平台對正式版復現。建議關注後續獨立評測,或在自己的業務場景做 A/B 測試。建議先查看 幫助中心了解雲端 Mac 開發環境設定。

蘋果在中國市場的 Apple Intelligence 功能基於經壓縮後的 Qwen 模型本地執行,國內 iPhone 用戶將在系統層面直接用到千問系列能力,無需主動選擇模型廠商。