Qwen3.8-Max 發布時間線:從預覽版到 GA 只用了兩週
7 月中下旬國產大模型密集交鋒,Qwen3.8-Max 的發布節奏與 Kimi K3、DeepSeek V4-Flash 形成直接對照——理解時間線有助於判斷哪些資訊已經過第三方驗證、哪些仍是廠商口徑。
7 月 16 日:月之暗面發布 Kimi K3,2.8 萬億參數(896 專家中啟用 16 個),主打獨立評測與透明技術報告路線。
7 月 19 日:Qwen3.8-Max 以預覽版開放,接入 Token Plan / Qoder / QoderWork,價格為正式價 10%,但未公布啟用參數量、未提供跑分表,服務條款禁止自動化生產環境呼叫。
7 月 27 日:Kimi K3 按承諾開源權重,上線 Hugging Face,並同步開源注意力核心、MoE 通訊函式庫等基礎設施。
7 月 31 日:DeepSeek 發布 V4-Flash 正式版,參數規模不變,靠架構與訓練最佳化讓智慧體、程式碼類基準大幅超過 V4-Pro 預覽版。
8 月 3 日:Qwen3.8-Max 正式 GA,發布完整跑分表,「千問辦公」Agent 同步上線。當天阿里港股漲約 7%、美股漲約 4.5%。
預計 8 月 10 日前後,Qwen3.8-Max 及精簡版 Qwen3.8-27B 權重計畫登陸 Hugging Face 與 ModelScope,但截至發稿具體日期與開源協定條款均未公布。
Qwen3.8-Max 核心參數與 Kimi K3、DeepSeek、Claude 橫評
下表優先列出阿里 GA 階段公開資料;帶「阿里自測」標註的基準尚無 Artificial Analysis、Arena.ai 等第三方正式復現。
| 項目 | Qwen3.8-Max | 備註 |
|---|---|---|
| 總參數 / 啟用參數 | 2.4 萬億 / 950 億 | 稀疏 MoE + 混合注意力 |
| 上下文視窗 | 100 萬 token | 思考模式約 98.3 萬,輸出上限 13.1 萬 |
| API 定價(每百萬 token) | 輸入 $2 / 輸出 $6 | 國內口徑:輸入 12 元 / 輸出 36 元 |
| Arena 文字競技場(8/1 快照) | 第 5 名,1496 分 | 標註 Preliminary;前 8 中唯一非 Anthropic |
| SWE-bench Pro(阿里自測) | 67.7 | 落後 Fable 5 的 80.0 |
| 權重開源狀態 | 承諾「下週」 | 截至發稿未上線 |
| 模型 | 總參數/啟用 | 定價(輸入/輸出) | 權重開源 | 獨立第三方評測 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950 億 | $2 / $6 | 未開源(承諾中) | 暫無 |
| Kimi K3 | 2.8T / 約 500 億 | $3 / $15 | 已開源(7/27) | AA Index ≈ 57.11 |
| DeepSeek V4-Flash | 較 V4-Pro 未變 | 未公開完整表 | 已開源 | 9 項智慧體/程式碼基準超 V4-Pro |
| Claude Fable 5 | 未公開 | $10 / $50 | 閉源 | Arena 文字第 1 |
唯一一次可比的獨立盲測(269 個檔案的真實專案架構任務)中,Kimi K3 得 83 分、Qwen3.8-Max 預覽版得 80 分——差距很小,屬於「互有勝負」而非「全面碾壓」。
2.4 萬億參數背後:MoE 效率、推理檔位與 Agent 生態
Qwen3.8-Max 延續 Qwen3.5 的稀疏 MoE 路線:總參數 2.4 萬億,實際啟用 950 億,推理成本更接近千億級模型而非完整 2.4T。這也是 API 定價能壓到 $2/$6、明顯低於 Claude Opus 5($5/$25)和 Fable 5($10/$50)的架構基礎。
reasoning_effort 三檔設計提供 low / medium / xhigh(預設 xhigh),開發者可按任務複雜度調節速度與深度,透過 enable_thinking 或 Anthropic 相容介面的 reasoning.effort 欄位呼叫。
長程自主任務是核心賣點:阿里案例包括 16 天無人工介入的自主編碼、500+ 步晶片設計最佳化,以及自建 RecreationBench(黑盒環境下僅憑互動與視覺回饋還原真實應用)。部分過程記錄在 GitHub qwen-code-dev-bot/oh-my-cli,但並非完整第三方稽核。
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_API_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
message = client.messages.create(
model="qwen3.8-max",
max_tokens=8192,
thinking={"type": "enabled", "budget_tokens": 4096},
messages=[{"role": "user", "content": "設計一個三服務微服務架構"}]
)
提示:API 同時相容 OpenAI 與 Anthropic 協定,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈,降低遷移成本。
Qwen3.8-Max 評估與接入:六步 Runbook
明確接入路徑:區分 API 呼叫(QwenCloud / DashScope)、等待開源權重(Qwen3.8-27B 更現實),還是透過 OpenClaw 等 Agent 閘道間接呼叫。完整 2.4T 權重需多節點資料中心,不適合本地自部署。
註冊並取得 API Key:在阿里雲 Model Studio 開通 Qwen3.8-Max,確認帳戶配額與區域。預覽版曾禁止自動化生產呼叫,GA 後條款以官方最新文件為準。
設定 reasoning_effort:按任務類型選擇 low / medium / xhigh。簡單分類用 low,複雜 Agent 編排預設 xhigh,平衡延遲與推理深度。
啟用快取策略:隱式快取命中 $0.25/百萬 token、顯式快取讀取 $0.17/百萬 token,長上下文 Agent 工作流程應評估快取命中率對實際帳單的影響。
業務場景 A/B 測試:在遷移生產系統前,用自有資料集與 Kimi K3 / DeepSeek V4-Flash 做盲測對比,不依賴廠商自報跑分。
關注開源落地:預計 8 月 10 日前後檢查 Hugging Face / ModelScope 儲存庫、授權條款與 Qwen3.8-27B 精簡版權重,再決定是否切換自部署路徑。
開源標籤爭議與 2026 中國大模型競爭格局
「Open-Source」標籤先於權重:qwen.ai 在 GA 當天已標註開源,但 Hugging Face / ModelScope 尚無儲存庫與授權條款,只有「下週」模糊承諾。
跑分均來自阿里自建框架:PaperBench 93.0、OSWorld-Verified 86.1 等尚無中立平台復現;Arena 1496 分標註為 Preliminary。
Apple Intelligence 中國版:千問模型經壓縮至 4GB 以內,已在 iPhone 15 及以上機型本地執行,商業化半徑延伸為數億部 iPhone 的系統級 AI。
注意:2026 年參數競賽敘事正被「架構效率競賽」取代——DeepSeek V4-Flash 在不增參數的前提下反超 V4-Pro。Qwen3.8-Max 的「大容量、低啟用」設計是同一思路的延續,但「全球第一梯隊」結論仍需等開源權重與第三方跑分落地後驗證。
若你的團隊需要在本地 Mac 上執行 OpenClaw Gateway、Claude Code 或 Qwen Code 等 Agent 編排工具,消費級硬體難以承載 2.4T 級模型的私有化推理;而本地 Mac 的休眠與記憶體瓶頸同樣會打斷 16 天級別的長程 Agent 任務。對於需要 7×24 穩定執行 iOS CI/CD 與 AI Agent 自動化的生產環境,MESHLAUNCH 的 Mac Mini 雲端租用通常是更優解:獨佔 Apple Silicon、按天/週/月彈性下單,把推理交給 API、把編排與建置留在穩定的雲端 Mac 節點上。
API 已可透過 QwenCloud 呼叫,相容 OpenAI 和 Anthropic 兩種介面。權重尚未開源,預計 8 月 10 日前後登陸 Hugging Face 與 ModelScope,具體日期以官方公告為準。詳情可見 價格頁了解雲端開發環境方案。
目前沒有權威的統一評測。唯一可比的獨立盲測顯示兩者非常接近(Kimi K3 83 分、Qwen3.8-Max 預覽版 80 分)。Kimi K3 優勢是已開源、有第三方評測;Qwen3.8-Max 優勢是 API 價格更低、多模態更全面。
總參數 2.4 萬億但啟用僅 950 億,API 呼叫成本接近千億級模型。本地私有化部署完整版需多節點資料中心;更現實的選擇是等待精簡版 Qwen3.8-27B 開源。
可作參考但不能當定論。資料均來自阿里自建測試框架,尚無 Artificial Analysis 等中立平台對正式版復現。建議關注後續獨立評測,或在自己的業務場景做 A/B 測試。建議先查看 幫助中心了解雲端 Mac 開發環境設定。
蘋果在中國市場的 Apple Intelligence 功能基於經壓縮後的 Qwen 模型本地執行,國內 iPhone 用戶將在系統層面直接用到千問系列能力,無需主動選擇模型廠商。