DeepSeek V4 Flash正式版上線
跑分逼近 Opus 4.8,價格卻只要幾十分之一

7/31 官方版 · 後訓練逆襲 · Harness 首秀 · 六邊形混戰 · 斬殺線 · 六步 Runbook

DeepSeek V4 Flash 0731 正式版評測 2026
7 月 31 日,DeepSeek 將 V4-Flash 升級為官方版 0731:參數規模不變,僅重訓後訓練,卻在多項 Agent 基準上反超自家更大的 V4-Pro 預覽版,API 價格約為 Claude Opus 4.8 的幾十分之一。若你關心旗艦 V4-Pro 官方版與自研 Agent 框架 Harness 何時落地、跑分能否相信、與 Kimi K3 / Qwen3.8-Max 如何橫評,本文將回答:① 從 4 月預覽到 7 月「官方版」的完整時間線;② 定價與 Artificial Analysis 第三方指數對照;③ 後訓練如何「變出」效能與六步接入 Runbook。
01

DeepSeek V4 Flash 正式版發佈了什麼?從 4 月預覽到 7 月官方版時間線

這不是一次新模型發佈,而是同一個 284B 總參數 / 13B 啟用參數的 Flash 版本重新做了一遍後訓練。真正的旗艦 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍處於「即將發佈」狀態,沒有確切日期。

01

誤讀「新模型」:7/31 升級並非擴大參數量,官方明確效能提升完全來自後訓練重跑,與「更強=更大」的產業直覺相反。

02

API 與消費端割裂:正式版僅限 API 公測,App 與網頁端暫未同步——只看客戶端的使用者會誤以為「還沒更新」。

03

舊介面已停用:7 月 24 日 deepseek-chat / deepseek-reasoner 正式下線,未遷移的流水線會直接 404。

04

競爭窗口擠壓:7 月 27 日 Kimi K3(2.8T)開源權重上線,給 DeepSeek 的 Flash 官方版製造了直接對標壓力。

05

Pro 版仍「放空炮」風險:社群曾戲稱梁文鋒「梁白開」;Flash 超預期後情緒反轉,但 V4-Pro GA 仍無官方日期。

日期事件
2026-04-24V4 預覽版開源:V4-Pro(1.6T/49B)與 V4-Flash(284B/13B),均 1M 上下文,MIT 協議
2026-07-24舊模型名停用,流量切換至 V4 系列命名
2026-07-27Kimi K3 2.8T 權重上線 Hugging Face
2026-07-31V4-Flash-0731 官方版 API 公測 + 權重同步;changelog 首次點名 Harness「即將發佈」
截至 2026-08-05V4-Pro 官方版仍「盡快發佈」;媒體援引的 8/10–8/20 GA 窗口未經官方證實
02

DeepSeek V4 Flash 定價多少?與 Kimi K3、Qwen3.8-Max 核心資料對比

模型狀態總/啟用參數上下文輸入價(未命中/命中,$/1M)輸出($/1M)協議
V4-Flash-0731官方(7/31)284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-Pro預覽版1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3權重開源(7/27)2.8T / ~104B~1.05M$3.00 / $0.30$15.00Modified MIT
GLM-5.2開源(6 月)~744B / ~40B1M本文未核實本文未核實MIT
Qwen3.8-MaxAPI GA(8/2)2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00承諾開源

以上定價均為廠商自報公開資料。DeepSeek 已預告 API 將在北京時間高峰時段(9–12 點、14–18 點)啟用 2 倍加價,截至發稿未公布具體生效日期。與 7 月 20 日 V4 GA 解讀相比,本篇聚焦 7/31 Flash 官方版與 Harness 首秀。

Flash 官方版對 Claude Opus 4.8:快取未命中輸入約便宜 36 倍,快取命中約 179 倍,輸出約 89 倍——廠商標價,非獨立審計。

03

效能怎麼「變出來」?後訓練、CSA+HCA 與 Harness Agent 框架

V4-Flash-0731 在參數規模與結構上與 4 月預覽版完全相同,官方說明提升完全來自後訓練重跑。284B/13B 的 Flash 在多項 Agent 基準上反而超過 1.6T/49B 的 V4-Pro 預覽版——2026 年下半年競爭焦點正從「堆參數」轉向「後訓練品質」。

01

混合注意力 CSA+HCA:壓縮稀疏注意力與高度壓縮注意力組合,對外稱 DSA,降低長上下文計算與顯存。

02

mHC 超連接:流形約束超連接改進殘差結構,提升深層穩定性。

03

Muon 優化器:替換傳統優化器,加速收斂;官方稱百萬 token 下 V4-Pro FLOPs 為 V3.2 的 27%,KV Cache 為 10%。

7 月 31 日 changelog 首次正式出現 DeepSeek Harness——對標 Claude Code 的自研 Agent 執行框架,用於讀寫檔案、呼叫工具與端到端工程任務。官方公布的 Terminal Bench 2.0、Toolathlon 等 Agent 跑分全部基於 Harness「極簡模式」測得,且框架尚未公開發佈。changelog 原話:跑分對 harness 選擇非常敏感,不能簡單等同於模型本身能力提升。

提示:Terminal Bench 2.0 官方報分 Flash-0731 為 82.7,V4-Pro 預覽版 67.9——參數為 max 檔位、top_p=0.95、temperature=1.0,屬廠商自報 + 特定框架結果。

04

中國開源大模型六邊形混戰:Artificial Analysis 指數與六步接入 Runbook

模型實驗室Intelligence Index單任務成本(AA)備註
V4-Flash-0731DeepSeek50$0.03官方版 7/31
Kimi K3月之暗面57$0.86指數更高,成本約 29 倍
GLM-5.2智譜高約 1 分本文未核實6 月開源
GPT-5.6 SolOpenAI高 9+ 分$1.86閉源
Claude Fable 5Anthropic高 9+ 分$3.15閉源

Intelligence Index 與單任務成本引自 Artificial Analysis(第三方),經財經媒體轉引;DeepSeek 自報 Agent 跑分方法論不同,不宜直接相加比較。DeepSeek 打的不是「跑分第一」,而是「夠用智慧 + 極致價格」——預覽版曾連續七週穩坐 OpenRouter 呼叫量第一。

01

確認接入點:model 設為 deepseek-v4-flashbase_url 保持 https://api.deepseek.com,OpenAI / Anthropic SDK 格式均可。

02

清理舊模型名:全庫搜尋 deepseek-chatdeepseek-reasoner,含 CI 環境變數與設定檔。

03

Staging 回歸:在預發環境切換模型名,對比 Agent 流水線輸出品質與延遲,記錄快取命中率。

04

最佳化 Prompt Cache:固定 System Prompt 置頂,最大化快取命中($0.0028/M 輸入)。

05

分層路由:輕量路由與批次任務走 Flash;複雜推理暫用 V4-Pro 預覽版,待官方版再評估。

06

監控 Harness 發佈:關注官方 changelog 與 Hugging Face 權重更新;Agent 跑分待 Harness 公開後做獨立複現。

05

跑分爭議、斬殺線與可引用硬數據:Pro 版還要等多久?

A

Harness 依賴:Agent 類跑分為廠商自報 + 未公開框架,宜等 Claude Code / Cursor 等獨立複現。

B

可用性反差:海外社群反饋快取命中率偏低、安全分類器偶發逾時——算力與工程細節仍限制上限。

C

「斬殺線」:中文開發者圈用語,指「夠用效能 + 極端低價」組合迫使友商要么明顯更強、要么更便宜才能生存;GPT-5.6 Luna 降價 80% 等動作與此背景相關。

7 月 31 日算力晶片股未明顯波動——市場已習慣「DeepSeek 式效率突破」,與 2025 年初 R1 引發晶片股大跌形成對比。多家媒體報導 DeepSeek 約 74 億美元融資與 IPO 籌備,目前多為「據報導」未經監管文件直接證實,宜作背景而非定論。

若你在本地用 ds4 跑 V4-Flash,96GB 統一記憶體是硬門檻;純 API 呼叫雖無本地硬體要求,但高頻 Agent 流水線仍需要 7×24 穩定宿主機。消費級 Mac 或低配 VPS 易出現 Swap 抖動與推理逾時;短期試用難以覆蓋百萬 token 壓測。對於更穩定、更適合 iOS CI/CD 與 AI Agent 自動化的生產環境,MESHLAUNCH 的 Mac Mini 雲端租用通常是更優解:獨占 Apple Silicon、按需升配統一記憶體、按天/週/月彈性下單。

常見問題

原生 1M 上下文;百萬 token 下 V4-Pro FLOPs 為 V3.2 的 27%,KV Cache 為 10%;Agent 專項最佳化並適配 Claude Code、OpenCode。定價對比見 租用價格頁

大規模低成本、批次與 Agent 流水線優先 V4-Flash-0731;更深推理且預算不敏感可暫用 V4-Pro 預覽版。

截至 2026-08-05 尚不能。官方版僅有 V4-Flash-0731 且限 API;8/10–8/20 GA 為未經證實的傳言。部署問題可參考 雲端幫助

SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 基於未公開 Harness,官方亦提示框架敏感,宜等社群複現。

OpenAI/Anthropic 格式無需改程式碼,deepseek-v4-flash 自動指向新官方版;須盡快棄用已停用的舊模型名。