DeepSeek V4 Flash 正式版發佈了什麼?從 4 月預覽到 7 月官方版時間線
這不是一次新模型發佈,而是同一個 284B 總參數 / 13B 啟用參數的 Flash 版本重新做了一遍後訓練。真正的旗艦 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍處於「即將發佈」狀態,沒有確切日期。
誤讀「新模型」:7/31 升級並非擴大參數量,官方明確效能提升完全來自後訓練重跑,與「更強=更大」的產業直覺相反。
API 與消費端割裂:正式版僅限 API 公測,App 與網頁端暫未同步——只看客戶端的使用者會誤以為「還沒更新」。
舊介面已停用:7 月 24 日 deepseek-chat / deepseek-reasoner 正式下線,未遷移的流水線會直接 404。
競爭窗口擠壓:7 月 27 日 Kimi K3(2.8T)開源權重上線,給 DeepSeek 的 Flash 官方版製造了直接對標壓力。
Pro 版仍「放空炮」風險:社群曾戲稱梁文鋒「梁白開」;Flash 超預期後情緒反轉,但 V4-Pro GA 仍無官方日期。
| 日期 | 事件 |
|---|---|
| 2026-04-24 | V4 預覽版開源:V4-Pro(1.6T/49B)與 V4-Flash(284B/13B),均 1M 上下文,MIT 協議 |
| 2026-07-24 | 舊模型名停用,流量切換至 V4 系列命名 |
| 2026-07-27 | Kimi K3 2.8T 權重上線 Hugging Face |
| 2026-07-31 | V4-Flash-0731 官方版 API 公測 + 權重同步;changelog 首次點名 Harness「即將發佈」 |
| 截至 2026-08-05 | V4-Pro 官方版仍「盡快發佈」;媒體援引的 8/10–8/20 GA 窗口未經官方證實 |
DeepSeek V4 Flash 定價多少?與 Kimi K3、Qwen3.8-Max 核心資料對比
| 模型 | 狀態 | 總/啟用參數 | 上下文 | 輸入價(未命中/命中,$/1M) | 輸出($/1M) | 協議 |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | 官方(7/31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| V4-Pro | 預覽版 | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 權重開源(7/27) | 2.8T / ~104B | ~1.05M | $3.00 / $0.30 | $15.00 | Modified MIT |
| GLM-5.2 | 開源(6 月) | ~744B / ~40B | 1M | 本文未核實 | 本文未核實 | MIT |
| Qwen3.8-Max | API GA(8/2) | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 承諾開源 |
以上定價均為廠商自報公開資料。DeepSeek 已預告 API 將在北京時間高峰時段(9–12 點、14–18 點)啟用 2 倍加價,截至發稿未公布具體生效日期。與 7 月 20 日 V4 GA 解讀相比,本篇聚焦 7/31 Flash 官方版與 Harness 首秀。
Flash 官方版對 Claude Opus 4.8:快取未命中輸入約便宜 36 倍,快取命中約 179 倍,輸出約 89 倍——廠商標價,非獨立審計。
效能怎麼「變出來」?後訓練、CSA+HCA 與 Harness Agent 框架
V4-Flash-0731 在參數規模與結構上與 4 月預覽版完全相同,官方說明提升完全來自後訓練重跑。284B/13B 的 Flash 在多項 Agent 基準上反而超過 1.6T/49B 的 V4-Pro 預覽版——2026 年下半年競爭焦點正從「堆參數」轉向「後訓練品質」。
混合注意力 CSA+HCA:壓縮稀疏注意力與高度壓縮注意力組合,對外稱 DSA,降低長上下文計算與顯存。
mHC 超連接:流形約束超連接改進殘差結構,提升深層穩定性。
Muon 優化器:替換傳統優化器,加速收斂;官方稱百萬 token 下 V4-Pro FLOPs 為 V3.2 的 27%,KV Cache 為 10%。
7 月 31 日 changelog 首次正式出現 DeepSeek Harness——對標 Claude Code 的自研 Agent 執行框架,用於讀寫檔案、呼叫工具與端到端工程任務。官方公布的 Terminal Bench 2.0、Toolathlon 等 Agent 跑分全部基於 Harness「極簡模式」測得,且框架尚未公開發佈。changelog 原話:跑分對 harness 選擇非常敏感,不能簡單等同於模型本身能力提升。
提示:Terminal Bench 2.0 官方報分 Flash-0731 為 82.7,V4-Pro 預覽版 67.9——參數為 max 檔位、top_p=0.95、temperature=1.0,屬廠商自報 + 特定框架結果。
中國開源大模型六邊形混戰:Artificial Analysis 指數與六步接入 Runbook
| 模型 | 實驗室 | Intelligence Index | 單任務成本(AA) | 備註 |
|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | $0.03 | 官方版 7/31 |
| Kimi K3 | 月之暗面 | 57 | $0.86 | 指數更高,成本約 29 倍 |
| GLM-5.2 | 智譜 | 高約 1 分 | 本文未核實 | 6 月開源 |
| GPT-5.6 Sol | OpenAI | 高 9+ 分 | $1.86 | 閉源 |
| Claude Fable 5 | Anthropic | 高 9+ 分 | $3.15 | 閉源 |
Intelligence Index 與單任務成本引自 Artificial Analysis(第三方),經財經媒體轉引;DeepSeek 自報 Agent 跑分方法論不同,不宜直接相加比較。DeepSeek 打的不是「跑分第一」,而是「夠用智慧 + 極致價格」——預覽版曾連續七週穩坐 OpenRouter 呼叫量第一。
確認接入點:將 model 設為 deepseek-v4-flash,base_url 保持 https://api.deepseek.com,OpenAI / Anthropic SDK 格式均可。
清理舊模型名:全庫搜尋 deepseek-chat、deepseek-reasoner,含 CI 環境變數與設定檔。
Staging 回歸:在預發環境切換模型名,對比 Agent 流水線輸出品質與延遲,記錄快取命中率。
最佳化 Prompt Cache:固定 System Prompt 置頂,最大化快取命中($0.0028/M 輸入)。
分層路由:輕量路由與批次任務走 Flash;複雜推理暫用 V4-Pro 預覽版,待官方版再評估。
監控 Harness 發佈:關注官方 changelog 與 Hugging Face 權重更新;Agent 跑分待 Harness 公開後做獨立複現。
跑分爭議、斬殺線與可引用硬數據:Pro 版還要等多久?
Harness 依賴:Agent 類跑分為廠商自報 + 未公開框架,宜等 Claude Code / Cursor 等獨立複現。
可用性反差:海外社群反饋快取命中率偏低、安全分類器偶發逾時——算力與工程細節仍限制上限。
「斬殺線」:中文開發者圈用語,指「夠用效能 + 極端低價」組合迫使友商要么明顯更強、要么更便宜才能生存;GPT-5.6 Luna 降價 80% 等動作與此背景相關。
7 月 31 日算力晶片股未明顯波動——市場已習慣「DeepSeek 式效率突破」,與 2025 年初 R1 引發晶片股大跌形成對比。多家媒體報導 DeepSeek 約 74 億美元融資與 IPO 籌備,目前多為「據報導」未經監管文件直接證實,宜作背景而非定論。
若你在本地用 ds4 跑 V4-Flash,96GB 統一記憶體是硬門檻;純 API 呼叫雖無本地硬體要求,但高頻 Agent 流水線仍需要 7×24 穩定宿主機。消費級 Mac 或低配 VPS 易出現 Swap 抖動與推理逾時;短期試用難以覆蓋百萬 token 壓測。對於更穩定、更適合 iOS CI/CD 與 AI Agent 自動化的生產環境,MESHLAUNCH 的 Mac Mini 雲端租用通常是更優解:獨占 Apple Silicon、按需升配統一記憶體、按天/週/月彈性下單。
原生 1M 上下文;百萬 token 下 V4-Pro FLOPs 為 V3.2 的 27%,KV Cache 為 10%;Agent 專項最佳化並適配 Claude Code、OpenCode。定價對比見 租用價格頁。
大規模低成本、批次與 Agent 流水線優先 V4-Flash-0731;更深推理且預算不敏感可暫用 V4-Pro 預覽版。
截至 2026-08-05 尚不能。官方版僅有 V4-Flash-0731 且限 API;8/10–8/20 GA 為未經證實的傳言。部署問題可參考 雲端幫助。
SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 基於未公開 Harness,官方亦提示框架敏感,宜等社群複現。
OpenAI/Anthropic 格式無需改程式碼,deepseek-v4-flash 自動指向新官方版;須盡快棄用已停用的舊模型名。