deepseek-chat、需要評估與 GPT-5.6 / Claude Fable 5 的性價比差距,或想在 7 月 24 日截止前完成 API 遷移,本文將回答:① 從預覽版到 GA 的完整時間線;② CSA+HCA 架構如何撐起 100 萬 token 上下文;③ Benchmark 跑分、峰谷價格表與六步遷移 Runbook。
DeepSeek V4 GA 今天發佈了什麼?從預覽版到滿血版時間線
2026 年 7 月 20 日,DeepSeek V4 滿血版(General Availability)正式上線。這不是全新架構——4 月 24 日已開源的 MoE 設計保持不變——而是預覽版在穩定性、效能最佳化與商業化計費上的畢業版本。滿血版在 Agent 能力、數學推理和程式碼生成上做了專項提升,同時配套正式的商業化計費體系,標誌著 DeepSeek 從「近乎免費」邁向有紀律的商業化營運。
| 時間 | 事件 |
|---|---|
| 2026-04-24 | V4 預覽版上線 + 開源(MIT),含 V4-Pro(1.6T)和 V4-Flash(284B) |
| 2026-05 | V4-Flash 與 V4-Pro 生產調校版本上線,API 正式可用 |
| 2026-06 | V4-Pro 價格永久降價 75%(輸出價 $0.87/M tokens) |
| 2026-06-29 | 向全體 API 用戶發郵件,宣布 GA 將於 7 月中旬上線,首次披露峰谷計費 |
| 2026-07-19 | 多位開發者獲得 GA 灰度內測資格 |
| 2026-07-20 | GA 正式版上線(本文發佈日) |
| 2026-07-24 | 舊介面名 deepseek-chat 與 deepseek-reasoner 永久下線 |
遷移緊迫性:舊模型名 deepseek-chat / deepseek-reasoner 將於 7 月 24 日 23:59(北京時間)永久停止,正式環境須 4 天內完成切換。
計費複雜度上升:GA 首次引入峰谷差異化定價,工作日 09:00–12:00 和 14:00–18:00 費率翻倍,7×24 流水線需重新排程。
效能預期管理:滿血版尚不能全面擊敗 Claude Fable 5 或 GPT-5.6 Ultra,但以 1/10 乃至 1/100 成本提供開源最強效能。
自託管門檻:雖 MIT 開源,但 V4-Pro 1.6T 參數對本地硬體要求極高,多數團隊仍依賴 API 或雲端高配 Mac 推理節點。
與 Kimi K3 競爭:Kimi K3 以 2.8T 參數衝擊規模紀錄,DeepSeek 以性價比與成熟 API 生態守住開發者基本盤。
DeepSeek V4 架構解析與 Benchmark 跑分全表
DeepSeek V4 捨棄 V2/V3 時代的多頭潛在注意力(MLA),採用 CSA(壓縮稀疏注意力)與 HCA(重度壓縮注意力)混合體,在 1M token 場景下 KV 快取記憶體僅為 V3.2 的 10%(V4-Flash 低至 7%),推理 FLOPs 僅需 V3.2 的 27%。mHC(流形約束超連接)以 4 通道殘差流穩定 61 層深網路;訓練採用 Muon 最佳化器替代 AdamW。
| 規格 | V4-Pro | V4-Flash |
|---|---|---|
| 總參數量 | 1.6 萬億(1.6T) | 2840 億(284B) |
| 每 Token 啟用 | 490 億(49B) | 130 億(13B) |
| Transformer 層數 | 61 層 | 43 層 |
| 上下文視窗 | 1,000,000 tokens | 1,000,000 tokens |
| 最大輸出 | 384K tokens | 384K tokens |
| 精度 | FP4(專家)+ FP8 | FP4 + FP8 混合 |
| 預訓練資料 | 33T+ tokens | 32T+ tokens |
| 開源協議 | MIT | MIT |
三種推理模式:Non-think(極速,無思維鏈)、Think High(顯式推理,適合程式碼除錯)、Think Max(最大推理力度,需 384K+ 上下文,適合複雜數學與長鏈路 Agent)。官方推薦取樣參數:temperature=1.0, top_p=1.0。
| 基準測試 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ 開源最高 | 96.0% | 未單獨公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
Artificial Analysis 資料顯示:Claude Fable 5 在 Strategy & Ops 任務每次花費 $3.48(50 分),DeepSeek V4-Pro 僅 $0.03(38 分)——成本相差 116 倍,得分差距約 12 分。
DeepSeek V4 對比 GPT-5.6 和 Claude Fable 5 怎麼選?
| 維度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 開源 / 自託管 | ✅ MIT | ❌ 閉源 | ❌ 閉源 |
| 上下文視窗 | 1M tokens | 未公開 | 1M tokens |
| 程式碼能力 | 極強(接近 Fable 5) | 極強 | 最強(SWE-bench Pro 80.3%) |
| API 輸出價(平時) | $0.87/M | ~$15/M | ~$50/M |
| 峰值輸出價 | $1.74/M | — | — |
| Agent 能力 | 強,支援多 Agent 編排 | 強 | 最強 |
| 資料隱私 | ✅ 可私有部署 | ❌ | ❌ |
預算有限 / 高頻呼叫 / 私有部署 → V4-Pro 或 V4-Flash;極致程式碼能力、不在乎成本 → Claude Fable 5;複雜演算法 + 數學推理 → GPT-5.6 Sol / Ultra;超大規模日誌/文件處理 → V4-Flash(快取命中輸入僅 $0.0028/M)。
峰谷計費怎麼省錢?API 遷移六步 Runbook(7/24 截止)
| 模型 | 計費項 | 平時(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 輸入(快取命中) | ¥0.025 / $0.0035 / 1M | 翻倍 |
| 輸入(快取未命中) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 輸出 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 輸入(快取命中) | ¥0.02 / $0.0028 / 1M | 翻倍 |
| 輸入(快取未命中) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 輸出 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
高峰時段(北京時間):工作日 09:00–12:00 和 14:00–18:00。即使在高峰期,V4-Pro 輸出價($1.74/M)仍比 Claude Opus 4.8($15/M)便宜 8.6 倍。
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
截止警告:deepseek-chat → deepseek-v4-flash(非思考);deepseek-reasoner → deepseek-v4-flash(思考模式)或 deepseek-v4-pro。7 月 24 日 15:59 UTC 後永久失效。
全庫搜尋舊模型名:在程式碼庫中搜尋 deepseek-chat 和 deepseek-reasoner,含環境變數與設定檔。
確定遷移對應:輕量對話 → deepseek-v4-flash;複雜推理 → deepseek-v4-pro + thinking 參數。
Staging 環境驗證:在預備環境切換模型名,跑迴歸測試集確認輸出品質無退化。
設定 Prompt Cache:將固定 System Prompt 置於訊息首部,最大化快取命中率(Flash 命中僅 $0.0028/M)。
排程非即時任務:批次文件處理、程式碼審查等安排在 18:00 後或 09:00 前,避開峰谷高峰。
正式環境灰度上線:7 月 23 日前完成全量切換,預留 24 小時回滾視窗;關注 DeepSeek 計費變更郵件通知。
DeepSeek V4 滿血版值得升級嗎?可引用硬數據
CSA 壓縮比:KV 序列經 Softmax 門控池化壓縮 4 倍,V4-Pro top-1024 / V4-Flash top-512 稀疏選擇 + 128 token 滑動視窗。
HCA 全域注意力:Token 壓縮 128 倍後做全域密集注意力,與 CSA 交替使用,擷取長程依賴。
性價比錨點:V4-Flash 六類指數任務每次均低於 $0.04;V4-Pro 輸出 $0.87/M 為 6 月永久降價 75% 後的定格價。
DeepSeek V4 GA 是 2026 年開源大模型領域最重要的里程碑之一。其價值不在於能否擊敗閉源旗艦,而在於以極低成本提供開源最強效能。對於不想資料出境的企業、預算有限的獨立開發者、需要 1M token 上下文的 Agent 工程師,V4-Pro 是目前最均衡的選擇。
若你計畫在本地或雲端自託管 V4-Flash 做 Agent 路由與推理分流,消費級 Mac 的 16GB 記憶體遠遠不夠——ds4 本地推理 文件顯示 V4-Flash 至少需要 96GB 統一記憶體。純 API 呼叫雖無硬體門檻,但高頻 Agent 流水線對主機穩定性與 7×24 在線仍有要求:自建 VPS 缺乏 Metal 加速、Swap 抖動會導致推理逾時;短期試用難以覆蓋長上下文壓測。對於更穩定、更適合 iOS CI/CD 與 AI Agent 自動化的正式環境,MESHLAUNCH 的 Mac Mini 雲端租用通常是更優解:獨占 Apple Silicon、按需升配至 64GB+ 統一記憶體、7×24 在線、按天/週/月彈性下單。
工作日北京時間 09:00–12:00 和 14:00–18:00 為高峰,費率翻倍。批次任務建議 18:00 後執行,詳見 租用價格頁 了解雲端推理節點方案。
2026 年 7 月 24 日 15:59 UTC(北京時間 23:59)永久下線。須遷移至 deepseek-v4-flash 或 deepseek-v4-pro。
Pro 適合複雜推理與 Agent;Flash 適合輕量路由,快取命中輸入僅 $0.0028/M。本地部署門檻可參考 幫助中心。
最難基準上 Fable 5 仍領先;但 V4-Pro SWE-bench Verified 80.6% 為開源紀錄,輸出價約為 GPT-5.6 Sol 的 1/17。
支援。V4-Pro 與 V4-Flash 均以 MIT 協議開源,可私有部署滿足資料不出境合規需求。伺服器規格與頻寬規劃見 雲端說明中心。