deepseek-chat、需要评估与 GPT-5.6 / Claude Fable 5 的性价比差距,或想在 7 月 24 日截止前完成 API 迁移,本文将回答:① 从预览版到 GA 的完整时间线;② CSA+HCA 架构如何撑起 100 万 token 上下文;③ Benchmark 跑分、峰谷价格表与六步迁移 Runbook。
DeepSeek V4 GA 今天发布了什么?从预览版到满血版时间线
2026 年 7 月 20 日,DeepSeek V4 满血版(General Availability)正式上线。这不是全新架构——4 月 24 日已开源的 MoE 设计保持不变——而是预览版在稳定性、性能优化与商业化计费上的毕业版本。满血版在 Agent 能力、数学推理和代码生成上做了专项提升,同时配套正式的商业化计费体系,标志着 DeepSeek 从「近乎免费」迈向有纪律的商业化运营。
| 时间 | 事件 |
|---|---|
| 2026-04-24 | V4 预览版上线 + 开源(MIT),含 V4-Pro(1.6T)和 V4-Flash(284B) |
| 2026-05 | V4-Flash 与 V4-Pro 生产调优版本上线,API 正式可用 |
| 2026-06 | V4-Pro 价格永久降价 75%(输出价 $0.87/M tokens) |
| 2026-06-29 | 向全体 API 用户发邮件,宣布 GA 将于 7 月中旬上线,首次披露峰谷计费 |
| 2026-07-19 | 多位开发者获得 GA 灰度内测资格 |
| 2026-07-20 | GA 正式版上线(本文发布日) |
| 2026-07-24 | 旧接口名 deepseek-chat 与 deepseek-reasoner 永久下线 |
迁移紧迫性:旧模型名 deepseek-chat / deepseek-reasoner 将于 7 月 24 日 23:59(北京时间)永久停止,生产环境须 4 天内完成切换。
计费复杂度上升:GA 首次引入峰谷差异化定价,工作日 09:00–12:00 和 14:00–18:00 费率翻倍,24/7 流水线需重新排期。
性能预期管理:满血版尚不能全面击败 Claude Fable 5 或 GPT-5.6 Ultra,但以 1/10 乃至 1/100 成本提供开源最强性能。
自托管门槛:虽 MIT 开源,但 V4-Pro 1.6T 参数对本地硬件要求极高,多数团队仍依赖 API 或云端高配 Mac 推理节点。
与 Kimi K3 竞争:Kimi K3 以 2.8T 参数冲击规模纪录,DeepSeek 以性价比与成熟 API 生态守住开发者基本盘。
DeepSeek V4 架构解析与 Benchmark 跑分全表
DeepSeek V4 抛弃 V2/V3 时代的多头潜在注意力(MLA),采用 CSA(压缩稀疏注意力)与 HCA(重度压缩注意力)混合体,在 1M token 场景下 KV Cache 内存仅为 V3.2 的 10%(V4-Flash 低至 7%),推理 FLOPs 仅需 V3.2 的 27%。mHC(流形约束超连接)以 4 通道残差流稳定 61 层深网络;训练采用 Muon 优化器替代 AdamW。
| 规格 | V4-Pro | V4-Flash |
|---|---|---|
| 总参数量 | 1.6 万亿(1.6T) | 2840 亿(284B) |
| 每 Token 激活 | 490 亿(49B) | 130 亿(13B) |
| Transformer 层数 | 61 层 | 43 层 |
| 上下文窗口 | 1,000,000 tokens | 1,000,000 tokens |
| 最大输出 | 384K tokens | 384K tokens |
| 精度 | FP4(专家)+ FP8 | FP4 + FP8 混合 |
| 预训练数据 | 33T+ tokens | 32T+ tokens |
| 开源协议 | MIT | MIT |
三种推理模式:Non-think(极速,无思维链)、Think High(显式推理,适合代码调试)、Think Max(最大推理力度,需 384K+ 上下文,适合复杂数学与长链路 Agent)。官方推荐采样参数:temperature=1.0, top_p=1.0。
| 基准测试 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ 开源最高 | 96.0% | 未单独公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
Artificial Analysis 数据显示:Claude Fable 5 在 Strategy & Ops 任务每次花费 $3.48(50 分),DeepSeek V4-Pro 仅 $0.03(38 分)——成本相差 116 倍,得分差距约 12 分。
DeepSeek V4 对比 GPT-5.6 和 Claude Fable 5 怎么选?
| 维度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 开源 / 自托管 | ✅ MIT | ❌ 闭源 | ❌ 闭源 |
| 上下文窗口 | 1M tokens | 未公开 | 1M tokens |
| 代码能力 | 极强(接近 Fable 5) | 极强 | 最强(SWE-bench Pro 80.3%) |
| API 输出价(平时) | $0.87/M | ~$15/M | ~$50/M |
| 峰值输出价 | $1.74/M | — | — |
| Agent 能力 | 强,支持多 Agent 编排 | 强 | 最强 |
| 数据隐私 | ✅ 可私有部署 | ❌ | ❌ |
预算有限 / 高频调用 / 私有部署 → V4-Pro 或 V4-Flash;极致代码能力、不在乎成本 → Claude Fable 5;复杂算法 + 数学推理 → GPT-5.6 Sol / Ultra;超大规模日志/文档处理 → V4-Flash(缓存命中输入仅 $0.0028/M)。
峰谷计费怎么省钱?API 迁移六步 Runbook(7/24 截止)
| 模型 | 计费项 | 平时(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 输入(缓存命中) | ¥0.025 / $0.0035 / 1M | 翻倍 |
| 输入(缓存未命中) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 输出 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 输入(缓存命中) | ¥0.02 / $0.0028 / 1M | 翻倍 |
| 输入(缓存未命中) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 输出 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
高峰时段(北京时间):工作日 09:00–12:00 和 14:00–18:00。即使在高峰期,V4-Pro 输出价($1.74/M)仍比 Claude Opus 4.8($15/M)便宜 8.6 倍。
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
截止警告:deepseek-chat → deepseek-v4-flash(非思考);deepseek-reasoner → deepseek-v4-flash(思考模式)或 deepseek-v4-pro。7 月 24 日 15:59 UTC 后永久失效。
全库搜索旧模型名:在代码库中搜索 deepseek-chat 和 deepseek-reasoner,含环境变量与配置文件。
确定迁移映射:轻量对话 → deepseek-v4-flash;复杂推理 → deepseek-v4-pro + thinking 参数。
Staging 环境验证:在预发环境切换模型名,跑回归测试集确认输出质量无退化。
配置 Prompt Cache:将固定 System Prompt 置于消息首部,最大化缓存命中率(Flash 命中仅 $0.0028/M)。
排期非实时任务:批量文档处理、代码审查等安排在 18:00 后或 09:00 前,避开峰谷高峰。
生产灰度上线:7 月 23 日前完成全量切换,预留 24 小时回滚窗口;关注 DeepSeek 计费变更邮件通知。
DeepSeek V4 满血版值得升级吗?可引用硬数据
CSA 压缩比:KV 序列经 Softmax 门控池化压缩 4 倍,V4-Pro top-1024 / V4-Flash top-512 稀疏选择 + 128 token 滑动窗口。
HCA 全局注意力:Token 压缩 128 倍后做全局密集注意力,与 CSA 交替使用,捕获长程依赖。
性价比锚点:V4-Flash 六类指数任务每次均低于 $0.04;V4-Pro 输出 $0.87/M 为 6 月永久降价 75% 后的定格价。
DeepSeek V4 GA 是 2026 年开源大模型领域最重要的里程碑之一。其价值不在于能否击败闭源旗舰,而在于以极低成本提供开源最强性能。对于不想数据出境的企业、预算有限的独立开发者、需要 1M token 上下文的 Agent 工程师,V4-Pro 是目前最均衡的选择。
若你计划在本地或云端自托管 V4-Flash 做 Agent 路由与推理分流,消费级 Mac 的 16GB 内存远不够用——ds4 本地推理 文档显示 V4-Flash 至少需要 96GB 统一内存。纯 API 调用虽无硬件门槛,但高频 Agent 流水线对宿主机稳定性与 7×24 在线仍有要求:自建 VPS 缺乏 Metal 加速、Swap 抖动会导致推理超时;短期试用难以覆盖长上下文压测。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,MESHLAUNCH 的 Mac Mini 云端租赁通常是更优解:独占 Apple Silicon、按需升配至 64GB+ 统一内存、7×24 在线、按天/周/月弹性下单。
工作日北京时间 09:00–12:00 和 14:00–18:00 为高峰,费率翻倍。批量任务建议 18:00 后运行,详见 租赁价格页 了解云端推理节点方案。
2026 年 7 月 24 日 15:59 UTC(北京时间 23:59)永久下线。须迁移至 deepseek-v4-flash 或 deepseek-v4-pro。
Pro 适合复杂推理与 Agent;Flash 适合轻量路由,缓存命中输入仅 $0.0028/M。本地部署门槛可参考 帮助中心。
最难基准上 Fable 5 仍领先;但 V4-Pro SWE-bench Verified 80.6% 为开源纪录,输出价约为 GPT-5.6 Sol 的 1/17。
支持。V4 同时兼容 OpenAI ChatCompletions 与 Anthropic Messages 格式,base_url 保持 https://api.deepseek.com,仅更新 model 参数即可。