DeepSeek V4 Flash 正式版发布了什么?从 4 月预览到 7 月官方版时间线
这不是一次新模型发布,而是同一个 284B 总参数 / 13B 激活参数的 Flash 版本重新做了一遍后训练。真正的旗舰 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍处于「即将发布」状态,没有确切日期。
误读「新模型」:7/31 升级并非扩大参数量,官方明确性能提升完全来自后训练重跑,与「更强=更大」的行业直觉相反。
API 与消费端割裂:正式版仅限 API 公测,App 与网页端暂未同步——只看客户端的用户会误以为「还没更新」。
旧接口已停用:7 月 24 日 deepseek-chat / deepseek-reasoner 正式下线,未迁移的流水线会直接 404。
竞争窗口挤压:7 月 27 日 Kimi K3(2.8T)开源权重上线,给 DeepSeek 的 Flash 官方版制造了直接对标压力。
Pro 版仍「放空炮」风险:社区曾戏称梁文锋「梁白开」;Flash 超预期后情绪反转,但 V4-Pro GA 仍无官方日期。
| 日期 | 事件 |
|---|---|
| 2026-04-24 | V4 预览版开源:V4-Pro(1.6T/49B)与 V4-Flash(284B/13B),均 1M 上下文,MIT 协议 |
| 2026-07-24 | 旧模型名停用,流量切换至 V4 系列命名 |
| 2026-07-27 | Kimi K3 2.8T 权重上线 Hugging Face |
| 2026-07-31 | V4-Flash-0731 官方版 API 公测 + 权重同步;changelog 首次点名 Harness「即将发布」 |
| 截至 2026-08-05 | V4-Pro 官方版仍「尽快发布」;媒体援引的 8/10–8/20 GA 窗口未经官方证实 |
DeepSeek V4 Flash 定价多少?与 Kimi K3、Qwen3.8-Max 核心数据对比
| 模型 | 状态 | 总/激活参数 | 上下文 | 输入价(未命中/命中,$/1M) | 输出($/1M) | 协议 |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | 官方(7/31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| V4-Pro | 预览版 | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 权重开源(7/27) | 2.8T / ~104B | ~1.05M | $3.00 / $0.30 | $15.00 | Modified MIT |
| GLM-5.2 | 开源(6 月) | ~744B / ~40B | 1M | 本文未核实 | 本文未核实 | MIT |
| Qwen3.8-Max | API GA(8/2) | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 承诺开源 |
以上定价均为厂商自报公开数据。DeepSeek 已预告 API 将在北京时间高峰时段(9–12 点、14–18 点)启用 2 倍加价,截至发稿未公布具体生效日期。与 7 月 20 日 V4 GA 解读相比,本篇聚焦 7/31 Flash 官方版与 Harness 首秀。
Flash 官方版对 Claude Opus 4.8:缓存未命中输入约便宜 36 倍,缓存命中约 179 倍,输出约 89 倍——厂商标价,非独立审计。
性能怎么「变出来」?后训练、CSA+HCA 与 Harness Agent 框架
V4-Flash-0731 在参数规模与结构上与 4 月预览版完全相同,官方说明提升完全来自后训练重跑。284B/13B 的 Flash 在多项 Agent 基准上反而超过 1.6T/49B 的 V4-Pro 预览版——2026 年下半年竞争焦点正从「堆参数」转向「后训练质量」。
混合注意力 CSA+HCA:压缩稀疏注意力与高度压缩注意力组合,对外称 DSA,降低长上下文计算与显存。
mHC 超连接:流形约束超连接改进残差结构,提升深层稳定性。
Muon 优化器:替换传统优化器,加速收敛;官方称百万 token 下 V4-Pro FLOPs 为 V3.2 的 27%,KV Cache 为 10%。
7 月 31 日 changelog 首次正式出现 DeepSeek Harness——对标 Claude Code 的自研 Agent 执行框架,用于读写文件、调用工具与端到端工程任务。官方公布的 Terminal Bench 2.0、Toolathlon 等 Agent 跑分全部基于 Harness「极简模式」测得,且框架尚未公开发布。changelog 原话:跑分对 harness 选择非常敏感,不能简单等同于模型本身能力提升。
提示:Terminal Bench 2.0 官方报分 Flash-0731 为 82.7,V4-Pro 预览版 67.9——参数为 max 档位、top_p=0.95、temperature=1.0,属厂商自报 + 特定框架结果。
中国开源大模型六边形混战:Artificial Analysis 指数与六步接入 Runbook
| 模型 | 实验室 | Intelligence Index | 单任务成本(AA) | 备注 |
|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | $0.03 | 官方版 7/31 |
| Kimi K3 | 月之暗面 | 57 | $0.86 | 指数更高,成本约 29 倍 |
| GLM-5.2 | 智谱 | 高约 1 分 | 本文未核实 | 6 月开源 |
| GPT-5.6 Sol | OpenAI | 高 9+ 分 | $1.86 | 闭源 |
| Claude Fable 5 | Anthropic | 高 9+ 分 | $3.15 | 闭源 |
Intelligence Index 与单任务成本引自 Artificial Analysis(第三方),经财经媒体转引;DeepSeek 自报 Agent 跑分方法论不同,不宜直接相加比较。DeepSeek 打的不是「跑分第一」,而是「够用智能 + 极致价格」——预览版曾连续七周稳坐 OpenRouter 调用量第一。
确认接入点:将 model 设为 deepseek-v4-flash,base_url 保持 https://api.deepseek.com,OpenAI / Anthropic SDK 格式均可。
清理旧模型名:全库搜索 deepseek-chat、deepseek-reasoner,含 CI 环境变量与配置文件。
Staging 回归:在预发环境切换模型名,对比 Agent 流水线输出质量与延迟,记录缓存命中率。
优化 Prompt Cache:固定 System Prompt 置顶,最大化缓存命中($0.0028/M 输入)。
分层路由:轻量路由与批量任务走 Flash;复杂推理暂用 V4-Pro 预览版,待官方版再评估。
监控 Harness 发布:关注官方 changelog 与 Hugging Face 权重更新;Agent 跑分待 Harness 公开后做独立复现。
跑分争议、斩杀线与可引用硬数据:Pro 版还要等多久?
Harness 依赖:Agent 类跑分为厂商自报 + 未公开框架,宜等 Claude Code / Cursor 等独立复现。
可用性反差:海外社区反馈缓存命中率偏低、安全分类器偶发超时——算力与工程细节仍限制上限。
「斩杀线」:中文开发者圈用语,指「够用性能 + 极端低价」组合迫使友商要么明显更强、要么更便宜才能生存;GPT-5.6 Luna 降价 80% 等动作与此背景相关。
7 月 31 日算力芯片股未明显波动——市场已习惯「DeepSeek 式效率突破」,与 2025 年初 R1 引发芯片股大跌形成对比。多家媒体报道 DeepSeek 约 74 亿美元融资与 IPO 筹备,目前多为「据报道」未经监管文件直接证实,宜作背景而非定论。
若你在本地用 ds4 跑 V4-Flash,96GB 统一内存是硬门槛;纯 API 调用虽无本地硬件要求,但高频 Agent 流水线仍需要 7×24 稳定宿主机。消费级 Mac 或低配 VPS 易出现 Swap 抖动与推理超时;短期试用难以覆盖百万 token 压测。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,MESHLAUNCH 的 Mac Mini 云端租赁通常是更优解:独占 Apple Silicon、按需升配统一内存、按天/周/月弹性下单。
原生 1M 上下文;百万 token 下 V4-Pro FLOPs 为 V3.2 的 27%,KV Cache 为 10%;Agent 专项优化并适配 Claude Code、OpenCode。定价对比见 租赁价格页。
大规模低成本、批量与 Agent 流水线优先 V4-Flash-0731;更深推理且预算不敏感可暂用 V4-Pro 预览版。
截至 2026-08-05 尚不能。官方版仅有 V4-Flash-0731 且限 API;8/10–8/20 GA 为未经证实的传言。部署问题可参考 帮助中心。
SWE-bench Verified 等第三方基准可信度较高;Terminal Bench 2.0 基于未公开 Harness,官方亦提示框架敏感,宜等社区复现。
OpenAI/Anthropic 格式无需改代码,deepseek-v4-flash 自动指向新官方版;须尽快弃用已停用的旧模型名。