DeepSeek V4 Flash正式版上线
跑分逼近 Opus 4.8,价格却只要几十分之一

7/31 官方版 · 后训练逆袭 · Harness 首秀 · 六边形混战 · 斩杀线 · 六步 Runbook

DeepSeek V4 Flash 0731 正式版评测 2026
7 月 31 日,DeepSeek 将 V4-Flash 升级为官方版 0731:参数规模不变,仅重训后训练,却在多项 Agent 基准上反超自家更大的 V4-Pro 预览版,API 价格约为 Claude Opus 4.8 的几十分之一。若你关心旗舰 V4-Pro 官方版与自研 Agent 框架 Harness 何时落地、跑分能否相信、与 Kimi K3 / Qwen3.8-Max 如何横评,本文将回答:① 从 4 月预览到 7 月「官方版」的完整时间线;② 定价与 Artificial Analysis 第三方指数对照;③ 后训练如何「变出」性能与六步接入 Runbook。
01

DeepSeek V4 Flash 正式版发布了什么?从 4 月预览到 7 月官方版时间线

这不是一次新模型发布,而是同一个 284B 总参数 / 13B 激活参数的 Flash 版本重新做了一遍后训练。真正的旗舰 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍处于「即将发布」状态,没有确切日期。

01

误读「新模型」:7/31 升级并非扩大参数量,官方明确性能提升完全来自后训练重跑,与「更强=更大」的行业直觉相反。

02

API 与消费端割裂:正式版仅限 API 公测,App 与网页端暂未同步——只看客户端的用户会误以为「还没更新」。

03

旧接口已停用:7 月 24 日 deepseek-chat / deepseek-reasoner 正式下线,未迁移的流水线会直接 404。

04

竞争窗口挤压:7 月 27 日 Kimi K3(2.8T)开源权重上线,给 DeepSeek 的 Flash 官方版制造了直接对标压力。

05

Pro 版仍「放空炮」风险:社区曾戏称梁文锋「梁白开」;Flash 超预期后情绪反转,但 V4-Pro GA 仍无官方日期。

日期事件
2026-04-24V4 预览版开源:V4-Pro(1.6T/49B)与 V4-Flash(284B/13B),均 1M 上下文,MIT 协议
2026-07-24旧模型名停用,流量切换至 V4 系列命名
2026-07-27Kimi K3 2.8T 权重上线 Hugging Face
2026-07-31V4-Flash-0731 官方版 API 公测 + 权重同步;changelog 首次点名 Harness「即将发布」
截至 2026-08-05V4-Pro 官方版仍「尽快发布」;媒体援引的 8/10–8/20 GA 窗口未经官方证实
02

DeepSeek V4 Flash 定价多少?与 Kimi K3、Qwen3.8-Max 核心数据对比

模型状态总/激活参数上下文输入价(未命中/命中,$/1M)输出($/1M)协议
V4-Flash-0731官方(7/31)284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-Pro预览版1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3权重开源(7/27)2.8T / ~104B~1.05M$3.00 / $0.30$15.00Modified MIT
GLM-5.2开源(6 月)~744B / ~40B1M本文未核实本文未核实MIT
Qwen3.8-MaxAPI GA(8/2)2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00承诺开源

以上定价均为厂商自报公开数据。DeepSeek 已预告 API 将在北京时间高峰时段(9–12 点、14–18 点)启用 2 倍加价,截至发稿未公布具体生效日期。与 7 月 20 日 V4 GA 解读相比,本篇聚焦 7/31 Flash 官方版与 Harness 首秀。

Flash 官方版对 Claude Opus 4.8:缓存未命中输入约便宜 36 倍,缓存命中约 179 倍,输出约 89 倍——厂商标价,非独立审计。

03

性能怎么「变出来」?后训练、CSA+HCA 与 Harness Agent 框架

V4-Flash-0731 在参数规模与结构上与 4 月预览版完全相同,官方说明提升完全来自后训练重跑。284B/13B 的 Flash 在多项 Agent 基准上反而超过 1.6T/49B 的 V4-Pro 预览版——2026 年下半年竞争焦点正从「堆参数」转向「后训练质量」。

01

混合注意力 CSA+HCA:压缩稀疏注意力与高度压缩注意力组合,对外称 DSA,降低长上下文计算与显存。

02

mHC 超连接:流形约束超连接改进残差结构,提升深层稳定性。

03

Muon 优化器:替换传统优化器,加速收敛;官方称百万 token 下 V4-Pro FLOPs 为 V3.2 的 27%,KV Cache 为 10%。

7 月 31 日 changelog 首次正式出现 DeepSeek Harness——对标 Claude Code 的自研 Agent 执行框架,用于读写文件、调用工具与端到端工程任务。官方公布的 Terminal Bench 2.0、Toolathlon 等 Agent 跑分全部基于 Harness「极简模式」测得,且框架尚未公开发布。changelog 原话:跑分对 harness 选择非常敏感,不能简单等同于模型本身能力提升。

提示:Terminal Bench 2.0 官方报分 Flash-0731 为 82.7,V4-Pro 预览版 67.9——参数为 max 档位、top_p=0.95、temperature=1.0,属厂商自报 + 特定框架结果。

04

中国开源大模型六边形混战:Artificial Analysis 指数与六步接入 Runbook

模型实验室Intelligence Index单任务成本(AA)备注
V4-Flash-0731DeepSeek50$0.03官方版 7/31
Kimi K3月之暗面57$0.86指数更高,成本约 29 倍
GLM-5.2智谱高约 1 分本文未核实6 月开源
GPT-5.6 SolOpenAI高 9+ 分$1.86闭源
Claude Fable 5Anthropic高 9+ 分$3.15闭源

Intelligence Index 与单任务成本引自 Artificial Analysis(第三方),经财经媒体转引;DeepSeek 自报 Agent 跑分方法论不同,不宜直接相加比较。DeepSeek 打的不是「跑分第一」,而是「够用智能 + 极致价格」——预览版曾连续七周稳坐 OpenRouter 调用量第一。

01

确认接入点:model 设为 deepseek-v4-flashbase_url 保持 https://api.deepseek.com,OpenAI / Anthropic SDK 格式均可。

02

清理旧模型名:全库搜索 deepseek-chatdeepseek-reasoner,含 CI 环境变量与配置文件。

03

Staging 回归:在预发环境切换模型名,对比 Agent 流水线输出质量与延迟,记录缓存命中率。

04

优化 Prompt Cache:固定 System Prompt 置顶,最大化缓存命中($0.0028/M 输入)。

05

分层路由:轻量路由与批量任务走 Flash;复杂推理暂用 V4-Pro 预览版,待官方版再评估。

06

监控 Harness 发布:关注官方 changelog 与 Hugging Face 权重更新;Agent 跑分待 Harness 公开后做独立复现。

05

跑分争议、斩杀线与可引用硬数据:Pro 版还要等多久?

A

Harness 依赖:Agent 类跑分为厂商自报 + 未公开框架,宜等 Claude Code / Cursor 等独立复现。

B

可用性反差:海外社区反馈缓存命中率偏低、安全分类器偶发超时——算力与工程细节仍限制上限。

C

「斩杀线」:中文开发者圈用语,指「够用性能 + 极端低价」组合迫使友商要么明显更强、要么更便宜才能生存;GPT-5.6 Luna 降价 80% 等动作与此背景相关。

7 月 31 日算力芯片股未明显波动——市场已习惯「DeepSeek 式效率突破」,与 2025 年初 R1 引发芯片股大跌形成对比。多家媒体报道 DeepSeek 约 74 亿美元融资与 IPO 筹备,目前多为「据报道」未经监管文件直接证实,宜作背景而非定论。

若你在本地用 ds4 跑 V4-Flash,96GB 统一内存是硬门槛;纯 API 调用虽无本地硬件要求,但高频 Agent 流水线仍需要 7×24 稳定宿主机。消费级 Mac 或低配 VPS 易出现 Swap 抖动与推理超时;短期试用难以覆盖百万 token 压测。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,MESHLAUNCH 的 Mac Mini 云端租赁通常是更优解:独占 Apple Silicon、按需升配统一内存、按天/周/月弹性下单。

常见问题

原生 1M 上下文;百万 token 下 V4-Pro FLOPs 为 V3.2 的 27%,KV Cache 为 10%;Agent 专项优化并适配 Claude Code、OpenCode。定价对比见 租赁价格页

大规模低成本、批量与 Agent 流水线优先 V4-Flash-0731;更深推理且预算不敏感可暂用 V4-Pro 预览版。

截至 2026-08-05 尚不能。官方版仅有 V4-Flash-0731 且限 API;8/10–8/20 GA 为未经证实的传言。部署问题可参考 帮助中心

SWE-bench Verified 等第三方基准可信度较高;Terminal Bench 2.0 基于未公开 Harness,官方亦提示框架敏感,宜等社区复现。

OpenAI/Anthropic 格式无需改代码,deepseek-v4-flash 自动指向新官方版;须尽快弃用已停用的旧模型名。