DeepSeek V4-Flash-0731: правда ли в 100 раз дешевле
Claude? Разбор официальных бенчмарков

Официальный билд 31.07 · post-training · Harness · kill line · шестишаговый runbook

DeepSeek V4-Flash-0731 официальные бенчмарки август 2026
31 июля 2026 DeepSeek перевёл V4-Flash-0731 в статус официального API-билда: та же 284B-архитектура, что в апрельском preview, но полный rerun post-training теперь обходит собственный V4-Pro preview на agent-бенчмарках — при list price примерно 1/36–1/179 от Claude Opus 4.8. Нужны чёткий timeline, честная оценка устойчивости scores и сравнение с Kimi K3 и Qwen3.8-Max — здесь: ① что реально вышло versus «coming soon»; ② vendor pricing против индексов Artificial Analysis; ③ шестишаговый adoption runbook по данным на 5 августа.
01

Что реально вышло 31 июля — и что нет

Формулировка «DeepSeek V4 official» создаёт впечатление новой модели. Это не так. Шаг 31 июля — post-training refresh на том же Flash-скелете. Flagship V4-Pro GA и in-house Harness agent framework остаются без публичной даты.

01

Не scale-up: DeepSeek объясняет прирост исключительно post-training, не ростом параметров — Flash 284B/13B теперь обходит Pro preview 1,6T/49B на ряде agent-задач.

02

Только API rollout: Официальный билд — исключительно API public beta; consumer app и web chat не обновлялись.

03

Legacy aliases отключены: deepseek-chat и deepseek-reasoner закрыты 24 июля — немигрированные pipeline падают жёстко.

04

Конкурентное давление: Kimi K3 Moonshot (2,8T open weights) вышел 27 июля, за дни до Flash-promotion DeepSeek.

05

Pro GA по-прежнему размыто: Китайские форумы высмеивали «пустые обещания» до Flash-сюрприза; срок V4-Pro official не подтверждён.

ДатаСобытие
24.04.2026V4 preview: V4-Pro (1,6T/49B) + V4-Flash (284B/13B), 1M context, MIT weights
24.07.2026Legacy model names сняты; трафик на семейство V4
27.07.2026Kimi K3 2,8T weights на Hugging Face
31.07.2026V4-Flash-0731 official API beta + weights; changelog называет Harness «coming soon»
05.08.2026V4-Pro GA всё ещё «как можно скорее»; окна 10–20 августа — неподтверждённые слухи
02

Цены DeepSeek V4-Flash vs Kimi K3 и Qwen3.8-Max

МодельСтатусTotal / ActiveContextInput miss/hit ($/1M)Output ($/1M)Лицензия
V4-Flash-0731Official 31.07284B / 13B1M$0,14 / $0,0028$0,28MIT
V4-ProPreview1,6T / 49B1M$0,435 / $0,003625$0,87MIT
Kimi K3Weights 27.072,8T / ~104B оцен.~1,05M$3,00 / $0,30$15,00Modified MIT
GLM-5.2Open июнь 2026~744B / ~40B1MНе верифицированоНе верифицированоMIT
Qwen3.8-MaxAPI GA 02.082,4T / 95B1M$2,00 / ~$0,17–0,25$6,00Weights обещаны

Все цифры — vendor list prices. DeepSeek анонсировал будущую 2× peak-hour надбавку (9:00–12:00 и 14:00–18:00 по Пекину) без даты вступления. См. наш разбор V4 GA от 20 июля; эта статья фокусируется на official Flash-билде 31 июля.

Vendor math vs Claude Opus 4.8: ~36× на cache-miss input, ~179× на cache-hit input, ~89× на output — list prices, не audited totals.

03

Как DeepSeek выжал больше из той же модели: post-training, CSA+HCA, Harness

V4-Flash-0731 идентичен по размеру и структуре апрельскому preview. Скачок agent-бенчмарков DeepSeek объясняет исключительно новым post-training pass — вразрез с дефолтной логикой «больше параметров — лучше» в гонке 2026.

01

Гибрид CSA+HCA attention: Compressed Sparse Attention плюс Heavily Compressed Attention, бренд DSA, снижает compute и memory на длинном context.

02

mHC hyper-connections: Manifold-Constrained Hyper-Connections уточняют residual paths для стабильности.

03

Muon optimizer: Заменяет классические optimizers; DeepSeek заявляет: при 1M tokens V4-Pro требует 27% per-token FLOPs V3.2 и 10% KV cache.

31 июля — первое официальное упоминание DeepSeek Harness, in-house agent runner против Claude Code. Каждый agent score DeepSeek для Flash-0731 (Terminal Bench 2.0, Toolathlon и др.) снят в Harness minimal mode, который ещё не публичен. Changelog предупреждает: agent scores «крайне чувствительны к выбору harness».

Примечание: Vendor score Terminal Bench 2.0: Flash-0731 82,7 vs V4-Pro preview 67,9 — max effort, top_p 0,95, temperature 1,0, Harness minimal mode.

04

Open-weight melee в Китае: индекс Artificial Analysis и шестишаговый runbook

МодельLabIntelligence IndexCost per task (AA)Примечание
V4-Flash-0731DeepSeek50$0,03Official 31.07
Kimi K3Moonshot57$0,86Выше index, ~29× cost
GLM-5.2Zhipu~1 pt выше FlashНе верифицированоOpen июнь 2026
GPT-5.6 SolOpenAI9+ pts выше$1,86Closed
Claude Fable 5Anthropic9+ pts выше$3,15Closed

Intelligence Index и cost per task — Artificial Analysis через финансовые медиа; собственные agent scores DeepSeek используют другие harness — не смешивать колонки. DeepSeek не гонится за leaderboard crowns; стратегия — «достаточно умно по цене, которую никто не бьёт», что объясняет семь недель на вершине OpenRouter usage для preview.

01

Настроить client: model = deepseek-v4-flash, base_url = https://api.deepseek.com; работают форматы OpenAI и Anthropic SDK.

02

Вычистить legacy names: Поиск deepseek-chat и deepseek-reasoner в repos и CI.

03

Staging regression: Сменить model names в pre-prod, сравнить quality agent pipeline, latency и cache-hit rates.

04

Максимизировать prompt cache: Закрепить стабильные system prompts вверху messages ($0,0028/M cached input).

05

Route by tier: Flash для bulk и routing; V4-Pro preview для тяжёлого reasoning до official GA.

06

Следить за Harness GA: Changelog и Hugging Face; перезапустить agent benchmarks после публикации Harness.

05

Оговорки по бенчмаркам, kill line и цитируемые hard data

A

Harness dependency: Agent headline scores — vendor плюс unreleased framework; ждать воспроизведения в Claude Code / Cursor.

B

Usability gaps: Зарубежный dev feedback: низкие cache-hit rates, occasional safety-classifier timeouts — compute ceilings всё ещё важны.

C

«Kill line» (斩杀线): Китайский dev-сленг о combo «достаточно хорошо + дёшево» DeepSeek, заставляющем конкурентов бить по capability или price — контекст для 80% среза GPT-5.6 Luna.

Nvidia, Broadcom и AMD 31 июля отреагировали сдержанно — рынок воспринимает «DeepSeek efficiency» как рутинную инженерию, в отличие от chip selloff начала 2025 вокруг R1. Сообщения о раунде ~$7,4B и IPO prep — анонимные финмедиа, не regulatory filings; только background.

Локальный V4-Flash через antirez ds4 требует 96 GB unified memory. Чистый API обходит local hardware, но high-frequency agent pipelines требуют стабильных 24/7 хостов. Consumer Mac и undersized VPS swap-thrash на длинном context; короткие trials редко нагружают 1M-token paths. Для стабильного iOS CI/CD и agent automation аренда облачного Mac Mini MESHLAUNCH — обычно лучший production bet: dedicated Apple Silicon, elastic memory tiers, billing по дням/неделям/месяцам. Тарифы: страница аренды; setup: центр помощи.

FAQ

Да. V4-Pro и V4-Flash, включая Flash-0731 от 31.07, — MIT weights на Hugging Face для commercial use. Cloud pricing: страница аренды.

Vendor list prices: ~36× на cache-miss input, ~179× на cache-hit input, ~89× на output vs Claude Opus 4.8 за миллион токенов.

Подтверждённой даты нет. Changelog: «как можно скорее». Окна 10–20 августа — неподтверждённые слухи.

SWE-bench Verified и аналогичные third-party suites весят больше. Terminal Bench 2.0 использовал unreleased Harness — трактовать как harness-specific до воспроизведения.

In-house agent runner DeepSeek vs Claude Code — file edits, tool calls, многошаговый engineering. Назван 31.07; ещё не публичен. Cloud Mac setup: центр помощи.