Что реально вышло 31 июля — и что нет
Формулировка «DeepSeek V4 official» создаёт впечатление новой модели. Это не так. Шаг 31 июля — post-training refresh на том же Flash-скелете. Flagship V4-Pro GA и in-house Harness agent framework остаются без публичной даты.
Не scale-up: DeepSeek объясняет прирост исключительно post-training, не ростом параметров — Flash 284B/13B теперь обходит Pro preview 1,6T/49B на ряде agent-задач.
Только API rollout: Официальный билд — исключительно API public beta; consumer app и web chat не обновлялись.
Legacy aliases отключены: deepseek-chat и deepseek-reasoner закрыты 24 июля — немигрированные pipeline падают жёстко.
Конкурентное давление: Kimi K3 Moonshot (2,8T open weights) вышел 27 июля, за дни до Flash-promotion DeepSeek.
Pro GA по-прежнему размыто: Китайские форумы высмеивали «пустые обещания» до Flash-сюрприза; срок V4-Pro official не подтверждён.
| Дата | Событие |
|---|---|
| 24.04.2026 | V4 preview: V4-Pro (1,6T/49B) + V4-Flash (284B/13B), 1M context, MIT weights |
| 24.07.2026 | Legacy model names сняты; трафик на семейство V4 |
| 27.07.2026 | Kimi K3 2,8T weights на Hugging Face |
| 31.07.2026 | V4-Flash-0731 official API beta + weights; changelog называет Harness «coming soon» |
| 05.08.2026 | V4-Pro GA всё ещё «как можно скорее»; окна 10–20 августа — неподтверждённые слухи |
Цены DeepSeek V4-Flash vs Kimi K3 и Qwen3.8-Max
| Модель | Статус | Total / Active | Context | Input miss/hit ($/1M) | Output ($/1M) | Лицензия |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | Official 31.07 | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| V4-Pro | Preview | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Weights 27.07 | 2,8T / ~104B оцен. | ~1,05M | $3,00 / $0,30 | $15,00 | Modified MIT |
| GLM-5.2 | Open июнь 2026 | ~744B / ~40B | 1M | Не верифицировано | Не верифицировано | MIT |
| Qwen3.8-Max | API GA 02.08 | 2,4T / 95B | 1M | $2,00 / ~$0,17–0,25 | $6,00 | Weights обещаны |
Все цифры — vendor list prices. DeepSeek анонсировал будущую 2× peak-hour надбавку (9:00–12:00 и 14:00–18:00 по Пекину) без даты вступления. См. наш разбор V4 GA от 20 июля; эта статья фокусируется на official Flash-билде 31 июля.
Vendor math vs Claude Opus 4.8: ~36× на cache-miss input, ~179× на cache-hit input, ~89× на output — list prices, не audited totals.
Как DeepSeek выжал больше из той же модели: post-training, CSA+HCA, Harness
V4-Flash-0731 идентичен по размеру и структуре апрельскому preview. Скачок agent-бенчмарков DeepSeek объясняет исключительно новым post-training pass — вразрез с дефолтной логикой «больше параметров — лучше» в гонке 2026.
Гибрид CSA+HCA attention: Compressed Sparse Attention плюс Heavily Compressed Attention, бренд DSA, снижает compute и memory на длинном context.
mHC hyper-connections: Manifold-Constrained Hyper-Connections уточняют residual paths для стабильности.
Muon optimizer: Заменяет классические optimizers; DeepSeek заявляет: при 1M tokens V4-Pro требует 27% per-token FLOPs V3.2 и 10% KV cache.
31 июля — первое официальное упоминание DeepSeek Harness, in-house agent runner против Claude Code. Каждый agent score DeepSeek для Flash-0731 (Terminal Bench 2.0, Toolathlon и др.) снят в Harness minimal mode, который ещё не публичен. Changelog предупреждает: agent scores «крайне чувствительны к выбору harness».
Примечание: Vendor score Terminal Bench 2.0: Flash-0731 82,7 vs V4-Pro preview 67,9 — max effort, top_p 0,95, temperature 1,0, Harness minimal mode.
Open-weight melee в Китае: индекс Artificial Analysis и шестишаговый runbook
| Модель | Lab | Intelligence Index | Cost per task (AA) | Примечание |
|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | $0,03 | Official 31.07 |
| Kimi K3 | Moonshot | 57 | $0,86 | Выше index, ~29× cost |
| GLM-5.2 | Zhipu | ~1 pt выше Flash | Не верифицировано | Open июнь 2026 |
| GPT-5.6 Sol | OpenAI | 9+ pts выше | $1,86 | Closed |
| Claude Fable 5 | Anthropic | 9+ pts выше | $3,15 | Closed |
Intelligence Index и cost per task — Artificial Analysis через финансовые медиа; собственные agent scores DeepSeek используют другие harness — не смешивать колонки. DeepSeek не гонится за leaderboard crowns; стратегия — «достаточно умно по цене, которую никто не бьёт», что объясняет семь недель на вершине OpenRouter usage для preview.
Настроить client: model = deepseek-v4-flash, base_url = https://api.deepseek.com; работают форматы OpenAI и Anthropic SDK.
Вычистить legacy names: Поиск deepseek-chat и deepseek-reasoner в repos и CI.
Staging regression: Сменить model names в pre-prod, сравнить quality agent pipeline, latency и cache-hit rates.
Максимизировать prompt cache: Закрепить стабильные system prompts вверху messages ($0,0028/M cached input).
Route by tier: Flash для bulk и routing; V4-Pro preview для тяжёлого reasoning до official GA.
Следить за Harness GA: Changelog и Hugging Face; перезапустить agent benchmarks после публикации Harness.
Оговорки по бенчмаркам, kill line и цитируемые hard data
Harness dependency: Agent headline scores — vendor плюс unreleased framework; ждать воспроизведения в Claude Code / Cursor.
Usability gaps: Зарубежный dev feedback: низкие cache-hit rates, occasional safety-classifier timeouts — compute ceilings всё ещё важны.
«Kill line» (斩杀线): Китайский dev-сленг о combo «достаточно хорошо + дёшево» DeepSeek, заставляющем конкурентов бить по capability или price — контекст для 80% среза GPT-5.6 Luna.
Nvidia, Broadcom и AMD 31 июля отреагировали сдержанно — рынок воспринимает «DeepSeek efficiency» как рутинную инженерию, в отличие от chip selloff начала 2025 вокруг R1. Сообщения о раунде ~$7,4B и IPO prep — анонимные финмедиа, не regulatory filings; только background.
Локальный V4-Flash через antirez ds4 требует 96 GB unified memory. Чистый API обходит local hardware, но high-frequency agent pipelines требуют стабильных 24/7 хостов. Consumer Mac и undersized VPS swap-thrash на длинном context; короткие trials редко нагружают 1M-token paths. Для стабильного iOS CI/CD и agent automation аренда облачного Mac Mini MESHLAUNCH — обычно лучший production bet: dedicated Apple Silicon, elastic memory tiers, billing по дням/неделям/месяцам. Тарифы: страница аренды; setup: центр помощи.
Да. V4-Pro и V4-Flash, включая Flash-0731 от 31.07, — MIT weights на Hugging Face для commercial use. Cloud pricing: страница аренды.
Vendor list prices: ~36× на cache-miss input, ~179× на cache-hit input, ~89× на output vs Claude Opus 4.8 за миллион токенов.
Подтверждённой даты нет. Changelog: «как можно скорее». Окна 10–20 августа — неподтверждённые слухи.
SWE-bench Verified и аналогичные third-party suites весят больше. Terminal Bench 2.0 использовал unreleased Harness — трактовать как harness-specific до воспроизведения.
In-house agent runner DeepSeek vs Claude Code — file edits, tool calls, многошаговый engineering. Назван 31.07; ещё не публичен. Cloud Mac setup: центр помощи.