DeepSeek V4 GA: полный релиз
цены, архитектура и сравнение с GPT-5.6

Timeline · CSA+HCA · бенчмарки · peak-valley pricing · миграция API · дедлайн 24.07

DeepSeek V4 GA полный релиз 2026
Три месяца ожидания — и DeepSeek V4 в полной версии (GA) вышел 20.07.2026. Относительно апрельского preview: прирост Agent-возможностей, math reasoning и code generation, плюс впервые — peak-valley billing. Если вы всё ещё на deepseek-chat, сравниваете cost/quality с GPT-5.6 и Claude Fable 5 или должны уложиться в миграцию до 24.07, здесь: ① полный timeline от preview до GA; ② как CSA+HCA держит 1M token context; ③ таблицы бенчмарков, peak-valley pricing и шестишаговый migration runbook.
01

Что принёс DeepSeek V4 GA? Timeline от preview до полной версии

20.07.2026 DeepSeek V4 General Availability вышел в production. Архитектура MoE не новая — с 24.04 она уже open-source под MIT — но GA — это «выпускной» preview: стабильность, оптимизация inference и коммерческий billing. Полная версия усилила Agent, math и code generation и впервые ввела дифференцированные тарифы peak/off-peak — сигнал перехода от «почти бесплатно» к дисциплинированной монетизации.

ДатаСобытие
2026-04-24Preview + open-source (MIT): V4-Pro (1,6T) и V4-Flash (284B)
2026-05Production-tuned V4-Flash и V4-Pro, API в general availability
2026-06Постоянное снижение цены V4-Pro на 75% (output $0,87/M tokens)
2026-06-29Email всем API-пользователям: GA в середине июля, первое раскрытие peak-valley pricing
2026-07-19Gray-scale GA-доступ у части разработчиков
2026-07-20GA официально live (дата публикации)
2026-07-24deepseek-chat и deepseek-reasoner уходят навсегда
01

Срочность миграции: deepseek-chat / deepseek-reasoner отключаются 24.07 в 23:59 по Пекину — на production остаётся четыре дня.

02

Усложнение billing: GA вводит peak-valley; в будни 09:00–12:00 и 14:00–18:00 тарифы ×2 — 24/7 pipeline нужно перепланировать.

03

Ожидания по quality: GA пока не бьёт Claude Fable 5 или GPT-5.6 Ultra везде, но даёт лучший open-source результат за 1/10–1/100 стоимости closed flagship.

04

Порог self-host: MIT открыт, но V4-Pro 1,6T требует серьёзного железа; большинство команд остаётся на API или cloud inference node.

05

Конкуренция с Kimi K3: Kimi K3 бьёт по scale (2,8T), DeepSeek удерживает developer base за счёт зрелого API и price/performance.

02

Архитектура DeepSeek V4 и полная таблица бенчмарков

V4 отказался от MLA (V2/V3) в пользу гибрида CSA (Compressed Sparse Attention) и HCA (Heavily Compressed Attention): при 1M context KV Cache занимает 10% памяти V3.2 (у V4-Flash — 7%), inference FLOPs — 27% от V3.2. mHC (manifold-constrained hyper-connections) стабилизирует 61-слойную сеть через 4-channel residual flow; обучение — оптимизатор Muon вместо AdamW.

СпецификацияV4-ProV4-Flash
Всего параметров1,6 трln (1,6T)284 млрд (284B)
Активных на token49 млрд (49B)13 млрд (13B)
Слои Transformer6143
Context window1 000 000 tokens1 000 000 tokens
Max output384K tokens384K tokens
ТочностьFP4 (experts) + FP8FP4 + FP8 mixed
Pretrain data33T+ tokens32T+ tokens
ЛицензияMITMIT

Три режима inference: Non-think (максимальная скорость, без chain-of-thought), Think High (явный reasoning, code debug), Think Max (максимальная глубина, нужен 384K+ context — сложная математика и long-chain Agent). Рекомендуемые sampling params: temperature=1.0, top_p=1.0.

БенчмаркDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6% ★ лучший open-source96,0%не опубликован отдельно~69%
SWE-bench Pro55,4%80,3%78,1%69,2%
LiveCodeBench (Pass@1)93,5%88,1%87,4%83,2%
Codeforces Elo3 206
Terminal-Bench 2.183,9%88,0%85,1%82,7%

Artificial Analysis: Claude Fable 5 на Strategy & Ops — $3,48 за run (50 баллов), DeepSeek V4-Pro — $0,03 (38 баллов). Разрыв по cost — 116×, по score — около 12 пунктов.

03

DeepSeek V4 vs GPT-5.6 и Claude Fable 5: как выбрать?

КритерийDeepSeek V4-ProGPT-5.6 SolClaude Fable 5
Open-source / self-host✅ MIT❌ closed❌ closed
Context window1M tokensне раскрыт1M tokens
Code capabilityочень сильный (близко к Fable 5)очень сильныйлучший (SWE-bench Pro 80,3%)
API output (off-peak)$0,87/M~$15/M~$50/M
API output (peak)$1,74/M
Agent capabilityсильный, multi-agent orchestrationсильныйлучший
Data privacy✅ private deploy

Ограниченный бюджет / high-frequency / private deploy → V4-Pro или V4-Flash; максимум code quality, cost не критичен → Claude Fable 5; сложные алгоритмы + math reasoning → GPT-5.6 Sol / Ultra; массовая обработка логов и документов → V4-Flash (cache-hit input $0,0028/M).

04

Peak-valley pricing: как экономить? Шестишаговый API migration runbook (дедлайн 24.07)

МодельСтатья billingOff-peakPeak
V4-ProInput (cache hit)¥0,025 / $0,0035 / 1M×2
Input (cache miss)¥3,00 / $0,435 / 1M¥6,00 / $0,87
Output¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashInput (cache hit)¥0,02 / $0,0028 / 1M×2
Input (cache miss)¥1,00 / $0,14 / 1M¥2,00 / $0,28
Output¥2,00 / $0,28 / 1M¥4,00 / $0,56

Peak (пекинское время, будни): 09:00–12:00 и 14:00–18:00. Даже в peak output V4-Pro ($1,74/M) в 8,6× дешевле Claude Opus 4.8 ($15/M).

Python
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

Дедлайн: deepseek-chatdeepseek-v4-flash (non-think); deepseek-reasonerdeepseek-v4-flash (think) или deepseek-v4-pro. После 24.07 15:59 UTC старые имена недоступны.

01

Поиск legacy model ID: grep по deepseek-chat и deepseek-reasoner — код, env vars, config files.

02

Маппинг миграции: лёгкий диалог → deepseek-v4-flash; сложный reasoning → deepseek-v4-pro + thinking params.

03

Staging validation: переключите model name в pre-prod, прогоните regression suite на quality degradation.

04

Prompt Cache: фиксированный system prompt в начале messages — максимальный cache hit (Flash hit $0,0028/M).

05

Расписание batch-задач: document processing, code review — после 18:00 или до 09:00, вне peak window.

06

Production rollout: полный switch до 23.07, 24h rollback window; следите за billing emails от DeepSeek.

05

Стоит ли апгрейдиться на DeepSeek V4 GA? Три опорных данных

A

CSA compression ratio: KV-последовательность сжимается softmax-gated pooling в 4×; V4-Pro top-1024 / V4-Flash top-512 sparse selection + sliding window 128 tokens.

B

HCA global attention: tokens сжимаются в 128×, затем dense global attention; чередуется с CSA для long-range dependencies.

C

Price anchor: V4-Flash — ниже $0,04 за run на шести index-задачах; V4-Pro output $0,87/M — финальная цена после −75% в июне.

DeepSeek V4 GA — один из главных milestone open-source LLM в 2026. Ценность не в победе над closed flagship, а в лучшем open-source performance при минимальном cost. Для компаний с data residency, indie-разработчиков с tight budget и Agent-инженеров с 1M context V4-Pro сейчас самый сбалансированный выбор.

Self-host V4-Flash для Agent routing на consumer Mac с 16GB RAM нереалистичен — ds4 local inference указывает минимум 96GB unified memory. Чистый API снимает hardware barrier, но high-frequency Agent pipeline требует стабильного 7×24 хоста: VPS без Metal, swap jitter → timeout на long context. Для production с iOS CI/CD и AI Agent automation аренда Mac Mini в MESHLAUNCH обычно практичнее: dedicated Apple Silicon, upgrade до 64GB+ unified memory, 7×24 uptime, гибкий billing по дням/неделям/месяцам. Тарифы — на странице цен, onboarding — в центре помощи.

FAQ

Будни по пекинскому времени 09:00–12:00 и 14:00–18:00 — peak, тарифы ×2. Batch-задачи ставьте после 18:00; cloud inference — тарифы аренды.

24.07.2026 15:59 UTC (23:59 Пекин) — permanent shutdown. Мигрируйте на deepseek-v4-flash или deepseek-v4-pro.

Pro — сложный reasoning и Agent; Flash — лёгкий routing, cache-hit input $0,0028/M. Self-host порог — центр помощи.

На hardest benchmarks Fable 5 впереди; V4-Pro — open-source рекорд SWE-bench Verified 80,6%, output ~в 17× дешевле GPT-5.6 Sol.

Да. V4-Pro и V4-Flash под MIT — private deployment для data residency. Также совместимы OpenAI ChatCompletions и Anthropic Messages: base_url остаётся https://api.deepseek.com, меняется только model.