deepseek-chat, сравниваете cost/quality с GPT-5.6 и Claude Fable 5 или должны уложиться в миграцию до 24.07, здесь: ① полный timeline от preview до GA; ② как CSA+HCA держит 1M token context; ③ таблицы бенчмарков, peak-valley pricing и шестишаговый migration runbook.
Что принёс DeepSeek V4 GA? Timeline от preview до полной версии
20.07.2026 DeepSeek V4 General Availability вышел в production. Архитектура MoE не новая — с 24.04 она уже open-source под MIT — но GA — это «выпускной» preview: стабильность, оптимизация inference и коммерческий billing. Полная версия усилила Agent, math и code generation и впервые ввела дифференцированные тарифы peak/off-peak — сигнал перехода от «почти бесплатно» к дисциплинированной монетизации.
| Дата | Событие |
|---|---|
| 2026-04-24 | Preview + open-source (MIT): V4-Pro (1,6T) и V4-Flash (284B) |
| 2026-05 | Production-tuned V4-Flash и V4-Pro, API в general availability |
| 2026-06 | Постоянное снижение цены V4-Pro на 75% (output $0,87/M tokens) |
| 2026-06-29 | Email всем API-пользователям: GA в середине июля, первое раскрытие peak-valley pricing |
| 2026-07-19 | Gray-scale GA-доступ у части разработчиков |
| 2026-07-20 | GA официально live (дата публикации) |
| 2026-07-24 | deepseek-chat и deepseek-reasoner уходят навсегда |
Срочность миграции: deepseek-chat / deepseek-reasoner отключаются 24.07 в 23:59 по Пекину — на production остаётся четыре дня.
Усложнение billing: GA вводит peak-valley; в будни 09:00–12:00 и 14:00–18:00 тарифы ×2 — 24/7 pipeline нужно перепланировать.
Ожидания по quality: GA пока не бьёт Claude Fable 5 или GPT-5.6 Ultra везде, но даёт лучший open-source результат за 1/10–1/100 стоимости closed flagship.
Порог self-host: MIT открыт, но V4-Pro 1,6T требует серьёзного железа; большинство команд остаётся на API или cloud inference node.
Конкуренция с Kimi K3: Kimi K3 бьёт по scale (2,8T), DeepSeek удерживает developer base за счёт зрелого API и price/performance.
Архитектура DeepSeek V4 и полная таблица бенчмарков
V4 отказался от MLA (V2/V3) в пользу гибрида CSA (Compressed Sparse Attention) и HCA (Heavily Compressed Attention): при 1M context KV Cache занимает 10% памяти V3.2 (у V4-Flash — 7%), inference FLOPs — 27% от V3.2. mHC (manifold-constrained hyper-connections) стабилизирует 61-слойную сеть через 4-channel residual flow; обучение — оптимизатор Muon вместо AdamW.
| Спецификация | V4-Pro | V4-Flash |
|---|---|---|
| Всего параметров | 1,6 трln (1,6T) | 284 млрд (284B) |
| Активных на token | 49 млрд (49B) | 13 млрд (13B) |
| Слои Transformer | 61 | 43 |
| Context window | 1 000 000 tokens | 1 000 000 tokens |
| Max output | 384K tokens | 384K tokens |
| Точность | FP4 (experts) + FP8 | FP4 + FP8 mixed |
| Pretrain data | 33T+ tokens | 32T+ tokens |
| Лицензия | MIT | MIT |
Три режима inference: Non-think (максимальная скорость, без chain-of-thought), Think High (явный reasoning, code debug), Think Max (максимальная глубина, нужен 384K+ context — сложная математика и long-chain Agent). Рекомендуемые sampling params: temperature=1.0, top_p=1.0.
| Бенчмарк | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6% ★ лучший open-source | 96,0% | не опубликован отдельно | ~69% |
| SWE-bench Pro | 55,4% | 80,3% | 78,1% | 69,2% |
| LiveCodeBench (Pass@1) | 93,5% | 88,1% | 87,4% | 83,2% |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9% | 88,0% | 85,1% | 82,7% |
Artificial Analysis: Claude Fable 5 на Strategy & Ops — $3,48 за run (50 баллов), DeepSeek V4-Pro — $0,03 (38 баллов). Разрыв по cost — 116×, по score — около 12 пунктов.
DeepSeek V4 vs GPT-5.6 и Claude Fable 5: как выбрать?
| Критерий | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open-source / self-host | ✅ MIT | ❌ closed | ❌ closed |
| Context window | 1M tokens | не раскрыт | 1M tokens |
| Code capability | очень сильный (близко к Fable 5) | очень сильный | лучший (SWE-bench Pro 80,3%) |
| API output (off-peak) | $0,87/M | ~$15/M | ~$50/M |
| API output (peak) | $1,74/M | — | — |
| Agent capability | сильный, multi-agent orchestration | сильный | лучший |
| Data privacy | ✅ private deploy | ❌ | ❌ |
Ограниченный бюджет / high-frequency / private deploy → V4-Pro или V4-Flash; максимум code quality, cost не критичен → Claude Fable 5; сложные алгоритмы + math reasoning → GPT-5.6 Sol / Ultra; массовая обработка логов и документов → V4-Flash (cache-hit input $0,0028/M).
Peak-valley pricing: как экономить? Шестишаговый API migration runbook (дедлайн 24.07)
| Модель | Статья billing | Off-peak | Peak |
|---|---|---|---|
| V4-Pro | Input (cache hit) | ¥0,025 / $0,0035 / 1M | ×2 |
| Input (cache miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 | |
| Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 | |
| V4-Flash | Input (cache hit) | ¥0,02 / $0,0028 / 1M | ×2 |
| Input (cache miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 | |
| Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
Peak (пекинское время, будни): 09:00–12:00 и 14:00–18:00. Даже в peak output V4-Pro ($1,74/M) в 8,6× дешевле Claude Opus 4.8 ($15/M).
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
Дедлайн: deepseek-chat → deepseek-v4-flash (non-think); deepseek-reasoner → deepseek-v4-flash (think) или deepseek-v4-pro. После 24.07 15:59 UTC старые имена недоступны.
Поиск legacy model ID: grep по deepseek-chat и deepseek-reasoner — код, env vars, config files.
Маппинг миграции: лёгкий диалог → deepseek-v4-flash; сложный reasoning → deepseek-v4-pro + thinking params.
Staging validation: переключите model name в pre-prod, прогоните regression suite на quality degradation.
Prompt Cache: фиксированный system prompt в начале messages — максимальный cache hit (Flash hit $0,0028/M).
Расписание batch-задач: document processing, code review — после 18:00 или до 09:00, вне peak window.
Production rollout: полный switch до 23.07, 24h rollback window; следите за billing emails от DeepSeek.
Стоит ли апгрейдиться на DeepSeek V4 GA? Три опорных данных
CSA compression ratio: KV-последовательность сжимается softmax-gated pooling в 4×; V4-Pro top-1024 / V4-Flash top-512 sparse selection + sliding window 128 tokens.
HCA global attention: tokens сжимаются в 128×, затем dense global attention; чередуется с CSA для long-range dependencies.
Price anchor: V4-Flash — ниже $0,04 за run на шести index-задачах; V4-Pro output $0,87/M — финальная цена после −75% в июне.
DeepSeek V4 GA — один из главных milestone open-source LLM в 2026. Ценность не в победе над closed flagship, а в лучшем open-source performance при минимальном cost. Для компаний с data residency, indie-разработчиков с tight budget и Agent-инженеров с 1M context V4-Pro сейчас самый сбалансированный выбор.
Self-host V4-Flash для Agent routing на consumer Mac с 16GB RAM нереалистичен — ds4 local inference указывает минимум 96GB unified memory. Чистый API снимает hardware barrier, но high-frequency Agent pipeline требует стабильного 7×24 хоста: VPS без Metal, swap jitter → timeout на long context. Для production с iOS CI/CD и AI Agent automation аренда Mac Mini в MESHLAUNCH обычно практичнее: dedicated Apple Silicon, upgrade до 64GB+ unified memory, 7×24 uptime, гибкий billing по дням/неделям/месяцам. Тарифы — на странице цен, onboarding — в центре помощи.
Будни по пекинскому времени 09:00–12:00 и 14:00–18:00 — peak, тарифы ×2. Batch-задачи ставьте после 18:00; cloud inference — тарифы аренды.
24.07.2026 15:59 UTC (23:59 Пекин) — permanent shutdown. Мигрируйте на deepseek-v4-flash или deepseek-v4-pro.
Pro — сложный reasoning и Agent; Flash — лёгкий routing, cache-hit input $0,0028/M. Self-host порог — центр помощи.
На hardest benchmarks Fable 5 впереди; V4-Pro — open-source рекорд SWE-bench Verified 80,6%, output ~в 17× дешевле GPT-5.6 Sol.
Да. V4-Pro и V4-Flash под MIT — private deployment для data residency. Также совместимы OpenAI ChatCompletions и Anthropic Messages: base_url остаётся https://api.deepseek.com, меняется только model.