deepseek-chat, si vous évaluez l'écart de rapport qualité-prix face à GPT-5.6 ou Claude Fable 5, ou si vous devez finaliser la migration API avant l'échéance du 24 juillet, cet article répond à : ① la chronologie complète de la préversion à la GA ; ② comment l'architecture CSA+HCA supporte un contexte d'un million de tokens ; ③ les scores de benchmarks, la grille tarifaire et un runbook de migration en six étapes.
Que change le lancement GA de DeepSeek V4 ? Chronologie de la préversion à la version complète
Le 20 juillet 2026, DeepSeek V4 version complète (General Availability) est officiellement disponible. Ce n'est pas une refonte architecturale — le design MoE open source du 24 avril reste inchangé — mais la version de sortie de l'école qui consolide stabilité, optimisation des performances et facturation commerciale. La GA apporte des améliorations ciblées en capacités agent, raisonnement mathématique et génération de code, accompagnées d'un cadre tarifaire formel qui marque le passage de DeepSeek d'un modèle « quasi gratuit » à une exploitation commerciale structurée.
| Date | Événement |
|---|---|
| 2026-04-24 | Préversion V4 en ligne + open source (MIT), avec V4-Pro (1,6T) et V4-Flash (284B) |
| 2026-05 | Versions de production optimisées V4-Flash et V4-Pro, API officiellement disponible |
| 2026-06 | Baisse permanente de 75 % sur V4-Pro (sortie à 0,87 $/M tokens) |
| 2026-06-29 | Email à tous les utilisateurs API annonçant la GA mi-juillet et la tarification heures pleines/creuses |
| 2026-07-19 | Plusieurs développeurs obtiennent un accès bêta grisé à la GA |
| 2026-07-20 | Mise en ligne officielle de la GA (date de publication) |
| 2026-07-24 | Retrait définitif des anciens noms deepseek-chat et deepseek-reasoner |
Urgence de migration : les anciens noms deepseek-chat / deepseek-reasoner cessent définitivement le 24 juillet à 23:59 (heure de Pékin) — les environnements de production ont quatre jours pour basculer.
Complexité tarifaire accrue : la GA introduit une tarification différenciée heures pleines/creuses ; les jours ouvrés de 09:00 à 12:00 et de 14:00 à 18:00, tous les tarifs doublent — les pipelines 24/7 doivent être replanifiés.
Attentes réalistes : la version complète ne bat pas encore Claude Fable 5 ou GPT-5.6 Ultra sur tous les axes, mais offre les meilleures performances open source à 1/10 voire 1/100 du coût.
Seuil d'auto-hébergement : bien que sous licence MIT, V4-Pro à 1,6T impose des exigences matérielles extrêmes — la majorité des équipes restent sur l'API ou des nœuds d'inférence Mac cloud haut de gamme.
Concurrence Kimi K3 : Kimi K3 revendique 2,8T de paramètres pour le record d'échelle ; DeepSeek conserve sa base développeurs grâce au rapport qualité-prix et à un écosystème API mature.
Architecture DeepSeek V4 et tableau complet des benchmarks
DeepSeek V4 abandonne l'attention latente multi-têtes (MLA) des générations V2/V3 au profit d'un hybride CSA (Compressed Sparse Attention) et HCA (Heavily Compressed Attention). Sur un contexte d'1M tokens, la mémoire KV Cache n'atteint que 10 % de celle de V3.2 (7 % pour V4-Flash) ; les FLOPs d'inférence ne représentent que 27 % de V3.2. Le mHC (Manifold-Constrained Hyper-Connections) stabilise le réseau profond de 61 couches via quatre flux résiduels ; l'entraînement utilise l'optimiseur Muon à la place d'AdamW.
| Spécification | V4-Pro | V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6 billion (1,6T) | 284 milliards (284B) |
| Activation par token | 49 milliards (49B) | 13 milliards (13B) |
| Couches Transformer | 61 | 43 |
| Fenêtre de contexte | 1 000 000 tokens | 1 000 000 tokens |
| Sortie maximale | 384K tokens | 384K tokens |
| Précision | FP4 (experts) + FP8 | FP4 + FP8 mixte |
| Données de pré-entraînement | 33T+ tokens | 32T+ tokens |
| Licence open source | MIT | MIT |
Trois modes d'inférence : Non-think (vitesse maximale, sans chaîne de pensée), Think High (raisonnement explicite, adapté au débogage de code), Think Max (effort de raisonnement maximal, nécessite 384K+ de contexte, pour les mathématiques complexes et les agents longue chaîne). Paramètres d'échantillonnage recommandés : temperature=1.0, top_p=1.0.
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % ★ record open source | 96,0 % | non publié séparément | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Les données Artificial Analysis montrent : Claude Fable 5 coûte 3,48 $ par tâche Strategy & Ops (50 points), DeepSeek V4-Pro seulement 0,03 $ (38 points) — un écart de coût de 116× pour environ 12 points de différence.
DeepSeek V4 face à GPT-5.6 et Claude Fable 5 : comment choisir ?
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source / auto-hébergement | ✅ MIT | ❌ fermé | ❌ fermé |
| Fenêtre de contexte | 1M tokens | non publiée | 1M tokens |
| Capacité code | très forte (proche de Fable 5) | très forte | la plus forte (SWE-bench Pro 80,3 %) |
| Prix sortie API (heures creuses) | 0,87 $/M | ~15 $/M | ~50 $/M |
| Prix sortie heures pleines | 1,74 $/M | — | — |
| Capacités agent | fortes, orchestration multi-agents | fortes | les plus fortes |
| Confidentialité des données | ✅ déploiement privé possible | ❌ | ❌ |
Budget serré / appels à haute fréquence / déploiement privé → V4-Pro ou V4-Flash ; code maximal, coût secondaire → Claude Fable 5 ; algorithmes complexes + raisonnement mathématique → GPT-5.6 Sol / Ultra ; traitement massif de logs ou documents → V4-Flash (entrée en cache à seulement 0,0028 $/M).
Comment économiser avec les heures pleines/creuses ? Runbook de migration API en six étapes (échéance 24/07)
| Modèle | Poste | Heures creuses (Off-Peak) | Heures pleines (Peak) |
|---|---|---|---|
| V4-Pro | Entrée (cache hit) | ¥0,025 / 0,0035 $ / 1M | doublé |
| Entrée (cache miss) | ¥3,00 / 0,435 $ / 1M | ¥6,00 / 0,87 $ | |
| Sortie | ¥6,00 / 0,87 $ / 1M | ¥12,00 / 1,74 $ | |
| V4-Flash | Entrée (cache hit) | ¥0,02 / 0,0028 $ / 1M | doublé |
| Entrée (cache miss) | ¥1,00 / 0,14 $ / 1M | ¥2,00 / 0,28 $ | |
| Sortie | ¥2,00 / 0,28 $ / 1M | ¥4,00 / 0,56 $ |
Heures pleines (heure de Pékin) : jours ouvrés 09:00–12:00 et 14:00–18:00. Même en heures pleines, le prix de sortie V4-Pro (1,74 $/M) reste 8,6× moins cher que Claude Opus 4.8 (15 $/M).
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
Échéance critique : deepseek-chat → deepseek-v4-flash (sans réflexion) ; deepseek-reasoner → deepseek-v4-flash (mode réflexion) ou deepseek-v4-pro. Retrait définitif après le 24 juillet à 15:59 UTC.
Recherche globale des anciens noms : scannez deepseek-chat et deepseek-reasoner dans tout le dépôt, y compris variables d'environnement et fichiers de configuration.
Définir le mapping de migration : dialogue léger → deepseek-v4-flash ; raisonnement complexe → deepseek-v4-pro + paramètre thinking.
Validation en staging : basculez le nom de modèle en préproduction et exécutez la suite de régression pour confirmer l'absence de dégradation.
Configurer le Prompt Cache : placez le System Prompt fixe en tête des messages pour maximiser le taux de cache (Flash en cache à 0,0028 $/M).
Planifier les tâches non temps réel : traitement documentaire par lots, revue de code, etc. après 18:00 ou avant 09:00 pour éviter les heures pleines.
Déploiement progressif en production : finalisez la bascule complète avant le 23 juillet, avec une fenêtre de rollback de 24 heures ; surveillez les emails de notification tarifaire DeepSeek.
DeepSeek V4 GA vaut-il la mise à niveau ? Données vérifiables
Ratio de compression CSA : les séquences KV sont compressées 4× par pooling Softmax à porte ; V4-Pro top-1024 / V4-Flash top-512 sélection sparse + fenêtre glissante de 128 tokens.
Attention globale HCA : compression des tokens 128× puis attention dense globale, alternée avec CSA pour capturer les dépendances longue portée.
Ancre rapport qualité-prix : V4-Flash reste sous 0,04 $ par tâche sur six catégories d'indices ; la sortie V4-Pro à 0,87 $/M est le tarif figé après la baisse permanente de 75 % en juin.
DeepSeek V4 GA est l'un des jalons les plus importants de l'open source en 2026. Sa valeur ne réside pas dans la capacité à battre les modèles fermés phares, mais dans l'offre des meilleures performances open source à un coût extrêmement bas. Pour les entreprises soucieuses de souveraineté des données, les développeurs indépendants au budget limité et les ingénieurs agent nécessitant 1M tokens de contexte, V4-Pro est actuellement le choix le plus équilibré.
Si vous prévoyez d'auto-héberger V4-Flash en local ou dans le cloud pour le routage agent et le découplage d'inférence, les 16 Go de mémoire d'un Mac grand public sont largement insuffisants — la documentation ds4 inférence locale indique un minimum de 96 Go de mémoire unifiée pour V4-Flash. L'appel API pur n'a pas de barrière matérielle, mais les pipelines agent à haute fréquence exigent une stabilité hôte et une disponibilité 7×24 : un VPS maison sans accélération Metal et avec swap instable provoque des timeouts d'inférence ; un essai court ne couvre pas les tests de charge long contexte. Pour un environnement de production plus stable, adapté au CI/CD iOS et à l'automatisation d'agents IA, la location cloud Mac Mini MESHLAUNCH est généralement la meilleure option : Apple Silicon dédié, montée en charge flexible jusqu'à 64 Go+ de mémoire unifiée, disponibilité 7×24, commande à la journée/semaine/mois.
Les jours ouvrés de 09:00 à 12:00 et de 14:00 à 18:00 (heure de Pékin), tous les tarifs doublent. Planifiez les tâches par lots après 18:00 ; consultez la page tarifs location pour les options de nœuds d'inférence cloud.
Retrait définitif le 24 juillet 2026 à 15:59 UTC (23:59 heure de Pékin). Migrez vers deepseek-v4-flash ou deepseek-v4-pro avant cette date.
Pro convient au raisonnement complexe et aux agents ; Flash au routage léger, avec entrée en cache à seulement 0,0028 $/M. Pour le déploiement local, consultez le centre d'aide.
Fable 5 reste en tête sur les benchmarks les plus exigeants ; mais V4-Pro affiche 80,6 % sur SWE-bench Verified, record open source, avec un prix de sortie environ 1/17 de GPT-5.6 Sol.
Oui. V4 est compatible avec les formats OpenAI ChatCompletions et Anthropic Messages ; conservez base_url sur https://api.deepseek.com et mettez uniquement à jour le paramètre model.