Ce qui a réellement été livré le 31 juillet — et ce qui ne l'a pas été
Lire « DeepSeek V4 officiel » laisse penser à un nouveau modèle. Ce n'est pas le cas. Le mouvement du 31 juillet est un rafraîchissement post-entraînement sur le même squelette Flash. La V4-Pro flagship GA et le framework agent Harness maison restent non publiés, sans date ferme.
Pas de montée en échelle : DeepSeek affirme que les gains viennent entièrement du post-entraînement, pas de la croissance paramétrique — un Flash 284B/13B bat maintenant une préversion Pro 1,6T/49B sur plusieurs tâches agent.
Déploiement API uniquement : Le build officiel est en bêta publique API seulement ; l'app grand public et le chat web n'ont pas été mis à jour.
Alias legacy retirés : deepseek-chat et deepseek-reasoner ont été arrêtés le 24 juillet — les pipelines non migrés échouent brutalement.
Pression concurrentielle : Kimi K3 de Moonshot (2,8T open weights) est arrivé le 27 juillet, quelques jours avant la promotion Flash de DeepSeek.
Pro GA toujours floue : Les forums chinois ont raillé les retards « promesses vides » avant la surprise Flash ; le calendrier V4-Pro officiel reste non confirmé.
| Date | Événement |
|---|---|
| 24/04/2026 | Préversion V4 : V4-Pro (1,6T/49B) + V4-Flash (284B/13B), contexte 1M, poids MIT |
| 24/07/2026 | Noms de modèles legacy retirés ; trafic routé vers la famille V4 |
| 27/07/2026 | Poids Kimi K3 2,8T sur Hugging Face |
| 31/07/2026 | V4-Flash-0731 bêta API officielle + poids ; changelog nomme Harness « coming soon » |
| 05/08/2026 | V4-Pro GA toujours « dès que possible » ; fenêtres 10–20 août sont des rumeurs non confirmées |
Tarifs DeepSeek V4-Flash vs Kimi K3 et Qwen3.8-Max
| Modèle | Statut | Total / Actif | Contexte | Entrée miss/hit ($/1M) | Sortie ($/1M) | Licence |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | Officiel 31/07 | 284B / 13B | 1M | 0,14 $ / 0,0028 $ | 0,28 $ | MIT |
| V4-Pro | Préversion | 1,6T / 49B | 1M | 0,435 $ / 0,003625 $ | 0,87 $ | MIT |
| Kimi K3 | Poids 27/07 | 2,8T / ~104B est. | ~1,05M | 3,00 $ / 0,30 $ | 15,00 $ | MIT modifiée |
| GLM-5.2 | Open juin 2026 | ~744B / ~40B | 1M | Non vérifié ici | Non vérifié | MIT |
| Qwen3.8-Max | API GA 02/08 | 2,4T / 95B | 1M | 2,00 $ / ~0,17–0,25 $ | 6,00 $ | Poids promis |
Tous les chiffres sont des tarifs listes publiés par les fournisseurs. DeepSeek a annoncé une future surcharge 2× en heures de pointe (9h–12h et 14h–18h heure de Pékin) sans date d'effet. Voir notre décryptage V4 GA du 20 juillet pour le récit GA antérieur ; cet article se concentre sur le build Flash officiel du 31 juillet.
Calcul fournisseur vs Claude Opus 4.8 : environ 36× en entrée cache miss, 179× en entrée cache hit, 89× en sortie — tarifs listes, pas totaux audités.
Comment DeepSeek a tiré plus du même modèle : post-entraînement, CSA+HCA, Harness
V4-Flash-0731 est identique en taille et structure à la préversion d'avril. DeepSeek attribue le bond des benchmarks agent entièrement à une nouvelle passe de post-entraînement — à contre-courant de l'hypothèse « plus gros égale mieux » dans la course aux modèles 2026.
Attention hybride CSA+HCA : Compressed Sparse Attention plus Heavily Compressed Attention, commercialisée DSA, réduit calcul et mémoire sur long contexte.
Hyper-connexions mHC : Manifold-Constrained Hyper-Connections affinent les chemins résiduels pour la stabilité.
Optimiseur Muon : Remplace les optimiseurs classiques ; DeepSeek affirme qu'à 1M tokens V4-Pro n'a besoin que de 27 % des FLOPs par token de V3.2 et de 10 % du cache KV.
Le 31 juillet a aussi marqué la première mention officielle de DeepSeek Harness — un exécuteur agent maison positionné face à Claude Code. Chaque score agent publié par DeepSeek pour Flash-0731 (Terminal Bench 2.0, Toolathlon, etc.) utilisait le mode minimal Harness, qui n'est pas encore public. Le changelog avertit lui-même que les scores agent sont « extrêmement sensibles au choix du harness ».
Note : Score fournisseur Terminal Bench 2.0 : Flash-0731 82,7 vs préversion V4-Pro 67,9 — effort max, top_p 0,95, temperature 1,0, mode minimal Harness.
La mêlée open weight chinoise : indice Artificial Analysis et runbook en six étapes
| Modèle | Labo | Intelligence Index | Coût par tâche (AA) | Note |
|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | 0,03 $ | Officiel 31/07 |
| Kimi K3 | Moonshot | 57 | 0,86 $ | Index supérieur, ~29× le coût |
| GLM-5.2 | Zhipu | ~1 pt au-dessus de Flash | Non vérifié | Open juin 2026 |
| GPT-5.6 Sol | OpenAI | 9+ pts au-dessus | 1,86 $ | Fermé |
| Claude Fable 5 | Anthropic | 9+ pts au-dessus | 3,15 $ | Fermé |
L'Intelligence Index et les coûts par tâche citent Artificial Analysis via la presse financière ; les scores agent de DeepSeek utilisent d'autres harness — ne pas fusionner les deux colonnes. DeepSeek ne chasse pas les couronnes de leaderboard ; il optimise pour « assez intelligent à un prix que personne d'autre n'atteint », ce qui explique aussi sept semaines en tête d'OpenRouter pour la préversion.
Pointer votre client : Définir model sur deepseek-v4-flash, garder base_url sur https://api.deepseek.com ; formats SDK OpenAI et Anthropic fonctionnent tous deux.
Nettoyer les noms legacy : Chercher deepseek-chat et deepseek-reasoner dans repos et CI.
Régression staging : Changer les noms de modèle en pré-prod, comparer qualité pipeline agent, latence et taux de cache hit.
Maximiser le cache de prompt : Épingler les prompts système stables en tête des messages (0,0028 $/M entrée en cache).
Routage par palier : Flash pour le volume et le routage ; préversion V4-Pro pour le raisonnement lourd jusqu'à la GA officielle.
Surveiller la GA Harness : Suivre changelog et Hugging Face ; relancer les benchmarks agent une fois Harness public.
Réserves sur les benchmarks, « kill line » et données brutes citables
Dépendance Harness : Les scores agent à la une sont fournisseur plus framework non publié — attendre les reproductions Claude Code / Cursor.
Lacunes d'usage : Les retours de développeurs à l'étranger citent de faibles taux de cache hit et des timeouts occasionnels du classificateur de sécurité — les plafonds de calcul comptent toujours.
« Kill line » (斩杀线) : Argot dev chinois pour le combo assez-bon-plus-pas-cher de DeepSeek qui force les rivaux à battre sur capacité ou prix — contexte pour la baisse de 80 % de GPT-5.6 Luna.
Nvidia, Broadcom et AMD ont réagi modérément le 31 juillet — les marchés traitent désormais « l'efficacité DeepSeek » comme de l'ingénierie routinière, contrairement à la vente massive de puces début 2025 autour de R1. Les rapports d'un tour de financement ~7,4 Md$ et de préparation IPO proviennent de médias financiers anonymes, pas de dépôts réglementaires — contexte seulement.
Exécuter V4-Flash localement via antirez ds4 exige 96 Go de mémoire unifiée. L'usage API pur évite le matériel local, mais les pipelines agent haute fréquence exigent des hôtes stables 24/7. Les Mac grand public et les VPS sous-dimensionnés swap-thrashent sur long contexte ; les essais courts stressent rarement les chemins à 1M tokens. Pour un CI/CD iOS et une automatisation agent plus stables, la location cloud Mac Mini MESHLAUNCH est en général le meilleur pari production : Apple Silicon dédié, paliers mémoire élastiques, facturation jour/semaine/mois. Tarifs : page location ; configuration : centre d'aide.
Oui. V4-Pro et V4-Flash, y compris Flash-0731 du 31/07, sont publiés en poids MIT sur Hugging Face pour usage commercial. Tarifs cloud sur notre page location.
Tarifs listes fournisseur : environ 36× en entrée cache miss, 179× en entrée cache hit, 89× en sortie vs Claude Opus 4.8 par million de tokens.
Aucune date confirmée. Le changelog indique « dès que possible ». Les fenêtres 10–20 août sont des rumeurs non confirmées.
SWE-bench Verified et suites tierces similaires pèsent davantage. Terminal Bench 2.0 a utilisé Harness non publié — traiter comme spécifique au harness jusqu'à reproduction ailleurs.
Exécuteur agent maison de DeepSeek vs Claude Code — éditions fichiers, appels d'outils, ingénierie multi-étapes. Nommé le 31/07 ; pas encore public. Configuration Mac cloud dans le centre d'aide.