DeepSeek V4-Flash est-il vraiment 100× moins cher
que Claude ? Lecture des benchmarks

Build officiel 31/07 · gains post-entraînement · début Harness · kill line · runbook en six étapes

DeepSeek V4-Flash-0731 benchmarks officiels août 2026
Le 31 juillet 2026, DeepSeek a promu V4-Flash-0731 en build API officiel : même architecture 284B que la préversion d'avril, mais un rerun complet de post-entraînement bat désormais la préversion V4-Pro plus lourde sur les benchmarks agent — à des tarifs listes d'environ 1/36 à 1/179 de Claude Opus 4.8. Si vous voulez une chronologie claire, une lecture honnête de la solidité des scores et un face-à-face avec Kimi K3 et Qwen3.8-Max, cet article couvre : ① ce qui a réellement été livré versus ce qui reste « coming soon » ; ② tarifs fournisseur face aux indices Artificial Analysis ; ③ un runbook d'adoption en six étapes sur les données du 5 août.
01

Ce qui a réellement été livré le 31 juillet — et ce qui ne l'a pas été

Lire « DeepSeek V4 officiel » laisse penser à un nouveau modèle. Ce n'est pas le cas. Le mouvement du 31 juillet est un rafraîchissement post-entraînement sur le même squelette Flash. La V4-Pro flagship GA et le framework agent Harness maison restent non publiés, sans date ferme.

01

Pas de montée en échelle : DeepSeek affirme que les gains viennent entièrement du post-entraînement, pas de la croissance paramétrique — un Flash 284B/13B bat maintenant une préversion Pro 1,6T/49B sur plusieurs tâches agent.

02

Déploiement API uniquement : Le build officiel est en bêta publique API seulement ; l'app grand public et le chat web n'ont pas été mis à jour.

03

Alias legacy retirés : deepseek-chat et deepseek-reasoner ont été arrêtés le 24 juillet — les pipelines non migrés échouent brutalement.

04

Pression concurrentielle : Kimi K3 de Moonshot (2,8T open weights) est arrivé le 27 juillet, quelques jours avant la promotion Flash de DeepSeek.

05

Pro GA toujours floue : Les forums chinois ont raillé les retards « promesses vides » avant la surprise Flash ; le calendrier V4-Pro officiel reste non confirmé.

DateÉvénement
24/04/2026Préversion V4 : V4-Pro (1,6T/49B) + V4-Flash (284B/13B), contexte 1M, poids MIT
24/07/2026Noms de modèles legacy retirés ; trafic routé vers la famille V4
27/07/2026Poids Kimi K3 2,8T sur Hugging Face
31/07/2026V4-Flash-0731 bêta API officielle + poids ; changelog nomme Harness « coming soon »
05/08/2026V4-Pro GA toujours « dès que possible » ; fenêtres 10–20 août sont des rumeurs non confirmées
02

Tarifs DeepSeek V4-Flash vs Kimi K3 et Qwen3.8-Max

ModèleStatutTotal / ActifContexteEntrée miss/hit ($/1M)Sortie ($/1M)Licence
V4-Flash-0731Officiel 31/07284B / 13B1M0,14 $ / 0,0028 $0,28 $MIT
V4-ProPréversion1,6T / 49B1M0,435 $ / 0,003625 $0,87 $MIT
Kimi K3Poids 27/072,8T / ~104B est.~1,05M3,00 $ / 0,30 $15,00 $MIT modifiée
GLM-5.2Open juin 2026~744B / ~40B1MNon vérifié iciNon vérifiéMIT
Qwen3.8-MaxAPI GA 02/082,4T / 95B1M2,00 $ / ~0,17–0,25 $6,00 $Poids promis

Tous les chiffres sont des tarifs listes publiés par les fournisseurs. DeepSeek a annoncé une future surcharge 2× en heures de pointe (9h–12h et 14h–18h heure de Pékin) sans date d'effet. Voir notre décryptage V4 GA du 20 juillet pour le récit GA antérieur ; cet article se concentre sur le build Flash officiel du 31 juillet.

Calcul fournisseur vs Claude Opus 4.8 : environ 36× en entrée cache miss, 179× en entrée cache hit, 89× en sortie — tarifs listes, pas totaux audités.

03

Comment DeepSeek a tiré plus du même modèle : post-entraînement, CSA+HCA, Harness

V4-Flash-0731 est identique en taille et structure à la préversion d'avril. DeepSeek attribue le bond des benchmarks agent entièrement à une nouvelle passe de post-entraînement — à contre-courant de l'hypothèse « plus gros égale mieux » dans la course aux modèles 2026.

01

Attention hybride CSA+HCA : Compressed Sparse Attention plus Heavily Compressed Attention, commercialisée DSA, réduit calcul et mémoire sur long contexte.

02

Hyper-connexions mHC : Manifold-Constrained Hyper-Connections affinent les chemins résiduels pour la stabilité.

03

Optimiseur Muon : Remplace les optimiseurs classiques ; DeepSeek affirme qu'à 1M tokens V4-Pro n'a besoin que de 27 % des FLOPs par token de V3.2 et de 10 % du cache KV.

Le 31 juillet a aussi marqué la première mention officielle de DeepSeek Harness — un exécuteur agent maison positionné face à Claude Code. Chaque score agent publié par DeepSeek pour Flash-0731 (Terminal Bench 2.0, Toolathlon, etc.) utilisait le mode minimal Harness, qui n'est pas encore public. Le changelog avertit lui-même que les scores agent sont « extrêmement sensibles au choix du harness ».

Note : Score fournisseur Terminal Bench 2.0 : Flash-0731 82,7 vs préversion V4-Pro 67,9 — effort max, top_p 0,95, temperature 1,0, mode minimal Harness.

04

La mêlée open weight chinoise : indice Artificial Analysis et runbook en six étapes

ModèleLaboIntelligence IndexCoût par tâche (AA)Note
V4-Flash-0731DeepSeek500,03 $Officiel 31/07
Kimi K3Moonshot570,86 $Index supérieur, ~29× le coût
GLM-5.2Zhipu~1 pt au-dessus de FlashNon vérifiéOpen juin 2026
GPT-5.6 SolOpenAI9+ pts au-dessus1,86 $Fermé
Claude Fable 5Anthropic9+ pts au-dessus3,15 $Fermé

L'Intelligence Index et les coûts par tâche citent Artificial Analysis via la presse financière ; les scores agent de DeepSeek utilisent d'autres harness — ne pas fusionner les deux colonnes. DeepSeek ne chasse pas les couronnes de leaderboard ; il optimise pour « assez intelligent à un prix que personne d'autre n'atteint », ce qui explique aussi sept semaines en tête d'OpenRouter pour la préversion.

01

Pointer votre client : Définir model sur deepseek-v4-flash, garder base_url sur https://api.deepseek.com ; formats SDK OpenAI et Anthropic fonctionnent tous deux.

02

Nettoyer les noms legacy : Chercher deepseek-chat et deepseek-reasoner dans repos et CI.

03

Régression staging : Changer les noms de modèle en pré-prod, comparer qualité pipeline agent, latence et taux de cache hit.

04

Maximiser le cache de prompt : Épingler les prompts système stables en tête des messages (0,0028 $/M entrée en cache).

05

Routage par palier : Flash pour le volume et le routage ; préversion V4-Pro pour le raisonnement lourd jusqu'à la GA officielle.

06

Surveiller la GA Harness : Suivre changelog et Hugging Face ; relancer les benchmarks agent une fois Harness public.

05

Réserves sur les benchmarks, « kill line » et données brutes citables

A

Dépendance Harness : Les scores agent à la une sont fournisseur plus framework non publié — attendre les reproductions Claude Code / Cursor.

B

Lacunes d'usage : Les retours de développeurs à l'étranger citent de faibles taux de cache hit et des timeouts occasionnels du classificateur de sécurité — les plafonds de calcul comptent toujours.

C

« Kill line » (斩杀线) : Argot dev chinois pour le combo assez-bon-plus-pas-cher de DeepSeek qui force les rivaux à battre sur capacité ou prix — contexte pour la baisse de 80 % de GPT-5.6 Luna.

Nvidia, Broadcom et AMD ont réagi modérément le 31 juillet — les marchés traitent désormais « l'efficacité DeepSeek » comme de l'ingénierie routinière, contrairement à la vente massive de puces début 2025 autour de R1. Les rapports d'un tour de financement ~7,4 Md$ et de préparation IPO proviennent de médias financiers anonymes, pas de dépôts réglementaires — contexte seulement.

Exécuter V4-Flash localement via antirez ds4 exige 96 Go de mémoire unifiée. L'usage API pur évite le matériel local, mais les pipelines agent haute fréquence exigent des hôtes stables 24/7. Les Mac grand public et les VPS sous-dimensionnés swap-thrashent sur long contexte ; les essais courts stressent rarement les chemins à 1M tokens. Pour un CI/CD iOS et une automatisation agent plus stables, la location cloud Mac Mini MESHLAUNCH est en général le meilleur pari production : Apple Silicon dédié, paliers mémoire élastiques, facturation jour/semaine/mois. Tarifs : page location ; configuration : centre d'aide.

FAQ

Oui. V4-Pro et V4-Flash, y compris Flash-0731 du 31/07, sont publiés en poids MIT sur Hugging Face pour usage commercial. Tarifs cloud sur notre page location.

Tarifs listes fournisseur : environ 36× en entrée cache miss, 179× en entrée cache hit, 89× en sortie vs Claude Opus 4.8 par million de tokens.

Aucune date confirmée. Le changelog indique « dès que possible ». Les fenêtres 10–20 août sont des rumeurs non confirmées.

SWE-bench Verified et suites tierces similaires pèsent davantage. Terminal Bench 2.0 a utilisé Harness non publié — traiter comme spécifique au harness jusqu'à reproduction ailleurs.

Exécuteur agent maison de DeepSeek vs Claude Code — éditions fichiers, appels d'outils, ingénierie multi-étapes. Nommé le 31/07 ; pas encore public. Configuration Mac cloud dans le centre d'aide.