Ce qui s’est passé entre le 12 et le 17 août 2026
Les trois mouvements semblent contradictoires jusqu’à ce qu’on les lise comme un seul signal. Les laboratoires chinois ne se battent plus seulement sur l’étiquette. Ils se battent pour le droit de fixer le prix.
16 juillet · Kimi K3 : Moonshot ouvre Kimi K3 à 2,8 billions de paramètres et attire l’attention sécuritaire américaine.
2–3 août · API Qwen : Alibaba prévisualise Qwen3.8-Max puis lance l’API hébergée.
10 août · Contraste Meta : Muse Glimmer sort à 30 milliards sous Apache 2.0. Meta annonce des poids ouverts pour le fleuron fermé Muse Spark 1.2.
12 août · Poids publics : Alibaba publie Qwen3.8-2.4T-A95B sur Hugging Face et ModelScope. Le même jour, xAI livre Grok 4.6.
13–14 août · Hausse et post-entraînement : DeepSeek-V4-Pro passe en GA et annonce une hausse au 17 août. Google sort un Gemini 3.7 Flash moins cher. Zhipu suit avec GLM-5.3 sur la base 743 milliards de GLM-5.2.
17 août, 00:00 Pékin · Nouveaux tarifs : Le 30 juillet, OpenAI a baissé GPT-5.6 Luna de 80 %. Les 6–7 août, Luna est devenue le modèle gratuit par défaut, texte illimité. Pendant que la Chine hausse et ouvre, les États-Unis descendent vers le gratuit côté grand public.
Repère : La presse financière chinoise y voit un repricing mondial forcé. La presse tech anglophone traite souvent chaque sortie comme une actualité produit isolée. Les deux cadres se complètent.
Grille DeepSeek, spécifications Qwen3.8-Max, benches GLM-5.3
Les 1100 % ne concernent que l’entrée cache-hit de V4-Pro aux heures de pointe, la ligne qui partait presque de zéro. La sortie, qui pèse sur la plupart des factures, a monté de 350 %. Les heures de pointe sont 9–12 h et 14–18 h, heure de Pékin. Tous les montants sont pour 1 million de tokens.
| Poste (par 1M tokens) | Ancien | Hors pointe | Pointe | Hausse pointe |
|---|---|---|---|---|
| V4-Flash entrée cache-hit | ¥0,02 | ¥0,05 | ¥0,10 | ~400 % |
| V4-Flash entrée cache-miss | ¥1,0 | ¥1,5 | ¥3,0 | 200 % |
| V4-Flash sortie | ¥2,0 | ¥4,5 | ¥9,0 | 350 % |
| V4-Pro entrée cache-hit | ¥0,025 | ¥0,15 | ¥0,30 | ~1100 % |
| V4-Pro entrée cache-miss | ¥3,0 | ¥4,5 | ¥9,0 | 200 % |
| V4-Pro sortie | ¥6,0 | ¥13,5 | ¥27,0 | 350 % |
Une modélisation tierce place une charge lourde réaliste (environ 84M tokens, surtout hors pointe, moitié de hits) plus près de 1,8 fois que de 12 fois.
Qwen3.8-2.4T-A95B est le premier modèle Max ouvert par Alibaba. Qwen3.5, 3.6 et 3.7 Max restaient API uniquement.
| Critère | Détail |
|---|---|
| Paramètres | 2,4 billions au total, 95 milliards actifs (MoE, 512 experts, 10 routés + 1 partagé) |
| Contexte | 262 144 tokens natifs, extensible à ~1,01M ; Max hébergé à 1M par défaut |
| Cadence | Aperçu 2 août → API 3 août → poids 12 août |
| API internationale | 2 $ / M en entrée, 6 $ / M en sortie |
| Licence | Pas Apache 2.0. Licence Qwen3.8-Max propriétaire |
GLM-5.3 réutilise la base 743 milliards de GLM-5.2. Les chiffres viennent de Zhipu. Aucune reprise tierce n’a encore été publiée.
| Banc d’essai | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 |
| CyberGym | 77,2 % | 84,5 % | +7,3 |
| AutomationBench | 26,2 % | 48,2 % | +22,0 |
Réserve : Sur Terminal-Bench 3.0, GLM-5.3 reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %). C’est un sommet open-weight, pas une victoire frontier fermée.
DeepSeek reste-t-il le fleuron le moins cher après la hausse ?
Non. Le V4-Pro hors pointe reste nettement sous Claude Opus 5. Il n’est plus le moins cher du tableau. L’API internationale Qwen3.8-Max et Luna d’OpenAI sous-cotent DeepSeek hors pointe sur au moins un axe.
Lire la hausse comme un virage premium est une erreur. L’ancien tarif plat tenait tant que les GPU suivaient. Quand l’usage croît plus vite que l’offre, la grille doit montrer la contrainte. « Encourager une planification plus souple » signifie : le compute de pointe est rare, décalez la charge vous-même.
Un détail que la couverture internationale a souvent manqué : aux heures de pointe, l’API officielle dépasse déjà plusieurs revendeurs, dont GMI Cloud et Novita. L’hypothèse « l’officiel est toujours le moins cher » est rompue.
Alibaba publie les 2,4 billions et attache une licence maison, pas Apache 2.0. Un MaaS ou un assistant de travail IA à plus de 50 millions de dollars sur 12 mois doit négocier une licence commerciale. Un produit à plus de 100 millions d’actifs mensuels ou 20 millions de dollars de revenu mensuel doit afficher le nom du modèle. Ce n’est pas le même degré d’ouverture que Muse Glimmer de Meta, sous Apache 2.0 sans clause extra.
La rumeur d’une interdiction de téléchargement pour les États-Unis, l’UE, le Royaume-Uni ou la Corée du Sud est fausse. Le texte publié n’a aucune clause territoriale.
Chez GLM-5.3, c’est la méthode qui compte. Même base 743 milliards, pas de réentraînement, Terminal-Bench 3.0 de 4,6 % à 28,3 % en élargissant les environnements RL en post-entraînement. Quand le pré-entraînement s’essouffle, le RL de post-entraînement devient un levier moins cher qu’un nouveau modèle de fondation — un argument qui parle aussi aux studios créatifs qui enchaînent agents et pipelines Apple Silicon.
| Modèle | Entrée / 1M tokens | Sortie / 1M tokens | Poids ouverts |
|---|---|---|---|
| DeepSeek V4-Pro (pointe) | ¥9,0 (~1,26 $) | ¥27,0 (~3,78 $) | Non |
| DeepSeek V4-Pro (hors pointe) | ¥4,5 (~0,63 $) | ¥13,5 (~1,89 $) | Non |
| Qwen3.8-Max (API internationale) | 2,00 $ | 6,00 $ | Oui (licence maison) |
| OpenAI GPT-5.6 Luna | 0,20 $ | 1,20 $ | Non |
| Claude Opus 5 (ratio Alibaba) | ~5,00 $ | ~25,00 $ | Non |
Beijing peak: 09:00-12:00 and 14:00-18:00 CST = 03:00-06:00 and 08:00-12:00 CEST (août 2026) FX ref ≈ ¥7.15 / $1
« Modèle chinois = modèle le moins cher » tenait en 2025 et début 2026. Ce n’est plus une hypothèse sûre.
Six étapes pour lire la nouvelle facture DeepSeek et la licence Qwen
Ne reconfigurez pas la pile à partir d’un multiple de une. Séparez d’abord la ligne, l’horloge et le seuil de licence.
Nommer la ligne : 1100 %, 350 % et 200 % sont tous justes. Ils décrivent l’entrée cache-hit, la sortie et l’entrée cache-miss. Les factures bougent avec les deux derniers.
Caler la journée de travail sur la pointe de Pékin : 9–12 h et 14–18 h. Les matinées d’Europe de l’Ouest recoupent la seconde fenêtre. Décalez explicitement batch et boucles d’évaluation.
Estimer via le taux de hits : Un mix lourd hors pointe, environ moitié de hits, a été modélisé vers 1,8 fois. Pointe plus faible hit rate, et les 350 % / 1100 % deviennent réels.
Vérifier les seuils Qwen : Usage personnel et interne sans impact. Licence commerciale séparée au-delà de 50 millions de dollars sur 12 mois pour MaaS ou assistant de travail IA. Affichage du nom au-delà de 100 millions de MAU ou 20 millions de dollars de revenu mensuel. Pas d’interdiction géographique.
Traiter GLM-5.3 comme un résultat de post-entraînement : Même base 743 milliards. Benches constructeur seulement. Garder l’étiquette « première ligue ouverte, pas vainqueur frontier fermé » jusqu’à une reprise tierce.
Séparer API officielle, revendeurs et poids locaux : La pointe officielle peut perdre face à GMI Cloud ou Novita. Les poids ouverts déplacent le coût des tokens vers la mémoire et la disponibilité. Pour une machine qui ne s’endort pas, commencez par les tarifs MESHLAUNCH et le centre d’aide.
Affirmations non vérifiées, deux guerres de prix, trois chiffres citables
Gardez ces quatre points hors de la colonne « confirmé » tant que les sources primaires n’ont pas rattrapé :
Le titre 1100 % : Exact techniquement, trompeur sans la ligne. Uniquement l’entrée cache-hit de pointe.
Silicium Zhenwu M890 : Plusieurs médias financiers chinois affirment qu’une partie de l’inférence Qwen3.8-Max tourne sur les puces maison Zhenwu M890 et les supernœuds « Pangu AL128 ». Alibaba n’a pas publié de docs techniques indépendants ni de benches tiers. À traiter comme non vérifié.
Une faille « grave » dans Cursor : VentureBeat et Zhipu. Les détails techniques ne sont pas publics. Source constructeur, non auditée.
Contrôles d’export de représailles : Les reports sur d’éventuelles mesures du ministère chinois du Commerce restent spéculatifs. Aucune annonce officielle.
La presse financière intérieure appelle le mois écoulé « trois mises à jour de modèles par semaine ». DeepSeek, Alibaba et Zhipu s’ajoutent à Kimi K3 (2,8 billions, 16 juillet) et MiniMax H3. Les labos américains ont joué l’inverse côté grand public : Luna moins 80 % le 30 juillet, puis gratuite et illimitée les 6–7 août ; Gemini 3.7 Flash le 13 août à la moitié du prix de son prédécesseur de trois semaines.
Il existe aussi une lecture géopolitique que la presse tech anglophone a largement laissée de côté. Kimi K3 avait déjà attiré un examen de sécurité américain. Certains analystes voient dans la sortie 2,4 billions d’Alibaba, à cette fenêtre précise, une tentative de verrouiller l’esprit international et un récit de parité technique avant un durcissement possible. C’est une interprétation, pas un fait établi. Elle reste utile pour le timing.
Trois chiffres citables : ① Entrée cache-hit de pointe V4-Pro ¥0,025 → ¥0,30 (~1100 %) ; sortie ¥6,0 → ¥27,0 (350 %). ② Qwen3.8-2.4T-A95B : 2,4 billions / 95 milliards actifs ; API internationale 2 $ / 6 $. ③ GLM-5.3 Terminal-Bench 3.0 : 4,6 % → 28,3 % sur la même base 743 milliards, chiffre constructeur.
Sources : Annonce tarifaire officielle DeepSeek, recoupée avec Wall Street CN, IT Home, AIGC.cn et V2EX ; dépôts officiels Qwen (Hugging Face / ModelScope) et SCMP sur la licence ; page technique Z.ai GLM-5.3 plus VentureBeat et StableLearn ; Meta AI Research et VentureBeat sur Muse Glimmer ; Yicai et Sohu Finance sur le rythme des sorties. Informations publiques à la date de rédaction.
Les API de pointe punissent les boucles d’évaluation toujours allumées. Les poids ouverts punissent les hôtes qui s’endorment ou partagent leurs ports. Un MacBook refermé ou un VPS bon marché sans Metal fausse les benches locaux et les tests d’agents. Pour un hôte de production qui reste debout pour l’iOS CI/CD et l’automatisation d’agents, une location Mac Mini MESHLAUNCH est en général la solution la plus propre : Apple Silicon dédié, 7×24, termes jour / semaine / mois. Voir la page tarifs et le centre d’aide.
Cela dépend du créneau et du taux de cache. Hors pointe de Pékin (9–12 h et 14–18 h) et avec un bon taux de hits, la facture réelle se situe plutôt autour de 1,8 fois. En pointe et à faible hit rate, on se rapproche des titres 350 % / 1100 %.
L’usage personnel et interne reste largement libre. Une licence commerciale séparée s’applique si un service MaaS ou un assistant de travail IA dépasse 50 millions de dollars de chiffre d’affaires sur 12 mois. Au-delà de 100 millions de MAU ou 20 millions de dollars de revenu mensuel, le nom du modèle doit être visible.
La base est identique : 743 milliards de paramètres, sans nouvel pré-entraînement. Les gains viennent du renforcement d’échelle en post-entraînement.
Non. Le texte publié n’a aucune clause géographique. Les seuils sont liés au chiffre d’affaires, pas au lieu.
Seulement en partie. Muse Glimmer est un modèle distillé de 30 milliards. Le fleuron fermé Muse Spark 1.2 n’est pas encore ouvert. Zuckerberg a dit « bientôt ». Pour un hôte d’évaluation stable, commencez par la page tarifs et le centre d’aide.