Juillet : Xiaomi en tête, la Chine atteint ~46% des tokens
Le classement OpenRouter trie par volume de tokens — c'est le baromètre de l'usage réel, pas de l'intelligence affichée. Au 25 juillet, le podium quotidien est tenu par Xiaomi Mimo V2.5 (1,4T/jour), DeepSeek V4 Flash (943,9B/jour) et Tencent Hy3 (590B/jour). Sept modèles sur dix sont chinois ; seuls Nemotron 3 Ultra (NVIDIA), Claude et Gemini maintiennent des positions américaines.
| Rang | Modèle | Éditeur | Tokens/jour | Cumul 30 j. |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra (gratuit) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot AI | 157,6B | 1,6T (nouveau) |
| 10 | Ling 3.0 Flash | Ant InclusionAI | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
À l'échelle des éditeurs, les laboratoires chinois totalisent ~46% des tokens — contre moins de 2% il y a un an. Le trio américain (OpenAI, Anthropic, Google) est passé d'environ 70% à 30–36%. La logique est tarifaire : DeepSeek V4 Flash à ~$0,05–0,14/M contre GPT-5.5 à ~$5/M, soit un écart d'environ 35×.
DeepSeek, fournisseur le plus stable : ~16–18% de part, mais le « champion du mois » change souvent.
Xiaomi, la plus forte volatilité : Mimo V2.5 fait osciller la part entre 8% et 18%.
Kimi K3, meilleure progression : entrée directe dans le top 9, poids ouverts record de 1,4TB.
Variabilité quotidienne : Claude Opus 4.8 encore top 10 le 24/07, évincé par Ling 3.0 Flash le 25/07.
Instantané ≠ tendance : la durée en tête compte plus qu'un seul jour de classement.
Le classement reflète-t-il la qualité ? La structure en haltère
Point essentiel : OpenRouter classe le volume, pas la capacité. Des modèles rapides et peu chers, portés par des applications à fort trafic, dominent le haut du tableau — même lorsque le raisonnement complexe reste moyen.
| Dimension | Par volume de tokens | Par dépenses (tâches difficiles) |
|---|---|---|
| Sommet | Open weights chinois bon marché | Claude Sonnet 4.6 / Opus 4.7 à 13,5% chacun |
| Workloads typiques | Chat, créatif, roleplay, code simple | Raisonnement complexe, agents entreprise, classification |
| Logique prix | Volume, tolérance aux erreurs, écart 35× | Flagships fermés à $5/$25 |
| Exemple juillet | Mimo V2.5 : 1,4T/jour | Claude Opus 5 : 43,3% FrontierBench v0.1 |
Le marché se segmente naturellement : les open weights abordables absorbent les tâches à faible barrière ; les modèles fermés conservent le pouvoir de prix et la réputation sécurité sur les charges difficiles.
Répartition des dépenses par type de tâche : dialogue général 35,7%, workflows agent 30,4%, code 26,5%, traitement de données 7,5%. En classification et raisonnement avancé, GPT-5.5 occupe 11,6% (3e place) — les modèles bon marché du classement volume y sont quasi absents. Claude Opus 5 (annoncé le 24/07) atteint 43,3% sur FrontierBench v0.1 (GPT-5.6 Sol : 37,5%), au tarif Opus $5/$25 par million de tokens.
| Modèle | Input/M | Output/M | Positionnement |
|---|---|---|---|
| DeepSeek V4 Flash | $0,05–0,14 | $0,24–0,28 | Roi du rapport qualité-prix, agentic coding |
| GLM 5.2 | $0,45 | $3,31 | Planification proche d'Opus, open weights |
| MiniMax M3 | $0,10 | $1,21 | Long contexte et multimodal économique |
| Kimi K3 | ~$3 | ~$15 | 1,4TB open weights, niveau fermé |
| Claude Opus 5 | $5 (fast $10) | $25 (fast $50) | Flagship fermé, meilleur benchmark de juillet |
Couche applicative : les agents de code et le roleplay invisible
Les classements modèles indiquent « quel cerveau » ; la couche apps (openrouter.ai/apps) montre à quoi il sert en production.
| Rang | Application | Type | Part (env.) |
|---|---|---|---|
| 1 | Hermes Agent | Agent personnel / CLI | ~45% |
| 2 | Kilo Code | Agent de code | ~13% |
| 3 | OpenClaw | Agent universel | ~9% |
| 4 | Claude Code | Agent de code | ~6% |
| 5 | Descript | Production de contenu | ~4,5% |
| 6–10 | pi, Lemonade, ISEKAI ZERO, Janitor AI, Cline | Agent / roleplay | 1,7%–3,3% |
Observation : la lignée Cline → Roo Code → Kilo Code illustre trois générations d'agents de code ; Kilo Code a dépassé ses prédécesseurs. L'étude OpenRouter × a16z « State of AI » estime que le roleplay créatif représente plus de la moitié du volume open source — une réalité rarement couverte par la presse entreprise.
| Scénario | Modèle recommandé | Raison |
|---|---|---|
| Code quotidien / agentic | DeepSeek V4 Flash | Meilleur rapport coût-efficacité, 2e en volume |
| Planification open source | GLM 5.2 | Qualité de planification proche d'Opus |
| Raisonnement complexe | Claude Opus 5 / Sonnet 5 | Leader des dépenses sur tâches difficiles |
| Long contexte ouvert | Kimi K3 | 1M de contexte, poids 1,4TB |
| Multimodal budget | MiniMax M3 | Entrée image économique |
| Open weights US | Nemotron 3 Ultra | Écosystème NVIDIA, tier gratuit |
Comment choisir son API ? Runbook de routage en six étapes
Classer les workloads : séparer volume (chat, résumés, complétions simples) et tâches difficiles (raisonnement, agents à risque). Interdire le modèle unique pour tout.
Couche volume : DeepSeek V4 Flash par défaut — input $0,05–0,14/M ; GLM 5.2 si la planification open source est requise.
Couche difficile : réserver Claude Opus 5 — uniquement après échecs répétés du tier économique ; routage hybride plutôt qu'Opus systématique.
Endpoint unifié OpenRouter — une clé, des centaines de modèles, idéal pour l'A/B ; prévoir 180–250ms de latence Europe→US.
Intégrer sécurité et conformité : incidents de sandbox, historique éditeur, moindre privilège pour les agents ; cadre RGPD si données personnelles transitent.
Hébergement 7×24 : passerelle agent sur Mac cloud plutôt que portable en veille ; configuration dans le centre d'aide.
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-d '{
"models": [
"deepseek/deepseek-v4-flash",
"anthropic/claude-opus-5"
],
"messages": [{"role": "user", "content": "Plan a multi-step refactor..."}]
}'
Août 2026 : prévisions et chiffres citables
À partir de la trajectoire de juillet, voici nos scénarios pour août :
Part chinoise vers 50% — sans baisse de prix majeure côté US (aucun signal actuel).
Champion mensuel toujours instable — guerre des prix entre Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot.
Anthropic pourrait lancer des gammes abordables — Opus 5 est le quatrième flagship en deux mois ; stratégie multi-prix.
Kimi K3 1,4TB : quantification communautaire sous 2–4 semaines — jusqu'alors, surtout les clouds d'inférence en bénéficient.
Sécurité et conformité comme variables de choix — loi US « AI Kill Switch » et cadre de revue des modèles frontier attendus avant août.
Part tokens Chine : ~46% (il y a 12 mois <2%) — l'une des migrations de parts les plus abruptes du secteur IA.
Part Hermes Agent : ~45% — plus grande application unique sur OpenRouter.
Écart DeepSeek vs GPT-5.5 : input environ 35× ($0,05–0,14/M vs ~$5/M).
Attention : le classement évolue chaque jour — vérifier openrouter.ai/rankings avant mise en production.
La leçon de juillet : capacité et popularité divergent. Mieux vaut investir dans l'évaluation et le routage par paliers que de courir après le numéro un du jour.
Faire tourner une passerelle multi-modèles sur un portable expose aux veilles, à la RAM et au réseau. Pour Hermes Agent, OpenClaw ou une CI multi-modèles en 7×24, MESHLAUNCH propose la location Mac Mini cloud bare-metal : Apple Silicon dédié, facturation jour/semaine/mois. Tarifs : page location.
Au 25 juillet : Xiaomi Mimo V2.5 avec 1,4T tokens/jour, puis DeepSeek V4 Flash (943,9B) et Tencent Hy3 (590B). Kimi K3 entre au 9e rang.
Non — volume de tokens ≠ intelligence. Sur les tâches difficiles, Claude Sonnet 4.6 et Opus 4.7 mènent à 13,5% chacun. Hébergement stable : tarifs location.
Code : tester DeepSeek V4 Flash et GLM 5.2 ; réserver Claude Opus 5 aux étapes bloquées. OpenRouter en bac à sable ; production avec hébergement conforme.
Déployer OpenRouter/LiteLLM sur Mac cloud 7×24. Région et configuration : centre d'aide ; location journalière ou mensuelle selon le projet.