Classement OpenRouter juillet 2026
Qui gagne la guerre du trafic IA ?

Trafic réel au 25/07 · Chine ~46% · volume ≠ qualité · Hermes Agent 45% · prévisions août

Parts fournisseurs classement modèles IA OpenRouter juillet 2026
En juillet 2026, le marché des modèles ne se joue plus sur les communiqués de presse, mais sur les flux de tokens payants. OpenRouter, la plus grande plateforme neutre de routage, ne mesure pas les benchmarks : elle révèle où les équipes envoient réellement leurs requêtes. Cette analyse s'adresse aux développeurs et décideurs techniques qui routent via OpenRouter. Données au 25 juillet 2026 : ① top 12 modèles et parts fournisseurs ; ② la fracture « haltère » entre volume et qualité ; ③ la couche applicative (Hermes Agent, Kilo Code, roleplay) ; ④ matrice tarifaire et scénarios ; ⑤ cinq tendances pour août et un runbook de routage en six étapes.
01

Juillet : Xiaomi en tête, la Chine atteint ~46% des tokens

Le classement OpenRouter trie par volume de tokens — c'est le baromètre de l'usage réel, pas de l'intelligence affichée. Au 25 juillet, le podium quotidien est tenu par Xiaomi Mimo V2.5 (1,4T/jour), DeepSeek V4 Flash (943,9B/jour) et Tencent Hy3 (590B/jour). Sept modèles sur dix sont chinois ; seuls Nemotron 3 Ultra (NVIDIA), Claude et Gemini maintiennent des positions américaines.

RangModèleÉditeurTokens/jourCumul 30 j.
1Mimo V2.5Xiaomi1,4T31,2T
2DeepSeek V4 FlashDeepSeek943,9B23,6T
3Hy3Tencent590B23,4T
4Nemotron 3 Ultra (gratuit)NVIDIA428,6B9T
5DeepSeek V4 ProDeepSeek413,7B11,6T
6GLM 5.2Z.ai316,7B13,3T
7MiniMax M3MiniMax262,5B15,1T
8Step 3.7 FlashStepFun204,8B5,9T
9Kimi K3Moonshot AI157,6B1,6T (nouveau)
10Ling 3.0 FlashAnt InclusionAI128,3B417,3B
11Gemini 3 Flash PreviewGoogle106,3B4T
12Claude Sonnet 5Anthropic99,5B3,6T

À l'échelle des éditeurs, les laboratoires chinois totalisent ~46% des tokens — contre moins de 2% il y a un an. Le trio américain (OpenAI, Anthropic, Google) est passé d'environ 70% à 30–36%. La logique est tarifaire : DeepSeek V4 Flash à ~$0,05–0,14/M contre GPT-5.5 à ~$5/M, soit un écart d'environ 35×.

01

DeepSeek, fournisseur le plus stable : ~16–18% de part, mais le « champion du mois » change souvent.

02

Xiaomi, la plus forte volatilité : Mimo V2.5 fait osciller la part entre 8% et 18%.

03

Kimi K3, meilleure progression : entrée directe dans le top 9, poids ouverts record de 1,4TB.

04

Variabilité quotidienne : Claude Opus 4.8 encore top 10 le 24/07, évincé par Ling 3.0 Flash le 25/07.

05

Instantané ≠ tendance : la durée en tête compte plus qu'un seul jour de classement.

02

Le classement reflète-t-il la qualité ? La structure en haltère

Point essentiel : OpenRouter classe le volume, pas la capacité. Des modèles rapides et peu chers, portés par des applications à fort trafic, dominent le haut du tableau — même lorsque le raisonnement complexe reste moyen.

DimensionPar volume de tokensPar dépenses (tâches difficiles)
SommetOpen weights chinois bon marchéClaude Sonnet 4.6 / Opus 4.7 à 13,5% chacun
Workloads typiquesChat, créatif, roleplay, code simpleRaisonnement complexe, agents entreprise, classification
Logique prixVolume, tolérance aux erreurs, écart 35×Flagships fermés à $5/$25
Exemple juilletMimo V2.5 : 1,4T/jourClaude Opus 5 : 43,3% FrontierBench v0.1

Le marché se segmente naturellement : les open weights abordables absorbent les tâches à faible barrière ; les modèles fermés conservent le pouvoir de prix et la réputation sécurité sur les charges difficiles.

Répartition des dépenses par type de tâche : dialogue général 35,7%, workflows agent 30,4%, code 26,5%, traitement de données 7,5%. En classification et raisonnement avancé, GPT-5.5 occupe 11,6% (3e place) — les modèles bon marché du classement volume y sont quasi absents. Claude Opus 5 (annoncé le 24/07) atteint 43,3% sur FrontierBench v0.1 (GPT-5.6 Sol : 37,5%), au tarif Opus $5/$25 par million de tokens.

ModèleInput/MOutput/MPositionnement
DeepSeek V4 Flash$0,05–0,14$0,24–0,28Roi du rapport qualité-prix, agentic coding
GLM 5.2$0,45$3,31Planification proche d'Opus, open weights
MiniMax M3$0,10$1,21Long contexte et multimodal économique
Kimi K3~$3~$151,4TB open weights, niveau fermé
Claude Opus 5$5 (fast $10)$25 (fast $50)Flagship fermé, meilleur benchmark de juillet
03

Couche applicative : les agents de code et le roleplay invisible

Les classements modèles indiquent « quel cerveau » ; la couche apps (openrouter.ai/apps) montre à quoi il sert en production.

RangApplicationTypePart (env.)
1Hermes AgentAgent personnel / CLI~45%
2Kilo CodeAgent de code~13%
3OpenClawAgent universel~9%
4Claude CodeAgent de code~6%
5DescriptProduction de contenu~4,5%
6–10pi, Lemonade, ISEKAI ZERO, Janitor AI, ClineAgent / roleplay1,7%–3,3%

Observation : la lignée Cline → Roo Code → Kilo Code illustre trois générations d'agents de code ; Kilo Code a dépassé ses prédécesseurs. L'étude OpenRouter × a16z « State of AI » estime que le roleplay créatif représente plus de la moitié du volume open source — une réalité rarement couverte par la presse entreprise.

ScénarioModèle recommandéRaison
Code quotidien / agenticDeepSeek V4 FlashMeilleur rapport coût-efficacité, 2e en volume
Planification open sourceGLM 5.2Qualité de planification proche d'Opus
Raisonnement complexeClaude Opus 5 / Sonnet 5Leader des dépenses sur tâches difficiles
Long contexte ouvertKimi K31M de contexte, poids 1,4TB
Multimodal budgetMiniMax M3Entrée image économique
Open weights USNemotron 3 UltraÉcosystème NVIDIA, tier gratuit
04

Comment choisir son API ? Runbook de routage en six étapes

01

Classer les workloads : séparer volume (chat, résumés, complétions simples) et tâches difficiles (raisonnement, agents à risque). Interdire le modèle unique pour tout.

02

Couche volume : DeepSeek V4 Flash par défaut — input $0,05–0,14/M ; GLM 5.2 si la planification open source est requise.

03

Couche difficile : réserver Claude Opus 5 — uniquement après échecs répétés du tier économique ; routage hybride plutôt qu'Opus systématique.

04

Endpoint unifié OpenRouter — une clé, des centaines de modèles, idéal pour l'A/B ; prévoir 180–250ms de latence Europe→US.

05

Intégrer sécurité et conformité : incidents de sandbox, historique éditeur, moindre privilège pour les agents ; cadre RGPD si données personnelles transitent.

06

Hébergement 7×24 : passerelle agent sur Mac cloud plutôt que portable en veille ; configuration dans le centre d'aide.

Routage hybride OpenRouter
curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -d '{
    "models": [
      "deepseek/deepseek-v4-flash",
      "anthropic/claude-opus-5"
    ],
    "messages": [{"role": "user", "content": "Plan a multi-step refactor..."}]
  }'
05

Août 2026 : prévisions et chiffres citables

À partir de la trajectoire de juillet, voici nos scénarios pour août :

1

Part chinoise vers 50% — sans baisse de prix majeure côté US (aucun signal actuel).

2

Champion mensuel toujours instable — guerre des prix entre Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot.

3

Anthropic pourrait lancer des gammes abordables — Opus 5 est le quatrième flagship en deux mois ; stratégie multi-prix.

4

Kimi K3 1,4TB : quantification communautaire sous 2–4 semaines — jusqu'alors, surtout les clouds d'inférence en bénéficient.

5

Sécurité et conformité comme variables de choix — loi US « AI Kill Switch » et cadre de revue des modèles frontier attendus avant août.

A

Part tokens Chine : ~46% (il y a 12 mois <2%) — l'une des migrations de parts les plus abruptes du secteur IA.

B

Part Hermes Agent : ~45% — plus grande application unique sur OpenRouter.

C

Écart DeepSeek vs GPT-5.5 : input environ 35× ($0,05–0,14/M vs ~$5/M).

Attention : le classement évolue chaque jour — vérifier openrouter.ai/rankings avant mise en production.

La leçon de juillet : capacité et popularité divergent. Mieux vaut investir dans l'évaluation et le routage par paliers que de courir après le numéro un du jour.

Faire tourner une passerelle multi-modèles sur un portable expose aux veilles, à la RAM et au réseau. Pour Hermes Agent, OpenClaw ou une CI multi-modèles en 7×24, MESHLAUNCH propose la location Mac Mini cloud bare-metal : Apple Silicon dédié, facturation jour/semaine/mois. Tarifs : page location.

FAQ

Au 25 juillet : Xiaomi Mimo V2.5 avec 1,4T tokens/jour, puis DeepSeek V4 Flash (943,9B) et Tencent Hy3 (590B). Kimi K3 entre au 9e rang.

Non — volume de tokens ≠ intelligence. Sur les tâches difficiles, Claude Sonnet 4.6 et Opus 4.7 mènent à 13,5% chacun. Hébergement stable : tarifs location.

Code : tester DeepSeek V4 Flash et GLM 5.2 ; réserver Claude Opus 5 aux étapes bloquées. OpenRouter en bac à sable ; production avec hébergement conforme.

Déployer OpenRouter/LiteLLM sur Mac cloud 7×24. Région et configuration : centre d'aide ; location journalière ou mensuelle selon le projet.