Juli-Ranking: Xiaomi an der Spitze, China ~46% Token-Anteil
OpenRouter sortiert nach Token-Volumen — das ist der Marktpreis für „was Entwickler wirklich schicken“. Stand 25.7. führen Xiaomi Mimo V2.5 (1,4T/Tag), DeepSeek V4 Flash (943,9B/Tag) und Tencent Hy3 (590B/Tag). Sieben der Top-10-Modelle stammen aus China; nur Nemotron 3 Ultra (NVIDIA), Claude und Gemini halten US-Positionen.
| Rang | Modell | Anbieter | Token/Tag | 30-Tage-Summe |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra (kostenlos) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot AI | 157,6B | 1,6T (neu) |
| 10 | Ling 3.0 Flash | Ant InclusionAI | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
Auf Anbieter-Ebene: chinesische Labs zusammen ~46% Token-Anteil — vor einem Jahr unter 2%. US-Trio (OpenAI, Anthropic, Google) fiel von ~70% auf 30–36%. Treiber ist Preislogik: DeepSeek V4 Flash Input ~$0,05–0,14/M vs. GPT-5.5 ~$5/M — Faktor ~35.
DeepSeek stabil #1 unter Anbietern: ~16–18% Anteil, aber Monats-Champion-Modell wechselt häufig.
Xiaomi höchste Volatilität: Mimo V2.5 treibt Anbieteranteil zwischen 8% und 18%.
Kimi K3 stärkster Aufsteiger: Neu in Top 9, 1,4TB Open Weights — Rekord.
Tages-Schwankungen: Claude Opus 4.8 noch Top-10 am 24.7., am 25.7. von Ling 3.0 Flash verdrängt.
Snapshot ≠ Trend: Entscheidend ist Dauer in der Spitzengruppe, nicht ein einzelner Tag.
Volumen ≠ Qualität: die Hantel-Struktur des Marktes
Klarstellung: OpenRouter rankt Token, nicht Intelligenz. Günstige, schnelle Modelle hinter High-Traffic-Apps landen oben — auch wenn komplexe Reasoning-Tasks schwächer sind.
| Dimension | Nach Token-Volumen | Nach Ausgaben (schwere Tasks) |
|---|---|---|
| Spitze | Günstige China-Open-Weights | Claude Sonnet 4.6 / Opus 4.7 je 13,5% |
| Typische Workloads | Chat, Kreativ, Roleplay, einfaches Coding | Komplexes Reasoning, Enterprise-Agenten, Klassifikation |
| Preislogik | Massenverkehr, fehlertolerant, 35× Spread | Closed-Source-Flaggschiffe $5/$25 |
| Juli-Beleg | Mimo V2.5 1,4T/Tag | Claude Opus 5 FrontierBench v0.1: 43,3% |
Der Markt teilt sich: günstige Open Weights fressen Low-Barrier-Tasks; Closed-Source-Flaggschiffe halten Preissetzung und Sicherheitsreputation bei schweren Aufgaben.
Ausgaben nach Task-Typ: Alltagsdialog 35,7%, Agent-Workflows 30,4%, Code 26,5%, Datenverarbeitung 7,5%. Bei Klassifikation/Reasoning: GPT-5.5 11,6% Rang 3 — Billig-Modelle aus dem Volumen-Ranking fehlen hier fast. Claude Opus 5 (24.7. Release) erreicht 43,3% FrontierBench v0.1 (GPT-5.6 Sol 37,5%), Preis Opus-Serie $5/$25 per M.
Für EU-Enterprise zählt zusätzlich: Prompt-Inhalte über US-Router können DSGVO Art. 44 ff. auslösen — Auftragsverarbeitung, AVV und Datenresidenz müssen in die Modell-Scorecard. Self-Hosting oder EU-Region-Hosting reduziert Transfer-Risiko.
| Modell | Input/M | Output/M | Positionierung |
|---|---|---|---|
| DeepSeek V4 Flash | $0,05–0,14 | $0,24–0,28 | Preis-Leistung, Agentic Coding |
| GLM 5.2 | $0,45 | $3,31 | Opus-ähnliche Planung, Open Weights |
| MiniMax M3 | $0,10 | $1,21 | Long Context, Multimodal Budget |
| Kimi K3 | ~$3 | ~$15 | 1,4TB Open Weights, Closed-Level |
| Claude Opus 5 | $5 (Fast $10) | $25 (Fast $50) | Closed Flagship, Juli-Benchmark #1 |
App-Layer: Hermes Agent dominiert, Roleplay unsichtbar groß
Modell-Rankings zeigen „welches Gehirn“; der App-Layer (openrouter.ai/apps) zeigt wofür es genutzt wird.
| Rang | App | Typ | Anteil (ca.) |
|---|---|---|---|
| 1 | Hermes Agent | Persönlicher Agent / CLI | ~45% |
| 2 | Kilo Code | Coding-Agent | ~13% |
| 3 | OpenClaw | Universal-Agent | ~9% |
| 4 | Claude Code | Coding-Agent | ~6% |
| 5 | Descript | Content-Produktion | ~4,5% |
| 6–10 | pi, Lemonade, ISEKAI ZERO, Janitor AI, Cline | Agent / Roleplay | 1,7%–3,3% |
Datenpunkt: Cline → Roo Code → Kilo Code — drei Generationen einer Code-Linie; Kilo Code hat die Vorfahren überholt. OpenRouter × a16z „State of AI“: kreatives Roleplay trägt >50% des Open-Source-Volumens — in Enterprise-Berichten kaum sichtbar.
| Szenario | Empfohlenes Modell | Begründung |
|---|---|---|
| Alltags-Coding / Agentic | DeepSeek V4 Flash | Bestes Preis-Leistungs-Verhältnis, #2 Volumen |
| Open-Source-Planung | GLM 5.2 | Opus-nahe Planungsqualität |
| Schweres Reasoning | Claude Opus 5 / Sonnet 5 | Führend bei Ausgabenanteil |
| Long Context Open | Kimi K3 | 1M Context, 1,4TB Weights |
| Multimodal Budget | MiniMax M3 | Bild-Input kosteneffizient |
| US Open Weights | Nemotron 3 Ultra | NVIDIA-Stack, Gratis-Tier |
API-Routing: Sechs-Schritte-Runbook für Produktion
Task-Tiers definieren: Massen-Workloads (Chat, Summary, einfache Completions) vs. schwere Tasks (Reasoning, High-Risk-Agenten). Kein Single-Model für alles.
Massen-Layer: DeepSeek V4 Flash default — Input $0,05–0,14/M; GLM 5.2 als Open-Source-Upgrade bei Planungsbedarf.
Schwer-Layer: Claude Opus 5 reservieren — nur bei wiederholten Failures des günstigen Tiers; Hybrid-Routing statt Voll-Opus.
OpenRouter als Unified Endpoint — ein Key, hunderte Modelle, ideal für A/B; Latenz EU→US ~180–250ms einplanen.
DSGVO und Sicherheit in Scorecard: AVV, Datenresidenz, Vendor-Sicherheitshistorie; Sandbox-Escape-Vorfälle bei Enterprise-Agenten berücksichtigen; Berechtigungen minimieren.
7×24-Host für Gateway: Agent-Router auf Cloud-Mac statt schlafendem Laptop; Produktion mit EU-konformem Relay evaluieren — Setup im Hilfezentrum.
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-d '{
"models": [
"deepseek/deepseek-v4-flash",
"anthropic/claude-opus-5"
],
"messages": [{"role": "user", "content": "Plan a multi-step refactor..."}]
}'
August 2026: Prognosen und zitierbare Hard Data
Aus Juli-Trend abgeleitete August-Szenarien:
China Open Weights Richtung 50% — ohne US-Preissenkung (derzeit kein Signal).
Monats-Champion wechselt weiter — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax, Moonshot im Preiskampf.
Anthropic günstigere Tiers möglich — Opus 5 ist viertes Flagship in zwei Monaten; Multi-Tier-Strategie.
Kimi K3 1,4TB: Community-Quantisierung in 2–4 Wochen — bis dahin vor allem Inference-Clouds.
Sicherheit & Compliance als Auswahlfaktor — US „AI Kill Switch“-Gesetz und Frontier-Review-Framework voraussichtlich vor August.
China Token-Anteil: ~46% (vor 12 Monaten <2%) — steilste Verschiebung im AI-Markt.
Hermes Agent App-Anteil: ~45% — größte Einzel-App auf OpenRouter.
DeepSeek vs. GPT-5.5 Preis: Input-Faktor ~35× ($0,05–0,14/M vs. ~$5/M).
Hinweis: Rankings ändern sich täglich — vor Deployment openrouter.ai/rankings prüfen.
Juli-Kernbotschaft: Capability und Popularity divergieren. Wertvoller als „Wer ist #1?“ sind Evaluations-Framework und Tier-Routing.
Multi-Modell-Agent-Gateways auf Laptops scheitern an Sleep, RAM und Netz. Für 7×24 Hermes Agent, OpenClaw oder Multi-Modell-CI: MESHLAUNCH Mac Mini Cloud-Bare-Metal — dediziertes Apple Silicon, flexibel tag-/wochen-/monatsweise. Preise: Mietpreise.
Stand 25.7.: Xiaomi Mimo V2.5 mit 1,4T Token/Tag, dann DeepSeek V4 Flash (943,9B) und Tencent Hy3 (590B). Kimi K3 neu auf Platz 9.
Nein — Token-Volumen ≠ Intelligenz. Bei schweren Tasks führen Claude Sonnet 4.6 und Opus 4.7 mit je 13,5% Ausgabenanteil. Stabile Agent-Hosts: Mietpreise.
Coding: DeepSeek V4 Flash und GLM 5.2 zuerst; Claude Opus 5 nur für blockierte Schritte. OpenRouter als Sandbox; Produktion mit DSGVO-konformem Setup.
OpenRouter/LiteLLM auf 7×24 Cloud-Mac deployen. Region und Konfiguration: Hilfezentrum; Tages-/Monatsmiete nach Projektlaufzeit.