Grok 4.5: Kernspezifikationen und Einsatzfelder
Grok 4.5 ist das erste Flaggschiff-Modell von SpaceXAI nach dem Börsengang. Es wurde gemeinsam mit Cursor trainiert — nach der SpaceX-Übernahme von Anysphere im Juni 2026 — auf Billionen Tokens realer IDE-Sessions.
Optimierungsziele (nach Priorität):
Coding-Agenten: Bugfixes, große Refactorings, End-to-End-App-Builds.
Agentische Workflows: Mehrstufige Automatisierung über Enterprise-Apps.
Wissensarbeit: Recht, Medizin, Bildung, Datenanalyse.
Hohe Aufrufvolumen: Hunderte bis tausende Agent-Tasks täglich — API-Kosten und Token-Effizienz bestimmen ROI.
First-Shot-Genauigkeit: Komplexe UI- und State-Management-Tasks bestrafen Retry-Loops.
| Parameter | Wert |
|---|---|
| Architektur | Mixture of Experts (MoE) |
| Kontextfenster | 500.000 Tokens |
| Reasoning-Modi | Niedrig / Mittel / Hoch (Standard: Hoch) |
| Inferenzgeschwindigkeit | 80 TPS offiziell, ~90 TPS gemessen |
| Trainings-Hardware | Zehntausende NVIDIA GB300 GPUs (Memphis, TN) |
| Parameterzahl | Nicht veröffentlicht (MoE) |
Preistabelle: Grok 4.5 vs Claude Opus vs GPT-5.6
Listenpreise sind nur die halbe Wahrheit — Token-Effizienz treibt die realen Kosten bei Agent-Loops.
| Modell | Input (pro 1M) | Output (pro 1M) |
|---|---|---|
| Grok 4.5 | $2,00 | $6,00 |
| Grok 4.5 (Cache-Hit) | $0,50 | — |
| Grok 4.5 Fast | $4,00 | $18,00 |
| Claude Opus 4.7 | $5,00 | $25,00 |
| Claude Fable 5 | Höher | Höher |
| GPT-5.6 Sol (Flaggschiff) | $5,00 | $30,00 |
| GPT-5.6 Luna (Economy) | $1,00 | $6,00 |
Kosten pro Agent-Task (SWE-Bench-Pro-Umrechnung):
| Plattform | Ø Tokens/Aufgabe | Kosten/Aufgabe |
|---|---|---|
| Grok 4.5 / Grok Build | ~1,9M | $2,49 |
| GPT-5.5 / Codex | ~6,2M | $5,07 |
| Claude Fable 5 / Claude Code | ~7,2M | $11,80 |
SWE-Bench Pro: Grok 4.5 verbraucht Ø 15.954 Output-Tokens/Aufgabe, Claude Opus 4.8: 67.020 — Faktor 4,2. Bei 500 Aufgaben/Tag: ~$1.245/Tag (Grok) vs ~$5.900/Tag (Claude Code).
Benchmark-Matrix: Coding, Agent-Tasks und Gesamtindex
3.1 Coding-Benchmarks
| Benchmark | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0 (Vendor-Harness) | 62,0 % | 66,1 % | 55,75 % | 64,31 % |
| DeepSWE 1.1 (neutraler Harness) | 53 % | 70 % | 59 % | 67 % |
| Terminal Bench 2.1 | 83,3 % | 84,3 % | 78,9 % | 83,4 % |
| SWE-Bench Pro (Solve Rate) | 64,7 % | 80,4 % | 69,2 % | 58,6 % |
Dateninterpretation: DeepSWE 1.0 (Vendor-Harness) — Grok 4.5 Rang 3. DeepSWE 1.1 (neutral) — Fable 5 +17 PP. Terminal Bench 2.1 — alle vier Modelle innerhalb 5,4 PP. SWE-Bench Pro — Grok 4.5 Rang 3, −15,7 PP vs Fable 5.
Datenhinweis: CursorBench wurde zurückgezogen — Cursor-Codebase-Snapshot in Trainingsdaten, Kontaminationsrisiko. Unabhängiger Retest ausstehend.
3.2 Agent-Benchmarks
| Benchmark | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA (657 Workflows) | 51,4 % | 48,6 % | 48,5 % |
| Snorkel GDPVal+ (Facharbeit) | 29 % | — | 21 % |
AutomationBench-AA: 40 simulierte Enterprise-Apps (Gmail, Slack, Salesforce, HubSpot). Grok 4.5 ist das erste Modell mit >50 % Workflow-Zielerreichung ohne Verletzung von Business-Constraints. Snorkel: Recht 40 % vs 27–28 %, Bildung 58 % vs 35–42 %, Medizin 35 % vs 23–25 %.
3.3 Gesamtindex: Artificial Analysis Intelligence Index 54/100 (Rang 4), +16 PP vs Vorgänger. Reihenfolge: Fable 5 (60), Opus 4.8 (56), GPT-5.5 (55).
3.4 TryAI Coding-Tests (unabhängig)
3D-Würfel-Rendering: Opus 4.8 und Fable 5 first-shot OK; Grok 4.5 Retry nötig; GPT-5.5 Fail.
Latenz: First Token <0,5 s, ~110 tokens/s (~2× Wettbewerb).
Kosten/Testlauf: Grok 4.5 niedrigst; Fable 5 langsamst und teuerst.
Kurzfassung: Hohe Frequenz + Wiederholbarkeit → Grok 4.5 dominiert bei Speed/Kosten. Komplexe Stateful-UI → Claude-Serie zuverlässiger.
Anbindung: Cursor, API und Sechs-Schritte-Runbook
Verfügbar auf: Grok Build (Default), Cursor (alle Pläne, Launch-Woche 2× Nutzung), SpaceXAI Console API, Office-Add-ins, Gateways (OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic). Regionen: us-east-1, us-west-2. Limits: 150 req/s, 50M tokens/min. EU-API: voraussichtlich Mitte Juli 2026.
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "Finde und behebe den Bug: function median(a){a.sort();return a[a.length/2]}"
}'
API-Key anlegen: SpaceXAI Console, Region us-east-1 oder us-west-2 bestätigen.
Cursor-Modellwahl: Grok 4.5 im Selector; Launch-Woche doppelte Nutzung.
Cache-Key setzen: prompt_cache_key (Responses API) oder x-grok-conv-id Header — Input sinkt auf $0,50/M.
Context Compaction: Für lange Agent-Loops aktivieren, Token-Akkumulation reduzieren.
Hybrid-Routing: Routine-Subtasks → Grok 4.5; Architekturentscheidungen → Claude Fable 5.
Produktionsvalidierung: Output-Checks für Finanz- und Security-Code; AA-Omniscience-Halluzinationsrate 54 % — Human-in-the-Loop. Bei personenbezogenen Produktionsdaten: DSGVO-konforme Verarbeitung und Auftragsverarbeitungsvertrag mit API-Anbieter prüfen.
Empfehlung: Cache-Key immer setzen. EU-Nutzer: Produktions-Pipelines erst nach EU-API-Freigabe deployen; bis dahin US-Region nur für nicht-personenbezogene Testdaten.
Entscheidungsmatrix: Wann wechseln, wann warten
Grok 4.5 passt bei: ① Hohem Agent-Aufkommen (100–1000+ Tasks/Tag); ② Terminal- und Tool-Call-Workloads; ③ Cursor-native Teams; ④ Budgetsensitiven Startups; ⑤ Hybrid-Modell-Strategie.
Vorsicht bei: ① SWE-Bench-Pro-Präzision (Fable 5 +15,7 PP); ② Halluzinationskritischen Systemen (54 % AA-Omniscience); ③ EU-Produktion vor Mitte Juli; ④ CursorBench-Claims ohne Retest; ⑤ DSGVO-relevanten Produktionsdaten ohne geklärte Datenverarbeitung.
Kosten/Task: $2,49 (Grok) vs $11,80 (Claude Code).
Output-Token-Effizienz: 15.954 vs 67.020 (4,2× vs Opus 4.8).
Throughput: 80 TPS offiziell, 90–110 tokens/s gemessen, First Token <500 ms.
Grok 4.5 ist nicht das genaueste Coding-Modell — aber das kosten-effizienteste Opus-ähnliche Agent-Modell. Reiner API-Zugang reicht für Tests; lokale Macs kollabieren unter langen Agent-Loops (Swap, IDE-Overhead); VMs verlieren Metal/Xcode-Fidelity. Für 7×24 Cursor-Agenten, parallele Dev-Server und iOS-CI/CD ist MESHLAUNCH Cloud Mac Mini Bare-Metal die stabilere Produktionsbasis: dediziertes Apple Silicon, flexible Tages-/Wochen-/Monats-Tarife.
Quellen: SpaceXAI · Cursor · API-Docs · TechCrunch · Snorkel AI
Metrikabhängig. Opus 4.8 führt bei SWE-Bench Pro (69,2 % vs 64,7 %). Grok 4.5 führt bei Speed, Token-Effizienz und Kosten — oft Faktor 4. Budget planen: Mietpreise.
Zeitlich begrenzt in Grok Build und Cursor. Dauerhaft: API $2/M Input, $6/M Output. Cursor-Abos enthalten das Modell.
Auf allen Cursor-Plänen: Modellwahl Grok 4.5. Deployment-Fragen: Hilfezentrum.
500.000 Tokens — ausreichend für die meisten großen Codebase-Aufgaben.
Cursor-Codebase-Snapshot in Trainingsdaten — Kontaminationsrisiko. SpaceXAI zog Ergebnisse zurück; Retest ausstehend.
Ja — auch Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic.