Grok 4.5 Test 2026
Opus-Klasse zum Viertelpreis?

Benchmark-Tabellen · API-Preise · Coding-Vergleich · Cursor-Anbindung · Entscheidungsmatrix

Grok 4.5 Test SpaceXAI Coding-Modell 2026
Am 8. Juli 2026 veröffentlichte SpaceXAI Grok 4.5 — Musk nannte es «Opus-Klasse, schneller, günstiger». Für Teams, die einen KI-Programmierassistenten für Agent-Workflows evaluieren, liefert dieser Datenbericht drei Antworten: ① Stärken und Schwächen anhand veröffentlichter Benchmarks; ② ob Kosten pro Aufgabe tatsächlich um Faktor 4 sinken; ③ wie Cursor- und API-Integration ohne Token-Explosion gelingt. Datenstand: 10. Juli 2026.
01

Grok 4.5: Kernspezifikationen und Einsatzfelder

Grok 4.5 ist das erste Flaggschiff-Modell von SpaceXAI nach dem Börsengang. Es wurde gemeinsam mit Cursor trainiert — nach der SpaceX-Übernahme von Anysphere im Juni 2026 — auf Billionen Tokens realer IDE-Sessions.

Optimierungsziele (nach Priorität):

01

Coding-Agenten: Bugfixes, große Refactorings, End-to-End-App-Builds.

02

Agentische Workflows: Mehrstufige Automatisierung über Enterprise-Apps.

03

Wissensarbeit: Recht, Medizin, Bildung, Datenanalyse.

04

Hohe Aufrufvolumen: Hunderte bis tausende Agent-Tasks täglich — API-Kosten und Token-Effizienz bestimmen ROI.

05

First-Shot-Genauigkeit: Komplexe UI- und State-Management-Tasks bestrafen Retry-Loops.

ParameterWert
ArchitekturMixture of Experts (MoE)
Kontextfenster500.000 Tokens
Reasoning-ModiNiedrig / Mittel / Hoch (Standard: Hoch)
Inferenzgeschwindigkeit80 TPS offiziell, ~90 TPS gemessen
Trainings-HardwareZehntausende NVIDIA GB300 GPUs (Memphis, TN)
ParameterzahlNicht veröffentlicht (MoE)
02

Preistabelle: Grok 4.5 vs Claude Opus vs GPT-5.6

Listenpreise sind nur die halbe Wahrheit — Token-Effizienz treibt die realen Kosten bei Agent-Loops.

ModellInput (pro 1M)Output (pro 1M)
Grok 4.5$2,00$6,00
Grok 4.5 (Cache-Hit)$0,50
Grok 4.5 Fast$4,00$18,00
Claude Opus 4.7$5,00$25,00
Claude Fable 5HöherHöher
GPT-5.6 Sol (Flaggschiff)$5,00$30,00
GPT-5.6 Luna (Economy)$1,00$6,00

Kosten pro Agent-Task (SWE-Bench-Pro-Umrechnung):

PlattformØ Tokens/AufgabeKosten/Aufgabe
Grok 4.5 / Grok Build~1,9M$2,49
GPT-5.5 / Codex~6,2M$5,07
Claude Fable 5 / Claude Code~7,2M$11,80

SWE-Bench Pro: Grok 4.5 verbraucht Ø 15.954 Output-Tokens/Aufgabe, Claude Opus 4.8: 67.020 — Faktor 4,2. Bei 500 Aufgaben/Tag: ~$1.245/Tag (Grok) vs ~$5.900/Tag (Claude Code).

03

Benchmark-Matrix: Coding, Agent-Tasks und Gesamtindex

3.1 Coding-Benchmarks

BenchmarkGrok 4.5Claude Fable 5Claude Opus 4.8GPT-5.5
DeepSWE 1.0 (Vendor-Harness)62,0 %66,1 %55,75 %64,31 %
DeepSWE 1.1 (neutraler Harness)53 %70 %59 %67 %
Terminal Bench 2.183,3 %84,3 %78,9 %83,4 %
SWE-Bench Pro (Solve Rate)64,7 %80,4 %69,2 %58,6 %

Dateninterpretation: DeepSWE 1.0 (Vendor-Harness) — Grok 4.5 Rang 3. DeepSWE 1.1 (neutral) — Fable 5 +17 PP. Terminal Bench 2.1 — alle vier Modelle innerhalb 5,4 PP. SWE-Bench Pro — Grok 4.5 Rang 3, −15,7 PP vs Fable 5.

Datenhinweis: CursorBench wurde zurückgezogen — Cursor-Codebase-Snapshot in Trainingsdaten, Kontaminationsrisiko. Unabhängiger Retest ausstehend.

3.2 Agent-Benchmarks

BenchmarkGrok 4.5Claude Fable 5Claude Opus 4.8
AutomationBench-AA (657 Workflows)51,4 %48,6 %48,5 %
Snorkel GDPVal+ (Facharbeit)29 %21 %

AutomationBench-AA: 40 simulierte Enterprise-Apps (Gmail, Slack, Salesforce, HubSpot). Grok 4.5 ist das erste Modell mit >50 % Workflow-Zielerreichung ohne Verletzung von Business-Constraints. Snorkel: Recht 40 % vs 27–28 %, Bildung 58 % vs 35–42 %, Medizin 35 % vs 23–25 %.

3.3 Gesamtindex: Artificial Analysis Intelligence Index 54/100 (Rang 4), +16 PP vs Vorgänger. Reihenfolge: Fable 5 (60), Opus 4.8 (56), GPT-5.5 (55).

3.4 TryAI Coding-Tests (unabhängig)

A

3D-Würfel-Rendering: Opus 4.8 und Fable 5 first-shot OK; Grok 4.5 Retry nötig; GPT-5.5 Fail.

B

Latenz: First Token <0,5 s, ~110 tokens/s (~2× Wettbewerb).

C

Kosten/Testlauf: Grok 4.5 niedrigst; Fable 5 langsamst und teuerst.

Kurzfassung: Hohe Frequenz + Wiederholbarkeit → Grok 4.5 dominiert bei Speed/Kosten. Komplexe Stateful-UI → Claude-Serie zuverlässiger.

04

Anbindung: Cursor, API und Sechs-Schritte-Runbook

Verfügbar auf: Grok Build (Default), Cursor (alle Pläne, Launch-Woche 2× Nutzung), SpaceXAI Console API, Office-Add-ins, Gateways (OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic). Regionen: us-east-1, us-west-2. Limits: 150 req/s, 50M tokens/min. EU-API: voraussichtlich Mitte Juli 2026.

bash
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Finde und behebe den Bug: function median(a){a.sort();return a[a.length/2]}"
  }'
01

API-Key anlegen: SpaceXAI Console, Region us-east-1 oder us-west-2 bestätigen.

02

Cursor-Modellwahl: Grok 4.5 im Selector; Launch-Woche doppelte Nutzung.

03

Cache-Key setzen: prompt_cache_key (Responses API) oder x-grok-conv-id Header — Input sinkt auf $0,50/M.

04

Context Compaction: Für lange Agent-Loops aktivieren, Token-Akkumulation reduzieren.

05

Hybrid-Routing: Routine-Subtasks → Grok 4.5; Architekturentscheidungen → Claude Fable 5.

06

Produktionsvalidierung: Output-Checks für Finanz- und Security-Code; AA-Omniscience-Halluzinationsrate 54 % — Human-in-the-Loop. Bei personenbezogenen Produktionsdaten: DSGVO-konforme Verarbeitung und Auftragsverarbeitungsvertrag mit API-Anbieter prüfen.

Empfehlung: Cache-Key immer setzen. EU-Nutzer: Produktions-Pipelines erst nach EU-API-Freigabe deployen; bis dahin US-Region nur für nicht-personenbezogene Testdaten.

05

Entscheidungsmatrix: Wann wechseln, wann warten

Grok 4.5 passt bei: ① Hohem Agent-Aufkommen (100–1000+ Tasks/Tag); ② Terminal- und Tool-Call-Workloads; ③ Cursor-native Teams; ④ Budgetsensitiven Startups; ⑤ Hybrid-Modell-Strategie.

Vorsicht bei: ① SWE-Bench-Pro-Präzision (Fable 5 +15,7 PP); ② Halluzinationskritischen Systemen (54 % AA-Omniscience); ③ EU-Produktion vor Mitte Juli; ④ CursorBench-Claims ohne Retest; ⑤ DSGVO-relevanten Produktionsdaten ohne geklärte Datenverarbeitung.

A

Kosten/Task: $2,49 (Grok) vs $11,80 (Claude Code).

B

Output-Token-Effizienz: 15.954 vs 67.020 (4,2× vs Opus 4.8).

C

Throughput: 80 TPS offiziell, 90–110 tokens/s gemessen, First Token <500 ms.

Grok 4.5 ist nicht das genaueste Coding-Modell — aber das kosten-effizienteste Opus-ähnliche Agent-Modell. Reiner API-Zugang reicht für Tests; lokale Macs kollabieren unter langen Agent-Loops (Swap, IDE-Overhead); VMs verlieren Metal/Xcode-Fidelity. Für 7×24 Cursor-Agenten, parallele Dev-Server und iOS-CI/CD ist MESHLAUNCH Cloud Mac Mini Bare-Metal die stabilere Produktionsbasis: dediziertes Apple Silicon, flexible Tages-/Wochen-/Monats-Tarife.

Quellen: SpaceXAI · Cursor · API-Docs · TechCrunch · Snorkel AI

FAQ

Metrikabhängig. Opus 4.8 führt bei SWE-Bench Pro (69,2 % vs 64,7 %). Grok 4.5 führt bei Speed, Token-Effizienz und Kosten — oft Faktor 4. Budget planen: Mietpreise.

Zeitlich begrenzt in Grok Build und Cursor. Dauerhaft: API $2/M Input, $6/M Output. Cursor-Abos enthalten das Modell.

Auf allen Cursor-Plänen: Modellwahl Grok 4.5. Deployment-Fragen: Hilfezentrum.

500.000 Tokens — ausreichend für die meisten großen Codebase-Aufgaben.

Cursor-Codebase-Snapshot in Trainingsdaten — Kontaminationsrisiko. SpaceXAI zog Ergebnisse zurück; Retest ausstehend.

Ja — auch Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic.