Test Grok 4.5 2026
Classe Opus à un quart du prix ?

Benchmarks · Tarifs API · Tests de codage · Intégration Cursor · Décision d'achat

Test Grok 4.5 modèle de codage SpaceXAI 2026
Le 8 juillet 2026, SpaceXAI a dévoilé Grok 4.5, qu'Elon Musk qualifie d'intelligence de classe Opus à une fraction du coût. Si votre équipe évalue un assistant IA de codage pour des workflows agentiques, cet article répond à trois questions essentielles : où Grok 4.5 gagne et perd sur les benchmarks publiés ; si le coût par tâche diminue réellement d'un facteur quatre ; et comment l'intégrer dans Cursor ou l'API sans exploser votre budget tokens. Données à jour au 10 juillet 2026.
01

Grok 4.5 : le modèle phare de SpaceXAI et ses spécifications

Grok 4.5 marque la première grande sortie de SpaceXAI depuis son introduction en bourse. Le modèle a été co-entraîné avec Cursor après l'acquisition d'Anysphere par SpaceX en juin 2026, en s'appuyant sur des billions de tokens issus de sessions IDE réelles — revue de code, débogage et interactions agent-base de code.

SpaceXAI a orienté Grok 4.5 vers les scénarios suivants :

01

Agents de codage : corrections de bugs, refactorings à grande échelle, développement d'applications de bout en bout.

02

Automatisation agentique : workflows multi-étapes à travers les applications d'entreprise.

03

Travail intellectuel : juridique, santé, éducation, analyse de données.

04

Pression sur les coûts à volume : les équipes exécutant des centaines d'appels agent par jour ressentent immédiatement l'impact sur la facture API.

05

Précision du premier essai : les interfaces complexes à gestion d'état pénalisent les modèles nécessitant des relances.

SpécificationDétail
ArchitectureMixture of Experts (MoE)
Fenêtre de contexte500 000 tokens
Modes de raisonnementFaible / Moyen / Élevé (par défaut : Élevé)
Vitesse80 TPS officiel, ~90 TPS mesuré
Infrastructure d'entraînementDizaines de milliers de GPU NVIDIA GB300 (Memphis, TN)
ParamètresNon divulgués
02

Tarification Grok 4.5 : combien économisez-vous réellement ?

La tarification constitue l'argument central de Grok 4.5. Au-delà des prix affichés, c'est l'efficacité token qui détermine le coût réel dans les scénarios agentiques à haute fréquence.

ModèleEntrée (par 1M)Sortie (par 1M)
Grok 4.52,00 $6,00 $
Grok 4.5 (entrée en cache)0,50 $
Grok 4.5 Fast4,00 $18,00 $
Claude Opus 4.75,00 $25,00 $
Claude Fable 5Plus élevéPlus élevé
GPT-5.6 Sol (flagship)5,00 $30,00 $
GPT-5.6 Luna (économique)1,00 $6,00 $

Coût réel par tâche agent (conversion SWE-Bench Pro) :

PlateformeTokens moyens/tâcheCoût/tâche
Grok 4.5 / Grok Build~1,9M2,49 $
GPT-5.5 / Codex~6,2M5,07 $
Claude Fable 5 / Claude Code~7,2M11,80 $

Sur SWE-Bench Pro, Grok 4.5 consomme en moyenne 15 954 tokens de sortie par tâche contre 67 020 pour Claude Opus 4.8 — un écart d'efficacité de 4,2×. À 500 tâches par jour, cela représente environ 1 245 $/jour contre 5 900 $/jour.

03

Benchmarks Grok 4.5 : codage, tâches agentiques et intelligence globale

3.1 Benchmarks de codage

BenchmarkGrok 4.5Fable 5Opus 4.8GPT-5.5
DeepSWE 1.0 (harness éditeur)62,0 %66,1 %55,75 %64,31 %
DeepSWE 1.1 (harness neutre)53 %70 %59 %67 %
Terminal Bench 2.183,3 %84,3 %78,9 %83,4 %
SWE-Bench Pro (taux de résolution)64,7 %80,4 %69,2 %58,6 %

Lecture des résultats : sur DeepSWE 1.0 avec le harness propriétaire de chaque éditeur, Grok 4.5 se classe troisième. Avec le harness neutre de DeepSWE 1.1, l'écart se creuse au profit de Fable 5 (+17 points). Terminal Bench 2.1 place les quatre modèles dans une fourchette de 5,4 points — quasi-équivalence. SWE-Bench Pro, le test le plus exigeant, confirme Fable 5 en tête avec environ 16 points d'avance sur Grok 4.5.

Point d'attention : CursorBench a été retiré du lancement — un instantané du code source Cursor s'est retrouvé dans les données d'entraînement, compromettant la validité de ce benchmark.

3.2 Benchmarks agentiques — le terrain de prédilection de Grok 4.5

Benchmark agentGrok 4.5Fable 5Opus 4.8
AutomationBench-AA (657 workflows)51,4 %48,6 %48,5 %
Snorkel GDPVal+ (travail professionnel)29 %21 %

AutomationBench-AA simule 40 applications d'entreprise — Gmail, Slack, Salesforce, HubSpot. Grok 4.5 est le premier modèle à dépasser 50 % d'objectifs de workflow atteints sans violer les contraintes métier. L'évaluation Snorkel montre des avances nettes en juridique (40 % vs 27–28 %), éducation (58 % vs 35–42 %) et santé (35 % vs 23–25 %).

3.3 Indice d'intelligence global : Artificial Analysis Intelligence Index à 54/100 (quatrième place), derrière Fable 5 (60), Opus 4.8 (56) et GPT-5.5 (55), mais en progression de 16 points par rapport au Grok précédent.

3.4 Tests de codage réels (TryAI, évaluation indépendante)

A

Rendu 3D de cube (le plus difficile) : Opus 4.8 et Fable 5 réussissent du premier coup ; Grok 4.5 nécessite une relance ; GPT-5.5 échoue.

B

Vitesse : premier token en moins de 0,5 seconde, débit d'environ 110 tokens/seconde — soit le double des concurrents.

C

Coût : Grok 4.5 affiche le coût le plus bas par exécution ; Fable 5 est le plus lent et le plus onéreux.

En synthèse : pour les tâches répétitives à haute fréquence, l'avantage vitesse-coût de Grok 4.5 est net. Pour les travaux complexes exigeant une précision immédiate sur la gestion d'état, la série Claude reste plus fiable.

04

Comment utiliser Grok 4.5 dans Cursor et via l'API

Grok 4.5 est disponible sur Grok Build (modèle par défaut), tous les plans Cursor (desktop, web, iOS, CLI, SDK), l'API SpaceXAI Console, les extensions Microsoft Office et les passerelles tierces (OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic). Régions : us-east-1, us-west-2. Limites : 150 req/s, 50M tokens/min. Disponibilité UE attendue mi-juillet 2026.

bash
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Trouve et corrige le bug : function median(a){a.sort();return a[a.length/2]}"
  }'
01

Créer une clé API dans SpaceXAI Console et confirmer l'accès aux régions américaines.

02

Sélectionner Grok 4.5 dans Cursor via le sélecteur de modèle ; utilisation doublée la semaine de lancement.

03

Configurer prompt_cache_key (API Responses) ou l'en-tête x-grok-conv-id pour réduire l'entrée en cache à 0,50 $/M.

04

Activer Context Compaction pour les boucles agent longues.

05

Router les tâches courantes vers Grok 4.5 et escalader les décisions d'architecture vers Claude Fable 5.

06

Valider les sorties en production ; le taux d'hallucination sur AA-Omniscience atteint 54 % — prévoir une revue humaine.

Bonne pratique : configurez systématiquement une clé de cache conversationnelle. Les utilisateurs européens doivent attendre l'ouverture de l'API UE avant de déployer des pipelines de production.

05

Faut-il changer ? Verdict et chiffres clés

Grok 4.5 convient aux pipelines agentiques à haut volume, aux workflows orientés terminal, aux équipes intégrées à Cursor, aux startups sensibles au budget et aux stratégies multi-modèles. La prudence s'impose pour la précision de niveau SWE-Bench Pro, les systèmes sensibles aux hallucinations, les déploiements UE avant mi-juillet et les affirmations liées à CursorBench.

A

Coût par tâche : ~2,49 $ (Grok) vs ~11,80 $ (Claude Code).

B

Efficacité token de sortie : 15 954 vs 67 020 (écart 4,2× vs Opus 4.8).

C

Débit : 80 TPS officiel, 90–110 tokens/s mesuré, premier token <500 ms.

Grok 4.5 n'est pas le modèle de codage le plus précis — Claude Fable 5 conserve cette couronne. Mais la précision sur un benchmark ne se confond pas avec la valeur par euro dépensé. Un setup API seul suffit pour les essais ; les Mac locaux subissent souvent une pression mémoire sous les boucles agent prolongées, et les machines virtuelles sacrifient la fidélité Metal/Xcode. Pour des agents Cursor 7×24, des serveurs de développement parallèles et une CI/CD iOS, la location Mac Mini cloud bare metal MESHLAUNCH constitue généralement la meilleure option de production : Apple Silicon dédié et conditions flexibles au jour, à la semaine ou au mois.

Sources : SpaceXAI · Cursor · Documentation API · TechCrunch · Snorkel AI

FAQ

Cela dépend de la métrique. Opus domine sur SWE-Bench Pro ; Grok excelle en vitesse, efficacité token et coût — souvent par un facteur 4. Consultez nos tarifs pour budgétiser le matériel de développement.

Une utilisation gratuite limitée a été proposée dans Grok Build et Cursor au lancement. Tarifs API en continu : 2 $/M en entrée, 6 $/M en sortie.

Choisissez Grok 4.5 dans le sélecteur de modèle sur tout plan Cursor. Questions de déploiement : centre d'aide.

500 000 tokens — suffisant pour la plupart des tâches sur de grandes bases de code.

Contamination des données d'entraînement par un instantané du code source Cursor — les chiffres ont été invalidés.

Oui — également sur Vercel AI Gateway, Cloudflare, Snowflake et Databricks Mosaic.