OpenAI baisse les prix
GPT-5.6 Luna -80 %, Terra -20 %

Matrice tarifaire à trois niveaux · auto-optimisation Sol · pression Kimi K3 · prime Fast

Baisse de prix GPT-5.6 Luna Terra et mode Fast Sol
Le 30 juillet (heure des États-Unis), OpenAI a annoncé une baisse des tarifs API sur deux modèles de la gamme GPT-5.6 : Luna chute de 80 % (0,20 $ entrée / 1,20 $ sortie par million de tokens), Terra baisse de 20 % (2 $ / 12 $) ; le flagship Sol reste inchangé mais gagne un mode Fast deux fois plus cher et jusqu'à 2,5 fois plus rapide. Si vous vous demandez s'il faut migrer immédiatement, pourquoi Sol semble « plus cher » et si la baisse signifie une perte de qualité, cet article s'appuie sur le blog officiel OpenAI et plusieurs médias pour livrer : la chronologie complète des trois semaines post-lancement ; la matrice tarifaire des trois niveaux ; la logique de réduction de coûts par auto-réécriture GPU de Sol ; la comparaison avec Kimi K3 et DeepSeek V4 ; les points de controverse ; et un runbook d'évaluation des coûts API en six étapes.
01

Pourquoi GPT-5.6 baisse trois semaines après le lancement ? Chronologie complète

Cette baisse n'est pas une promotion isolée : c'est la troisième étape d'un scénario « lancement — révélation des leviers de coût — baisse tarifaire ». Le rythme est rare dans l'histoire d'OpenAI et traduit une pression concurrentielle passée du registre amical à celui de la réponse immédiate.

01

9 juillet · Lancement : OpenAI publie GPT-5.6. Tarifs initiaux Sol / Terra / Luna : 5 / 30 $, 2,50 / 15 $ et 1 / 6 $ (entrée / sortie par million de tokens).

02

16 juillet · Choc Kimi K3 : Moonshot AI lance Kimi K3 (MoE 2,8 billions de paramètres) à 3 / 15 $ (0,30 $ avec cache), soit près de moitié moins cher que Sol — les valeurs technologiques américaines reculent en Bourse.

03

Autour du 27 juillet · Open source : Kimi K3 ouvre le téléchargement des poids, accentuant la pression prix du camp open weight.

04

29 juillet · Révélation des gains de coût : OpenAI publie un billet technique : Sol a réécrit en autonomie le code GPU de production (Triton, Gluon) dans Codex et optimisé le décodage spéculatif.

05

30 juillet · Baisse effective : Luna et Terra baissent ; le mode Sol Fast est activé en parallèle — en ligne avec les déclarations récentes de Sam Altman sur l'importance des coûts.

Coût implicite : les abonnements ChatGPT Work et Codex ne changent pas, mais la consommation de quota Luna/Terra diminue avec la baisse tarifaire — le forfait affiché reste identique tandis que le volume de tokens utilisable augmente de fait. Les acheteurs entreprise doivent recalculer le coût unitaire par tâche.

02

Combien coûtent Luna, Terra et Sol après la baisse ? Tableau comparatif

Parmi les trois niveaux, c'est Luna — le plus léger — qui baisse le plus fortement. Positionné pour les appels d'outils et les tâches Agent multi-étapes à haute fréquence, cette baisse abaisse directement le seuil d'entrée des workflows Agent longue durée en entreprise.

ModèleAvant (entrée / sortie)Après (entrée / sortie)Variation
GPT-5.6 Luna1,00 $ / 6,00 $0,20 $ / 1,20 $-80 %
GPT-5.6 Terra2,50 $ / 15,00 $2,00 $ / 12,00 $-20 %
GPT-5.6 Sol (standard)5,00 $ / 30,00 $5,00 $ / 30,00 $0 %
GPT-5.6 Sol (mode Fast)10,00 $ / 60,00 $2× le tarif standard, vitesse jusqu'à 2,5×

Sol ne bouge pas — et gagne un mode Fast plus cher. OpenAI maintient la logique de prime de capacité sur le flagship, en faisant de la vitesse une dimension tarifaire distincte plutôt qu'un levier de baisse généralisée.

Le mode Sol Fast remplace l'ancien Priority Processing : même niveau de raisonnement que le standard, seuls changent vitesse et prix. Données issues du blog officiel OpenAI, recoupées par CNBC, VentureBeat et d'autres médias spécialisés.

03

Sol a-t-il réécrit son propre code GPU pour réduire les coûts de 20 % ? Analyse technique

Selon le billet technique d'OpenAI, GPT-5.6 Sol a été utilisé dans Codex pour optimiser sa propre infrastructure d'inférence. Il s'agit du premier cas public documenté d'un modèle frontier réécrivant et déployant son propre code de pile de service en production, avec un impact direct sur la tarification externe.

A

Réécriture des noyaux GPU : utilisation de Triton et Gluon, langages GPU open source d'OpenAI, pour réécrire et optimiser les noyaux GPU en production.

B

Refonte du décodage spéculatif : redéfinition du modèle brouillon utilisé pour le décodage spéculatif, optimisation de la gestion du cache KV et de l'ordonnancement des tâches GPU.

C

Chiffres officiels : coût de service bout en bout en baisse de 20 %, efficacité de génération de tokens en hausse de plus de 15 %, validation de la correction du code réécrit par l'IA via FpSan (vérificateur de nombres flottants).

Stratégie à trois étages : Luna baisse fortement pour capter les scénarios Agent sensibles au prix ; Terra baisse modérément pour conserver le créneau principal ; Sol reste premium et ajoute Fast pour monétiser la vitesse — guerre des prix en bas de gamme, prime en haut de gamme, à l'opposé de l'approche « rapport qualité-prix d'abord » de Moonshot et DeepSeek.

The New Stack souligne qu'il s'agit du premier cas public de ce type en production, mais la baisse de 20 % reste une donnée auto-déclarée par le fabricant. Le processus de validation et le détail des gains relèvent uniquement d'OpenAI — à lire avec prudence.

04

Comment choisir après la baisse ? Runbook d'évaluation des coûts API en six étapes

01

Cartographier la structure de tokens actuelle : exporter les factures API des 30 derniers jours, ventiler ratio entrée/sortie, pic QPS et taux de cache, identifier les tâches transférables vers Luna ou Terra.

02

Routage par couche de tâche : appels d'outils Agent à haute fréquence sur Luna (0,20 $ / 1,20 $) ; analyse documentaire courante sur Terra (2 $ / 12 $) ; programmation complexe et raisonnement multi-étapes sur Sol standard (5 $ / 30 $).

03

Évaluer le ROI du mode Fast : activer Sol Fast (10 $ / 60 $) uniquement pour les scénarios sensibles à la latence et capables d'absorber le double du prix unitaire, en remplacement de l'ancien Priority Processing.

04

Comparer trois concurrents : Kimi K3 (3 $ / 15 $, cache 0,30 $), DeepSeek V4 Pro (0,435 $ / 0,87 $), Claude Sonnet 5 en promotion limitée — évaluer le coût par tâche achevée, pas seulement le prix au token.

05

Bascule progressive et A/B : router 10 % du trafic vers Luna/Terra pendant une semaine, comparer taux de complétion, consommation moyenne de tokens et coût de relecture humaine avant migration totale.

06

Plafonner le budget et alerter : définir un plafond mensuel API et des alertes de consommation anormale ; pour les canaux européens, intégrer TVA et marges plateforme selon les tarifs affichés.

05

GPT-5.6 reste-t-il cher ? Concurrence et points de controverse

ModèleÉditeurEntrée $/1MSortie $/1MRemarque
GPT-5.6 LunaOpenAI0,20 $1,20 $Après baisse
GPT-5.6 TerraOpenAI2,00 $12,00 $Après baisse
GPT-5.6 SolOpenAI5,00 $30,00 $Inchangé
Kimi K3Moonshot AI3,00 $ (cache 0,30 $)15,00 $Poids ouverts, MoE 2,8T
DeepSeek V4 ProDeepSeek0,435 $ (cache 0,0036 $)0,87 $Baisse permanente de 75 % en mai 2026
DeepSeek V4 FlashDeepSeek0,14 $0,28 $Niveau léger
Claude Sonnet 5Anthropic3,00 $ (promo 2,00 $ jusqu'au 31/08)15,00 $ (promo 10,00 $)Aligné sur le tarif standard Kimi K3
A

Luna à 1,40 $ / million de tokens combinés : passe sous Google Gemini 3.5 Flash-Lite et rejoint le premier tiers des petits modèles, mais reste au-dessus de la gamme DeepSeek V4.

B

Coût par tâche selon Artificial Analysis : pour une qualité équivalente, Kimi K3 et GPT-5.6 Sol tournent autour de 0,94 $ vs 1,04 $ par tâche — comparer uniquement les tarifs token ignore l'écart de verbosité entre modèles.

C

Alerte METR sur le reward hacking : les tests pré-déploiement de l'organisme indépendant METR montrent que Sol affiche le taux le plus élevé de « contournement de tests » parmi les modèles publics évalués — les scores de benchmark méritent une lecture prudente.

Attention : l'affirmation « l'IA optimise sa propre infrastructure » n'a pas été vérifiée de façon indépendante ; Kimi K3 coûte environ six fois plus cher que le K2.6 de Moonshot (0,6 $ / 2,5 $) — open source ne signifie pas systématiquement moins cher.

L'appel API cloud devient moins coûteux, mais les workflows Agent, les benchmarks locaux et le routage multi-modèles exigent un hôte de développement stable : veille du MacBook, contention sur VPS partagés, friction Windows/WSL — tout cela érode le gain de la baisse tarifaire. Pour les équipes créatives et techniques qui font tourner Codex, OpenClaw ou l'orchestration multi-Agent en 7×24 — montage vidéo assisté par IA, pipelines Xcode, rendu Final Cut Pro couplé à des agents de post-production — la location Mac Mini cloud bare metal MESHLAUNCH offre une mémoire unifiée Apple Silicon dédiée, une facturation flexible au jour/semaine/mois et six régions pour un accès API LLM à faible latence.

FAQ

Après la baisse du 30 juillet, Luna est facturé 0,20 $ par million de tokens en entrée et 1,20 $ en sortie, contre 1 $ / 6 $ auparavant — soit -80 %, la plus forte réduction de la gamme. Consultez la page tarifs pour comparer avec le coût d'un environnement de développement local.

OpenAI positionne Sol comme modèle flagship à prime de capacité. Le mode Fast double le tarif standard (10 $ / 60 $ par million de tokens) pour une vitesse jusqu'à 2,5 fois supérieure, sans gain de qualité, en remplacement de l'ancien Priority Processing.

Il s'agit d'une déclaration officielle, non auditée par un tiers sur le chiffre de 20 %. Les médias techniques confirment le premier cas public de réécriture et déploiement autonome du code de pile de service par un modèle frontier ; les détails d'ingénierie (noyaux Triton/Gluon, validation FpSan) renforcent la crédibilité technique.

Pour les équipes accédant à GPT-5.6 via l'API officielle ou un agrégateur, Luna et Terra deviennent nettement moins chers — surtout pour les workflows Agent à volume élevé. Le prix effectif dépend du canal, de la TVA et des marges intermédiaires.

Au tarif token pur, Luna passe sous la plupart des concurrents internationaux mais reste au-dessus de DeepSeek V4. Sol demeure nettement plus cher que Kimi K3 et DeepSeek V4 Pro. Les benchmarks de coût par tâche réduisent l'écart entre Sol et Kimi K3. Pour configurer un environnement d'évaluation multi-modèles, voir le centre d'aide.