Introduction
OpenAI a procédé à des ajustements tarifaires majeurs sur la gamme GPT-5.6.
Depuis le 30 juillet 2026, l'entreprise a réduit de 80 % le prix de l'API de GPT-5.6 Luna et de 20 % celui de GPT-5.6 Terra. Le prix standard du modèle phare GPT-5.6 Sol reste inchangé, mais OpenAI a lancé un mode rapide dont la vitesse de traitement peut atteindre 2,5 fois celle du mode standard, tout en conservant le même niveau d'intelligence du modèle.
Ce changement intervient alors qu'OpenAI vient de publier une analyse technique montrant comment GPT-5.6 Sol a contribué à optimiser les systèmes servant GPT-5.6 lui-même. Selon OpenAI, les améliorations apportées aux noyaux GPU de production ont réduit les coûts de service de bout en bout de 20 %, tandis que les améliorations du décodage spéculatif ont accru l'efficacité de génération des jetons de plus de 15 %.
Le résultat est qu'OpenAI adopte une stratégie plus agressive sur ce qu'il appelle la frontière du rapport qualité-prix : faire correspondre la quantité d'intelligence utilisée à la valeur économique de la tâche.

Pour les développeurs, les changements les plus importants sont immédiatement visibles : Luna est désormais beaucoup plus abordable pour les charges de travail d'agents à haut débit, Terra coûte moins cher pour un usage quotidien, et Sol peut être acheté à un niveau de service supérieur lorsque la latence prime sur le prix.
- Luna en baisse de 80 %, Terra en baisse de 20 %, Sol lance le mode rapide
La mise à jour tarifaire du 30 juillet couvre toute la gamme GPT-5.6, mais les ajustements varient selon les modèles.
GPT-5.6 Luna : la plus forte réduction de prix
Luna bénéficie de la réduction la plus agressive.
Son prix d'API standard passe des niveaux suivants :
| Type de jeton | Ancien prix | Nouveau prix | Variation |
|---|---|---|---|
| Entrée | 1,00 $ / 1 million de jetons | 0,20 $ / 1 million de jetons | -80 % |
| Sortie | 6,00 $ / 1 million de jetons | 1,20 $ / 1 million de jetons | -80 % |
OpenAI décrit Luna comme le modèle le plus rapide et le plus abordable de la gamme GPT-5.6, le positionnant pour les charges de travail à haut débit et sensibles aux coûts.
Cela inclut les tâches suivantes :
- Classification
- Extraction d'informations
- Agents en arrière-plan
- Travail de codage quotidien
- Génération de tests
- Flux de travail de sortie structurée
- Sous-agents utilisant des outils
- Traitement documentaire à grande échelle
La baisse des prix modifie particulièrement l'économie des boucles d'agents, car une seule requête utilisateur peut impliquer plusieurs appels de modèle plutôt qu'une simple complétion.
OpenAI indique que Luna est capable d'utiliser des outils et d'exécuter des flux de travail en plusieurs étapes, ce qui rend pratique l'affectation d'une plus grande partie du travail à des modèles moins coûteux, sans avoir à réserver le comportement d'agent au niveau supérieur plus onéreux.
GPT-5.6 Terra : une réduction modeste mais significative
Les prix d'API standard de Terra sont désormais :
| Type de jeton | Ancien prix | Nouveau prix | Variation |
|---|---|---|---|
| Entrée | 2,50 $ / 1 million de jetons | 2,00 $ / 1 million de jetons | -20 % |
| Sortie | 15,00 $ / 1 million de jetons | 12,00 $ / 1 million de jetons | -20 % |
Terra reste le modèle de milieu de gamme de la série GPT-5.6.
Il est conçu pour les charges de travail nécessitant des capacités de raisonnement supérieures à celles de Luna, sans pour autant exiger le coût plus élevé de Sol.
Les applications typiques comprennent :
- Agents d'entreprise quotidiens
- Assistance au codage
- Questions-réponses sur l'espace de travail
- Analyse documentaire
- Recherche à portée limitée
- Flux de travail professionnels multi-étapes
OpenAI mentionne Notion comme l'un des clients utilisant Terra pour les charges de travail d'agents personnels, telles que les questions-réponses sensibles à la latence et les tâches à portée limitée.
GPT-5.6 Sol maintient ses prix standard
La tarification d'API standard de Sol reste inchangée :
| Type de jeton | Prix standard |
|---|---|
| Entrée | 5,00 $ / 1 million de jetons |
| Sortie | 30,00 $ / 1 million de jetons |
Le changement pour Sol n'est pas une baisse de prix.
OpenAI a plutôt lancé le mode rapide.
Mode rapide Sol : une vitesse jusqu'à 2,5 fois supérieure
Le mode rapide remplace l'ancienne terminologie de « traitement prioritaire » d'OpenAI.
Pour GPT-5.6 Sol, OpenAI indique que le mode rapide traite les requêtes jusqu'à 2,5 fois plus vite que le traitement standard, avec un niveau d'intelligence du modèle inchangé.
Le prix en est le coût.
Le mode rapide coûte deux fois plus cher que le traitement standard.
Pour Sol, cela signifie :
| Type de jeton | Standard | Mode rapide |
|---|---|---|
| Entrée | 5,00 $ / 1 million | 10,00 $ / 1 million |
| Entrée en cache | 0,50 $ / 1 million | 1,00 $ / 1 million |
| Sortie | 30,00 $ / 1 million | 60,00 $ / 1 million |
Les requêtes API existantes utilisant :
service_tier="priority"
restent rétrocompatibles et sont routées vers le mode rapide.
OpenAI prend également en charge :
service_tier="fast"
comme identifiant de service renommé.
Le mode rapide est utile lorsque le coût de l'attente dépasse le coût d'une inférence plus rapide.
Les exemples comprennent :
- Agents de codage interactifs
- Flux de travail de production sensibles au temps
- Assistance d'analyste en temps réel
- Opérations clients à forte valeur ajoutée
- Tâches d'agents complexes où la latence s'accumule sur plusieurs étapes
Un flux de travail nécessitant 20 à 30 appels de modèle peut sembler beaucoup plus lent qu'une simple réponse de chat, même si la latence de chaque appel individuel est faible. Par conséquent, dans les systèmes d'agents, un traitement plus rapide peut avoir un impact disproportionné.
Les modes de facturation de ChatGPT Work et Codex changent également
Les prix plus bas de Luna et Terra se reflètent également dans la façon dont l'utilisation est calculée pour ChatGPT Work et Codex.
OpenAI indique :
- Les utilisateurs gratuits et les utilisateurs Go peuvent utiliser Terra.
- Les utilisateurs Plus, Pro, Business et Enterprise peuvent choisir entre Terra et Luna.
- Les prix d'abonnement et les budgets de quotas restent inchangés.
- Comme Luna et Terra sont moins chers, ils consomment désormais moins de crédits.
Cela ne signifie pas que les abonnements payants deviennent moins chers en eux-mêmes.
Ce changement signifie que lorsque les utilisateurs choisissent Luna ou Terra, le même quota dure plus longtemps.

Le rapport qualité-prix devient une mesure plus importante pour les modèles
OpenAI a publié un graphique comparant le prix et l'intelligence, basé sur l'indice d'intelligence Artificial Analysis v4.1, afin d'illustrer le nouveau positionnement de Luna.
Ce graphique place GPT-5.6 Luna à plus de 50 points sur l'indice d'intelligence, tout en montrant qu'après l'ajustement des prix, l'un des Luna
Le coût estimé de la tâche de configuration est d'environ 0,05 USD.
Ces données ne doivent pas être confondues avec le prix d'un appel API individuel.
Artificial Analysis calcule le coût par tâche d'intelligence à partir d'une méthode pondérée basée sur l'utilisation des tokens du modèle et les benchmarks. Le coût réel des requêtes en production dépend de :
-
La taille de l'entrée
-
La taille de la sortie
-
La profondeur de raisonnement
-
La mise en cache des prompts
-
Le nombre d'appels d'outils
-
Le nombre de tours d'exécution de l'agent
-
La facturation des contextes longs
-
Les mécanismes de nouvelle tentative
Avant la baisse de prix du 30 juillet, Artificial Analysis rapportait que GPT-5.6 Luna atteignait un indice d'intelligence d'environ 51 dans sa configuration de raisonnement maximale.
Les nouveaux prix de tokens, plus bas, rapprochent encore davantage Luna de l'extrémité basse de la courbe « intelligence-coût ».
Le message plus large transmis par OpenAI est le suivant : les entreprises ne devraient pas utiliser le modèle le plus cher pour chaque étape.
Un flux de travail pourrait d'abord utiliser Sol pour lever les ambiguïtés et établir un plan, puis confier les tâches d'implémentation, de test ou les tâches répétitives bien définies à Luna.
Cette forme de routage des modèles devient d'autant plus attrayante que les modèles de niveau inférieur sont déjà capables d'utiliser des outils et de réaliser des flux de travail multi-étapes.
- GPT-5.6 a contribué à optimiser l'infrastructure qui exécute GPT-5.6
La veille de cette baisse de prix, OpenAI a publié un article technique détaillé expliquant comment GPT-5.6 est devenu plus efficace.
L'aspect le plus inhabituel de cette histoire est que GPT-5.6 Sol lui-même a participé au processus d'optimisation.
OpenAI indique que ses ingénieurs ont utilisé Sol via Codex pour analyser les systèmes de production, écrire du code de performance, tester des alternatives et superviser les expériences.
L'entreprise décrit trois principaux niveaux d'optimisation :
- La suite d'outils de l'agent
- L'orchestration des API et des requêtes
- L'inférence du modèle sur l'infrastructure GPU
Sol a contribué à optimiser les kernels GPU de production
Au niveau de l'inférence, OpenAI affirme que GPT-5.6 Sol a réécrit et optimisé de manière autonome les kernels de production.
Un kernel GPU est un programme de bas niveau chargé d'exécuter efficacement des opérations mathématiques sur le matériel accélérateur.
Même si l'architecture du modèle sous-jacent reste inchangée, des mouvements de mémoire, des synchronisations, des ordonnancements ou des dispositions de données inefficaces peuvent entraîner une sous-utilisation des ressources GPU coûteuses.
OpenAI indique que Sol a aidé à identifier les types de calculs suivants comme optimisables :
- Précalculables
- Évitables
- Parallélisables
- Réordonnables
- Réalisables via des kernels plus efficaces
L'entreprise a spécifiquement mentionné les technologies de programmation GPU Triton et Gluon comme impliquées dans ce travail.
Selon OpenAI, les améliorations des kernels et les optimisations de service associées ont permis de réduire de 20 % les coûts de service de bout en bout de GPT-5.6.
Sol a également amélioré le décodage spéculatif
Une autre optimisation importante provient du décodage spéculatif.
Voici une version simplifiée du décodage spéculatif :
- Un petit modèle de brouillon prédit plusieurs tokens suivants possibles.
- Le modèle principal évalue ces tokens candidats en parallèle.
- Les tokens acceptés sont produits sans nécessiter la même quantité de travail de génération séquentielle.
La qualité du modèle de brouillon est donc cruciale.
OpenAI indique que GPT-5.6 Sol a conçu et exécuté des centaines d'expériences sur l'architecture du modèle spéculatif, avec des modifications portant sur :
- L'échelle
- La structure
- Les caractéristiques
- La configuration d'entraînement
Sol surveille également le processus d'entraînement et intervient en cas de panne matérielle ou d'instabilité d'entraînement.
OpenAI affirme que les améliorations qui en résultent ont permis d'augmenter l'efficacité de génération de tokens de plus de 15 %.

L'équilibrage de charge est tout aussi important
Le coût d'un modèle ne dépend pas uniquement du code exécuté à l'intérieur d'un seul GPU.
Les requêtes doivent être routées entre les niveaux suivants :
- Régions
- Centres de données
- Types d'accélérateurs
- Clusters
- Instances de modèle
- Sous-réseaux de modèle
- Cœurs de calcul
Si la répartition du travail est déséquilibrée et que du matériel reste inactif, les coûts peuvent rester élevés même avec des accélérateurs puissants.
OpenAI indique que Sol a aidé à analyser le trafic de production, à identifier les causes profondes de l'équilibrage de charge, à tester des stratégies de routage alternatives et à ajuster les heuristiques utilisées pour distribuer les requêtes.
Ce type d'optimisation opérationnelle peut augmenter le débit global sans investissement matériel supplémentaire correspondant.
La gestion du contexte réduit les calculs redondants
Creez un site vitrine et genere des leads en quelques minutes
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
OpenAI a également optimisé les frameworks d'agents utilisés par des systèmes tels que Codex et ChatGPT Work.
Un agent peut avoir besoin d'effectuer plusieurs appels de modèle et d'outils avant de renvoyer un résultat final.
Par exemple, Codex peut :
- Examiner le code source.
- Rechercher l'historique de déploiement.
- Lire les rapports d'incident.
- Modifier des fichiers.
- Exécuter des tests.
- Vérifier les erreurs.
- Modifier le code.
- Relancer les tests.
Chaque boucle peut transporter du contexte, des définitions d'outils, des résultats précédents et des informations environnementales.
Si ce contexte croît inutilement, les coûts et la latence augmentent également.
OpenAI indique que son framework d'agents utilise des techniques telles que la découverte tardive, qui n'expose les outils, compétences, plugins et intégrations MCP qu'en cas de besoin.
La sortie des outils est limitée par défaut à 10 000 tokens, sauf si le modèle demande une limite différente.
Cela réduit la probabilité que des résultats d'outils volumineux remplissent inutilement la fenêtre de contexte.
Historique en ajout uniquement pour préserver le cache de prompts
Les boucles d'agents réutilisent généralement les mêmes instructions et le même contexte à plusieurs reprises.
Le cache de prompts évite de recalculer les préfixes de prompts stables.
Mais le cache n'est efficace que si le préfixe répété reste parfaitement identique.
OpenAI indique que son framework maintient le caractère « ajout uniquement » de l'historique visible par le modèle :
- Les nouveaux messages sont ajoutés à la fin.
- Les résultats d'outils sont ajoutés à la fin.
- Les mises à jour d'environnement sont ajoutées à la fin.
- L'ordre des outils est déterministe.
- Les paramètres d'approbation d'exécution ne sont pas traités dans les définitions d'outils.
Cette conception améliore le taux de réutilisation du cache de prompts dans Codex et ChatGPT Work.
Le principe de base est simple :
Un modèle est moins cher non seulement parce que ses tokens coûtent moins cher, mais aussi parce que les systèmes qui l'entourent évitent dès le départ de générer et de traiter des tokens inutiles.
La boucle d'efficacité peut produire des effets composés
OpenAI décrit cela comme une boucle de rétroaction.
Des modèles plus puissants aident les ingénieurs à améliorer :
- Les kernels GPU
- Le routage
- Le décodage spéculatif
- La mise en cache
- La configuration des charges de travail
- L'orchestration des agents
Ces améliorations réduisent les coûts et la latence.
Une infrastructure plus efficace rend ensuite plus économique l'exécution de modèles plus puissants à plus grande échelle.
OpenAI estime que cela peut raccourcir le cycle entre la recherche sur les modèles et le déploiement à grande échelle, accélérant ainsi le rythme d'innovation dans l'IA.
Les gains d'optimisation de la prochaine génération doivent être trouvés.
Les baisses de prix du 30 juillet pour Luna et Terra sont le résultat le plus visible pour les clients à ce jour.
- Réactions des développeurs : Luna attire davantage l'attention, les concurrents subissent de nouvelles pressions sur les prix
Le rapport chinois original mettait également en avant les vives réactions des développeurs après l'annonce.
Certains utilisateurs se sont concentrés sur l'ampleur de la baisse de prix de Luna.
Une réduction de 80 % est bien supérieure aux ajustements progressifs courants dans les API de pointe.
D'autres estiment que Luna était déjà sous-évaluée avant la baisse, en particulier pour les charges de travail d'agents — dans ces scénarios, des modèles moins chers peuvent gérer les tâches d'exécution courantes sous la direction d'un planificateur plus puissant.
Ce réajustement des prix a également immédiatement suscité des comparaisons avec d'autres modèles axés sur le coût, notamment Kimi K3.
Un mème viral partagé dans la communauté décrivait la situation ainsi : Luna commençait soudainement à se disputer les utilisateurs attirés par le positionnement à bas prix de Kimi K3.
Ce mème était amusant, mais il ne s'agit pas d'un benchmark technique, il n'a donc pas été inclus dans les images du texte principal.
Les développeurs demandent immédiatement si Anthropic répondra
Une autre réaction courante a été d'interpeller @Anthropic pour savoir si les prix des API Claude seraient ajustés en conséquence.
Cette réaction reflète une évolution plus large du paysage concurrentiel des grands modèles.
Il y a un an, la concurrence la plus visible portait sur :
- Les scores de benchmark
- Les capacités de codage
- Les fenêtres de contexte
- Les fonctions multimodales
Ces dimensions restent importantes.
Mais les développeurs qui exécutent des agents de production s'intéressent de plus en plus à :
- Le coût par tâche accomplie
- La latence
- L'utilisation des tokens de sortie
- L'efficacité du cache de prompts
- Le nombre d'appels d'outils
- La fiabilité
- La flexibilité du routage des modèles
Le token le moins cher n'est pas toujours le workflow le moins cher.
De même, le modèle le plus intelligent n'est pas forcément le meilleur modèle pour chaque étape d'un workflow.
La baisse de prix de Luna rend le routage de modèles plus attractif
Supposons qu'une tâche comporte cinq étapes :
- Comprendre un problème ambigu.
- Élaborer un plan.
- Modifier des fichiers de routine.
- Écrire des tests.
- Vérifier les résultats.
Une équipe pourrait utiliser Sol pour les étapes 1 et 2.
Lorsque le travail est clairement spécifié, Luna peut gérer les étapes 3 à 5.
Plus Luna est abordable, plus l'incitation à délester le travail d'agent de routine du modèle phare est forte.
Cela ne signifie pas que Luna se rapproche de Sol dans toutes les capacités.
Cela signifie que la valeur d'un modèle plus petit dépend de sa capacité à être suffisamment intelligent pour la tâche spécifique qui lui est assignée.
La métrique importante est le coût par résultat réussi
Le nouveau discours d'OpenAI insiste à plusieurs reprises sur les résultats par dollar.
C'est plus utile que de se concentrer uniquement sur le prix des tokens.
Les évaluations en production devraient suivre :
- Le taux de réussite des tâches
- Les tokens d'entrée
- Les tokens de sortie
- La réutilisation du cache d'entrée
- Le nombre de tours de modèle
- Les appels d'outils
- La latence de bout en bout
- Le taux de nouvelles tentatives
- Le temps de correction humaine
- Le coût total par tâche réussie
Un modèle cinq fois moins cher par token peut encore s'avérer coûteux s'il nécessite de nombreuses nouvelles tentatives.
Un modèle plus cher qui accomplit le travail en moins d'étapes peut, en fin de compte, avoir un coût global inférieur.
Les nouveaux tarifs de Luna rendent le calcul plus favorable aux modèles plus petits, mais les développeurs ont toujours besoin
d'évaluations adaptées à leurs charges de travail spécifiques.
Conclusion : la concurrence entre modèles se déplace vers le rapport intelligence/coût
Les événements du 29 et du 30 juillet montrent qu'OpenAI fait progresser simultanément deux idées liées.
Premièrement, GPT-5.6 est de plus en plus utilisé pour améliorer l'infrastructure qui fait fonctionner GPT-5.6 lui-même.
Deuxièmement, l'entreprise transforme une partie de ces gains d'efficacité en prix clients plus bas et en options de service plus rapides.
Cela change le paysage concurrentiel.
La prochaine phase du marché des modèles ne consiste pas seulement à se demander :
Quel est le modèle le plus intelligent ?
Elle consiste aussi à se demander :
Quelle quantité d'intelligence utile un développeur peut-il acheter pour chaque dollar dépensé et chaque seconde de latence ?
La baisse de 80 % du prix de Luna rend cette question particulièrement pertinente.
Terra devient plus abordable pour le travail professionnel quotidien.
Sol reste le modèle haut de gamme, mais le mode Fast permet aux développeurs de payer plus pour une rapidité accrue lorsque le temps presse.
À mesure que la qualité des modèles converge sur davantage de tâches, les entreprises qui parviennent à faire faire plus de travail utile au même matériel — et à transformer ces gains d'efficacité en meilleurs prix — pourraient obtenir un avantage concurrentiel de plus en plus important.
Questions fréquentes
Quel est le nouveau prix de l'API GPT-5.6 Luna ?
À compter du 30 juillet 2026, OpenAI fixe le prix de GPT-5.6 Luna en mode de traitement standard à 0,20 $ par million de tokens d'entrée et 1,20 $ par million de tokens de sortie. Cela représente une réduction de 80 % par rapport au prix initial de 1 $ / 6 $ par million de tokens.
Quel est le nouveau prix de GPT-5.6 Terra ?
GPT-5.6 Terra est actuellement proposé en mode de traitement standard à 2 $ par million de tokens d'entrée et 12 $ par million de tokens de sortie. OpenAI indique qu'il s'agit d'une réduction de 20 % par rapport aux prix précédents de 2,50 $ / 15 $ par million de tokens.
GPT-5.6 Sol a-t-il baissé de prix ?
Non. Le prix standard de l'API Sol reste à 5 $ par million de tokens d'entrée et 30 $ par million de tokens de sortie. Le principal changement est l'introduction du mode Fast.
Qu'est-ce que le mode Fast de GPT-5.6 Sol ?
Le mode Fast est le niveau de traitement API plus rapide d'OpenAI, qui remplace l'ancien nom Priority Processing. Pour GPT-5.6 Sol, OpenAI indique qu'au double du prix standard des tokens, il peut augmenter la vitesse de traitement jusqu'à 2,5 fois par rapport au mode standard, sans modifier le niveau d'intelligence du modèle.
Les anciennes requêtes API Priority Processing fonctionnent-elles toujours ?
Oui. OpenAI indique que les requêtes utilisant le niveau de service priority restent rétrocompatibles et utiliseront automatiquement le mode Fast. Les développeurs peuvent également utiliser la valeur de niveau de service fast.
GPT-5.6 a-t-il vraiment contribué à s'optimiser lui-même ?
OpenAI indique que GPT-5.6 Sol, utilisé via Codex dans des processus d'ingénierie supervisés par des humains, a aidé à analyser le trafic de production, à réécrire des noyaux GPU, à exécuter des centaines d'expériences de décodage spéculatif et à surveiller le processus d'entraînement. OpenAI attribue une partie des résultats — une réduction de 20 % des coûts de service de bout en bout et une amélioration de plus de 15 % de l'efficacité de génération de tokens — à ces travaux.
La baisse des prix modifiera-t-elle les abonnements ChatGPT ?
Les prix des abonnements et les budgets de quotas ne changeront pas. OpenAI indique que, grâce aux prix sous-jacents plus bas, Luna et Terra consomment désormais moins de crédits dans Codex et ChatGPT Work.
Luna est-elle désormais le meilleur modèle pour toutes les charges de travail d'agents ?
Non. Luna est beaucoup moins chère, mais le choix du modèle dépend toujours de la difficulté de la tâche et du taux d'erreur acceptable. La stratégie courante consiste à utiliser un modèle plus puissant pour les tâches de planification floues et un modèle moins cher pour les tâches d'exécution clairement définies.
Outils associés
- API OpenAI : La plateforme de développement d'OpenAI pour accéder aux modèles GPT-5.6 et aux services API.
- GPT-5.6 Sol : Les spécifications officielles du modèle phare GPT-5.6.
- GPT-5.6 Terra : La documentation officielle du modèle équilibré GPT-5.6.
- GPT-5.6 Luna : La documentation officielle du modèle GPT-5.6 axé sur la réduction des coûts.
- Codex : L'environnement de codage d'agents d'OpenAI, utilisé pour certains travaux d'optimisation de GPT-5.6.
- Artificial Analysis : Une plateforme d'analyse indépendante de modèles, couvrant l'intelligence, la vitesse, l'utilisation des tokens et le coût par tâche.
Liens associés
- OpenAI : faire progresser la frontière du rapport prix/performance avec GPT-5.6 : L'annonce officielle d'OpenAI du 30 juillet concernant les baisses de prix de Luna et Terra et le mode Fast de Sol.
- OpenAI : comment GPT-5.6 fusionne intelligence de pointe et efficacité de pointe : Les détails techniques sur l'équilibrage de charge, les noyaux GPU, le décodage spéculatif, la gestion du contexte et la mise en cache des prompts.
- OpenAI Fast mode : La documentation officielle sur le traitement API plus rapide et la tarification du mode Fast.
- OpenAI GPT-5.6 release : L'annonce originale de disponibilité générale de la famille GPT-5.6 et le contexte des benchmarks.
- Artificial Analysis : benchmarks GPT-5.6 : Analyse indépendante de l'intelligence, des performances de codage, de la vitesse et du coût de GPT-5.6 avant la baisse de prix du 30 juillet.
- [Artificial Analysis GPT-5.6 Luna](https://artificialanalysis.
ai/models/gpt-5-6-luna/) : Informations détaillées sur la méthodologie au niveau du modèle et l'indice d'intelligence de Luna.
- Catalogue des modèles OpenAI : Catalogue officiel des modèles API et spécifications actuelles des modèles.
Résumé
OpenAI a réduit de 80 % le prix de l'API GPT-5.6 Luna, et de 20 % celui de Terra, tout en maintenant inchangé le prix de Sol Standard. Sol a en revanche gagné un nouveau mode Fast, qui accélère le traitement API jusqu'à 2,5 fois, mais à un prix double de celui du mode Standard.
Ce calendrier est étroitement lié aux récents travaux d'ingénierie d'OpenAI. La société indique que GPT-5.6 Sol a contribué à optimiser les cœurs GPU, le décodage spéculatif, l'équilibrage de charge et l'infrastructure des agents, réduisant ainsi le coût de service de bout en bout de 20 %, et atteignant une amélioration de l'efficacité de génération de jetons de plus de 15 % sur certaines parties de la pile technologique.
Pour les développeurs, le résultat est une gamme de rapport qualité-prix plus large : Sol pour les tâches les plus difficiles, Terra pour les tâches professionnelles équilibrées, et Luna à prix réduit pour l'exécution d'agents à grande échelle.
La mise à jour de GPT-5.6 montre que la concurrence autour des modèles de pointe se concentre de plus en plus sur le coût par résultat réussi — et non plus seulement sur le niveau brut d'intelligence des benchmarks.



