Analyse des baisses de prix de GPT-5.6 : Luna en baisse de 80 %, Terra de 20 %, Sol lance le mode rapide
Moins d'un mois après la sortie officielle de la série GPT-5.6, OpenAI a ajusté sa stratégie de prix. À compter du 30 juillet 2026 : - GPT-5.6 Luna voit son prix réduit de 80 %. - GPT-5.6 Terra voit son prix réduit de 20 %

Interprétation de la baisse des prix de GPT-5.6 : Luna en baisse de 80 %, Terra en baisse de 20 %, Sol ajoute un mode rapide
Introduction
Moins d'un mois après la sortie officielle de la série GPT-5.6, OpenAI a ajusté son système de tarification.
À compter du 30 juillet 2026 :
- GPT-5.6 Luna voit son prix réduit de 80 %.
- GPT-5.6 Terra voit son prix réduit de 20 %.
- GPT-5.6 Sol conserve son prix Standard d'origine, mais propose désormais une option de traitement API plus rapide.
- Priority Processing a été renommé Fast mode.
Cette mise à jour ne se limite pas à une simple remise temporaire. OpenAI indique que ces baisses reflètent des améliorations apportées au modèle lui-même, à l'architecture d'inférence, au système de routage, à la gestion du contexte ainsi qu'aux logiciels d'agents connectant les modèles aux outils.
Le résultat concret : un choix plus large en environnement de production.
Luna est désormais tarifée pour les flux de travail d'agents à forte concurrence et sensibles aux coûts. Terra reste le choix équilibré pour le travail quotidien nécessitant une intelligence accrue. Sol continue de servir les tâches les plus exigeantes, tandis que le Fast mode offre une option à plus faible latence lorsque le temps d'attente prime sur la prime au token.
Changements au 30 juillet 2026
Lors de la sortie de GPT-5.6 le 9 juillet, OpenAI avait publié les tarifs Standard pour contexte court suivants :
| Modèle | Prix d'entrée d'origine | Prix de sortie d'origine |
|---|---|---|
| GPT-5.6 Sol | $5,00 / million de tokens | $30,00 / million de tokens |
| GPT-5.6 Terra | $2,50 / million de tokens | $15,00 / million de tokens |
| GPT-5.6 Luna | $1,00 / million de tokens | $6,00 / million de tokens |
La mise à jour du 30 juillet ajuste les prix de Terra et Luna :
| Modèle | Nouveau prix d'entrée | Nouveau prix de sortie | Variation |
|---|---|---|---|
| GPT-5.6 Sol | $5,00 / million de tokens | $30,00 / million de tokens | Inchangé |
| GPT-5.6 Terra | $2,00 / million de tokens | $12,00 / million de tokens | Baisse de 20 % |
| GPT-5.6 Luna | $0,20 / million de tokens | $1,20 / million de tokens | Baisse de 80 % |
Le prix de Luna est désormais tombé au cinquième de son prix de lancement.
Le nouveau prix de Terra représente les quatre cinquièmes de son prix d'origine.
Sol reste inchangé en traitement Standard, mais le Fast mode offre désormais aux développeurs un choix : jusqu'à 2,5 fois la vitesse de réponse pour deux fois le prix du token Standard.
Tarification Standard actuelle de l'API
Les prix d'entrée et de sortie affichés ne montrent pas la structure de facturation complète.
GPT-5.6 prend en charge les réductions pour entrée en cache et l'écriture explicite en cache. Les requêtes de plus de 272 000 tokens d'entrée bénéficient également d'une tarification long contexte pour l'ensemble de la requête.
Tarification Standard pour contexte court
Les tarifs suivants sont calculés par million de tokens :
| Modèle | Entrée | Entrée en cache | Écriture en cache | Sortie |
|---|---|---|---|---|
| GPT-5.6 Sol | $5,00 | $0,50 | $6,25 | $30,00 |
| GPT-5.6 Terra | $2,00 | $0,20 | $2,50 | $12,00 |
| GPT-5.6 Luna | $0,20 | $0,02 | $0,25 | $1,20 |
La lecture en cache bénéficie d'une remise de 90 % par rapport à une entrée non mise en cache.
L'écriture en cache est facturée à 1,25 fois le prix de l'entrée non mise en cache.
Tarification Standard pour long contexte
Pour les prompts dépassant 272 000 tokens d'entrée, OpenAI facture actuellement les frais suivants pour la requête complète :
| Modèle | Entrée | Entrée en cache | Écriture en cache | Sortie |
|---|---|---|---|---|
| GPT-5.6 Sol | $10,00 | $1,00 | $12,50 | $45,00 |
| GPT-5.6 Terra | $4,00 | $0,40 | $5,00 | $18,00 |
| GPT-5.6 Luna | $0,40 | $0,04 | $0,50 | $1,80 |
La règle du long contexte implique que
l'estimation des coûts doit prendre en compte à la fois le nombre de tokens et le fait que la requête franchisse ou non le seuil de 272 000 tokens.
Un très grand prompt n'est pas traité en facturant les 272 000 premiers tokens au tarif court contexte et le reste à un tarif plus élevé. Le multiplicateur long contexte s'applique à l'ensemble de la requête.
Aligner l'intelligence avec les résultats
L'argument principal d'OpenAI est qu'un déploiement efficace de l'IA commence par les résultats, et non par le nom du modèle.
Différentes étapes d'un même flux de travail peuvent nécessiter différents niveaux d'intelligence, de vitesse et de fiabilité.
Le modèle idéal pour une tâche dépend de :
- La gravité des conséquences en cas d'erreur.
- La difficulté du travail.
- Le temps de réponse acceptable.
- Le volume de requêtes.
- Le coût de la vérification humaine.
- La possibilité de valider automatiquement les résultats.
- Le caractère clairement spécifié ou encore flou de la tâche.
Quand choisir Luna
GPT-5.6 Luna est conçu pour les travaux à haut volume et sensibles aux coûts.
Sa page actuelle du modèle API le décrit comme correspondant approximativement au niveau nano utilisé dans la série GPT-5 précédente.
Luna est un candidat pratique pour :
- La classification.
- L'extraction structurée.
- Les étapes d'agents en arrière-plan.
- Les modifications de code de routine.
- La génération de tests.
- Le traitement documentaire.
- Les boucles d'appels d'outils répétitives.
- Le traitement à grande échelle où l'impact négatif de chaque tâche individuelle est limité.
OpenAI estime que Luna peut fournir des performances comparables à ce qui était considéré comme un modèle de pointe il y a environ un an, à un coût d'environ six cents par dollar de tâche et près de neuf fois plus rapidement.
Cette comparaison s'appuie sur les évaluations et la méthodologie de coûts d'OpenAI. Les équipes doivent valider ces chiffres sur leurs propres charges de travail.
Quand choisir Terra
GPT-5.6 Terra est le membre équilibré de la série.
OpenAI le positionne là où se situaient les modèles mini de l'ère GPT-5, mais avec une meilleure capacité d'agents et un travail professionnel plus poussé.
Terra convient à :
- Les questions-réponses sur des espaces de travail.
- La recherche délimitée.
- Le codage quotidien.
- L'analyse de documents.
- La planification d'agents de complexité moyenne.
- Les flux de support client nécessitant du raisonnement.
- Les tâches métier répétitives lorsque Luna n'est pas assez fiable mais que Sol n'est pas nécessaire.
Quand choisir Sol
GPT-5.6 Sol est le modèle phare pour les travaux complexes et professionnels.
C'est le meilleur choix lorsque le modèle doit :
- Lever les ambiguïtés.
- Établir des plans pour des projets difficiles.
- Examiner des décisions à forte valeur.
- Gérer du codage ou du débogage complexe.
- Coordonner des outils dans des flux de travail longs.
- Mener des recherches approfondies.
- Générer ou valider des travaux dont l'échec est coûteux.
L'alias API gpt-5.6 route vers gpt-5.6-sol.
Un flux de travail peut utiliser plusieurs modèles
Cette mise à jour tarifaire rend les flux de travail hybrides multi-modèles plus pratiques.
Un agent de codage n'a pas besoin d'utiliser Sol pour chaque token et chaque appel d'outil.
Une architecture possible est la suivante :
- Utiliser Sol pour comprendre la base de code et identifier les incertitudes.
- Laisser Sol créer le plan et définir les critères de réussite.
- Envoyer les tâches d'implémentation clairement spécifiées à Luna.
- Utiliser Luna pour écrire des tests de routine et effectuer des vérifications répétitives.
- Router les étapes incertaines ou en échec vers Terra ou Sol.
- Utiliser Sol pour une revue finale lorsque les conséquences d'une erreur sont importantes.
est très élevée.
Le même schéma peut s'appliquer au-delà du génie logiciel.
Un système de traitement documentaire pourrait utiliser Luna pour l'extraction, Terra pour la synthèse, et Sol uniquement lorsque les documents présentent une ambiguïté ou un impact majeur.
La bonne stratégie de routage doit être déterminée par l'évaluation, et non par des hypothèses.
OpenAI partage les résultats clients
Les annonces d'OpenAI incluent des retours clients précoces provenant de plusieurs utilisateurs en production.
Ces exemples sont autodéclarés par les entreprises et les clients, et ne constituent pas des benchmarks indépendants.
| Entreprise | Usage ou résultat rapporté |
|---|---|
| Replit | Luna rend des cas d'usage auparavant irréalistes suffisamment rentables pour être explorés |
| Notion | Terra, lors d'évaluations internes, atteint une qualité comparable à GPT-5.5 avec la moitié du coût de tâche et un temps réduit de 60 % |
| Ramp | Terra et Luna dominent les évaluations internes de codage en termes d'efficacité coût ; Luna devient le choix par défaut pour les tâches d'automatisation en arrière-plan |
| Blitzy | Luna fait passer le taux de réutilisation du cache de提示 de 24 % à 90 %, réduisant considérablement les coûts par rapport à l'option précédente par défaut |
| Cognition | Luna sert de partenaire de codage à moindre coût dans Devin Fusion, en complément de modèles plus grands |
| Dust | Selon les rapports, sur des tâches d'agent similaires, Luna est 40 % plus rapide et 40 % moins chère que l'option précédente par défaut de l'entreprise |
Ces exemples montrent que la facturation au token n'est pas la seule mesure utile.
Un modèle moins cher peut également modifier :
- Le nombre d'appels d'outils.
- La réutilisation du cache.
- La longueur du contexte.
- La verbosité de la sortie.
- La fréquence des nouvelles tentatives.
- Les besoins de revue humaine.
- Le temps total d'achèvement.
Une mesure plus significative est souvent le coût par résultat réussi.
Ce qu'OpenAI présente comme moyens d'améliorer l'efficacité
OpenAI attribue l'amélioration du rapport performance-prix à trois niveaux interdépendants.
1. Le modèle
Les modèles de la série GPT-5.6 sont conçus pour accomplir le travail plus directement.
Un modèle qui nécessite moins de tokens de sortie, moins de nouvelles tentatives ou moins de boucles de raisonnement peut réduire le coût total de la tâche, même si le prix affiché reste inchangé.
2. Le système d'inférence
La pile de production détermine l'efficacité avec laquelle le modèle utilise le matériel.
OpenAI indique qu'un logiciel de service optimisé peut générer des tokens plus efficacement et maintenir la productivité des ressources de calcul.
3. Le framework d'agents
Le framework est le logiciel qui entoure le modèle, fournissant outils, contexte, routage, état et contrôle des flux de travail.
OpenAI indique qu'une meilleure gestion du contexte aide les agents à éviter de répéter un travail déjà accompli.
Cela peut réduire :
- Les appels d'outils répétés.
- Le traitement répété d'un contexte inchangé.
- La planification redondante.
- Les allers-retours inutiles vers le modèle.
- Les tokens dépensés pour reformuler des résultats précédents.
Ces trois niveaux s'influencent mutuellement.
Un modèle plus puissant peut trouver des optimisations dans la pile de service. Ces optimisations réduisent les coûts, rendant l'utilisation d'agents à plus grande échelle économiquement viable. Une plus grande utilisation crée à son tour davantage d'opportunités d'amélioration du système.
GPT-5.6 Sol a contribué à optimiser sa propre pile de service
L'une des déclarations les plus frappantes de l'annonce est que GPT-5.6 Sol a contribué aux travaux internes d'efficacité d'OpenAI.
Dans un processus d'ingénierie dominé par les humains, OpenAI indique que Sol :
- A réécrit et optimisé les noyaux de production.
- A conçu et exécuté des centaines d'expériences de génération de tokens.
- A surveillé les processus d'entraînement.
- Est intervenu en cas de problème.
OpenAI rapporte que les optimisations au niveau des noyaux ont réduit le coût de service de bout en bout du modèle d'environ 20 %.
L'entreprise indique également que ces expériences ont amélioré l'efficacité de génération de tokens de plus de 15 %.
Ces résultats sont internes à OpenAI et n'ont pas été reproduits indépendamment via des benchmarks publics.
Un point plus important est que les modèles deviennent progressivement partie intégrante du processus d'amélioration de l'infrastructure sur laquelle ils fonctionnent.
Cela crée une boucle de rétroaction d'ingénierie plus étroite :
Modèle plus puissant
→ Meilleure optimisation de l'infrastructure
→ Coûts de service réduits
→ Adoption plus large
→ Davantage de retours et d'investissements
→ Génération suivante de modèles plus puissants
Stratégie de calcul orientée vers l'échelle
Une tarification plus basse ne signifie pas qu'OpenAI a besoin de moins de puissance de calcul totale.
L'entreprise estime qu'atteindre une intelligence suffisante nécessite deux éléments :
- Davantage de puissance de calcul.
- Une puissance de calcul plus productive.
Le premier élargit la capacité totale.
Le second augmente le volume de travail effectif accompli par unité de matériel.
OpenAI indique qu'elle construit un portefeuille d'infrastructure diversifié et fait correspondre les charges de travail aux systèmes les plus adaptés pour les exécuter.
Cela soutient simultanément les deux extrémités de la série GPT-5.6 :
- Luna et Terra rendent les charges de travail à grand volume moins coûteuses.
- Sol et Fast Mode prennent en charge les tâches difficiles et sensibles à la latence.
Les exemples de charges de travail plus faciles à exécuter à grande échelle incluent :
- Les pipelines d'analyse de grands documents.
- La classification des interactions clients.
- L'implémentation logicielle de routine.
- L'automatisation d'agents en arrière-plan.
- Les tâches répétitives de traitement de données.
- Les flux de travail d'appels d'outils avec un taux de réutilisation du cache élevé.
Parallèlement, lorsque la valeur d'obtenir une réponse plus rapide justifie le coût supplémentaire, les requêtes complexes de Sol peuvent utiliser le Fast Mode.
Fast Mode remplace le traitement prioritaire
Fast Mode est le nouveau nom du niveau de service prioritaire d'OpenAI.
Les requêtes API existantes utilisant :
"service_tier": "priority"
restent compatibles.
Les développeurs peuvent également utiliser :
"service_tier": "fast"
Pour GPT-5.6 Sol, OpenAI indique que le Fast Mode peut atteindre des vitesses jusqu'à 2,5 fois supérieures au traitement standard, tout en conservant la même intelligence du modèle.
Le prix en est le coût.
Actuellement, le Fast Mode de GPT-5.6 Sol est facturé à 2 fois le prix standard des tokens API.
Les réductions pour entrée en cache restent applicables.
Exemple en Python
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-sol",
input="Examinez ce plan de migration et identifiez les trois hypothèses les plus risquées.",
service_tier="fast",
)
print(response.output_text)
Le Fast Mode est disponible via l'API Responses et l'API Chat Completions pour les modèles pris en charge.
Pour GPT-5.6 et les modèles antérieurs, même si la requête utilise le nouveau nom fast, l'objet de réponse peut rapporter le niveau de service comme priority.
Quand la prime du Fast Mode vaut-elle la peine
Le Fast Mode n'est pas automatiquement le meilleur réglage pour toutes les requêtes Sol.
Il est le plus utile lorsque la latence affecte directement la valeur du résultat.
Les exemples incluent :
- Les assistants orientés utilisateur qui complètent des flux de travail à forte valeur ajoutée.
- Les agents de programmation qui attendent de débloquer les développeurs.
- La recherche ou l'analyse interactive.
- Le support en cas d'incident.
- Les examens en temps réel avant prise de décision.
- Le trafic métier sensible à la latence des systèmes de production stables.
Pour les scénarios suivants, le traitement standard peut être plus économique :
- Les tâches en arrière-plan.
- La recherche de nuit.
- La génération asynchrone de rapports.
- L'analyse par lots.
- Les tâches où l'utilisateur n'attend pas.
- Les flux de travail dont le goulot d'étranglement se situe au niveau des outils externes plutôt que du modèle.
La prime de deux fois le token n'a de sens que si la valeur créée par l'achèvement en aval dépasse son coût.
Le cache de提示 devient plus important dans les flux de travail d'agents longs
Les nouveaux prix rendent Luna et Terra moins chers, mais le cache de提示 peut également avoir un impact considérable sur les agents qui s'exécutent longtemps.
Chaque tour de boucle d'agent peut renvoyer :
- Les instructions système.
- Les définitions d'outils.
- Les documents partagés.
- Le contexte de la base de code.
- L'historique de la conversation.
- Les règles stables du flux de travail.
Sans cache, une application peut payer plusieurs fois pour les mêmes préfixes.
GPT-5.6 prend en charge à la fois le cache automatique et les points de rupture de cache explicites.
La facturation actuelle d'OpenAI est la suivante :
- La lecture du cache est facturée à 10 % du prix de l'entrée non mise en cache.
- L'écriture du cache est facturée à 125 % du prix de l'entrée non mise en cache.
L'écriture du cache coûte plus cher que l'entrée ordinaire, mais les lectures suivantes bénéficient d'une réduction importante.
Le cache est le plus utile lorsque le même préfixe stable est réutilisé suffisamment de fois pour amortir le coût d'écriture plus élevé.
Les applications doivent suivre :
- Le taux de réussite du cache.
- La stabilité du préfixe.
- L'intervalle entre les requêtes.
- La taille du contexte en cache.
- La fréquence à laquelle le flux de travail invalide le préfixe.
Spécifications du modèle partagées par toute la série
Le modèle actuel
La page du modèle API répertorie plusieurs spécifications partagées :
| Spécification | Sol | Terra | Luna |
|---|---|---|---|
| Fenêtre de contexte | 1 050 000 jetons | 1 050 000 jetons | 1 050 000 jetons |
| Sortie maximale | 128 000 jetons | 128 000 jetons | 128 000 jetons |
| Date limite des connaissances | 16 février 2026 | 16 février 2026 | 16 février 2026 |
| Entrée/sortie de texte | Pris en charge | Pris en charge | Pris en charge |
| Entrée d'image | Pris en charge | Pris en charge | Pris en charge |
| Jetons de raisonnement | Pris en charge | Pris en charge | Pris en charge |
| Appel de fonction | Pris en charge | Pris en charge | Pris en charge |
| Sortie structurée | Pris en charge | Pris en charge | Pris en charge |
| Fine-tuning | Non pris en charge | Non pris en charge | Non pris en charge |
Ces trois modèles sont tous disponibles via l'API Responses.
La page du modèle répertorie également une large prise en charge des outils, mais la disponibilité réelle des fonctionnalités peut varier selon le point de terminaison, le compte, le produit et la phase de déploiement.
Disponibilité dans ChatGPT Work, Codex et l'API
OpenAI indique que GPT-5.6 Terra et Luna restent disponibles sur les plateformes suivantes :
- ChatGPT Work.
- Codex.
- API OpenAI.
Les accès actuels décrits dans l'annonce tarifaire incluent :
| Groupe de forfaits | Accès à GPT-5.6 dans ChatGPT Work et Codex |
|---|---|
| Gratuit et Go | Terra |
| Plus, Pro, Business, Enterprise | Terra et Luna |
Sol possède ses propres règles d'accès dans ChatGPT, ChatGPT Work, Codex et l'API.
La mise à jour du 30 juillet n'a pas réduit les prix d'abonnement de ChatGPT ou de Codex.
Elle n'a pas non plus augmenté les budgets de quotas annoncés.
Au contraire, Luna et Terra consomment désormais moins de crédits, car leurs coûts d'utilisation sous-jacents sont plus faibles.
OpenAI a également indiqué que la mise à jour tarifaire commencerait à être déployée via AWS le jour de l'annonce. Les tarifs des modèles proposés via des plateformes tierces peuvent différer de ceux de l'API OpenAI directe.
Comment faire
Choisir le bon modèle GPT-5.6
Un processus de sélection pratique peut suivre cinq étapes.
Première étape : définir clairement le résultat attendu
Notez ce qui constitue un succès.
Évitez de choisir un modèle uniquement sur la base de catégories générales comme « programmation » ou « recherche ».
Deuxième étape : identifier le coût de l'échec
Les tâches de classification à faible risque et les migrations de bases de données en production ne devraient pas utiliser les mêmes règles de décision.
Troisième étape : établir une référence avec Sol
Pour les tâches difficiles, testez d'abord Sol pour connaître le niveau de qualité maximal disponible.
Quatrième étape : tester Terra et Luna sur le même ensemble d'évaluation
Mesurez si les modèles moins chers préservent la qualité réellement importante.
Cinquième étape : optimiser l'ensemble du flux de travail
Suivez :
- Le taux de réussite des tâches.
- Le nombre total de jetons.
- Le taux de réutilisation du cache.
- Le nombre d'appels d'outils.
- Le nombre de nouvelles tentatives.
- La latence.
- Le temps de révision humaine.
- Le coût par résultat réussi.
N'optimisez pas uniquement le prix le plus bas des jetons d'entrée.
Questions fréquentes
Quel est le nouveau prix de GPT-5.6 Luna ?
GPT-5.6 Luna a désormais un prix standard de 0,20 $ par million de jetons d'entrée en contexte court, 0,02 $ par million de jetons d'entrée en cache, et 1,20 $ par million de jetons de sortie. Le prix d'écriture en cache est de 0,25 $ par million de jetons.
Quel est le nouveau prix de GPT-5.6 Terra ?
GPT-5.6 Terra a désormais un prix standard de 2,00 $ par million de jetons d'entrée en contexte court, 0,20 $ par million de jetons d'entrée en cache, et 12,00 $ par million de jetons de sortie. Le prix d'écriture en cache est de 2,50 $ par million de jetons.
GPT-5.6 Sol a-t-il baissé de prix ?
Le prix standard de ses jetons n'a pas changé. Sol reste à 5 $ par million de jetons d'entrée en contexte court et 30 $ par million de jetons de sortie, tandis que le mode Fast offre une vitesse de traitement 2,5 fois supérieure pour un prix deux fois plus élevé que le tarif standard.
Qu'est-il arrivé au traitement prioritaire ?
OpenAI a renommé le traitement prioritaire en mode Fast le 30 juillet 2026. Les requêtes existantes utilisant service_tier: "priority" restent compatibles, et les nouvelles requêtes peuvent utiliser service_tier: "fast".
Quand la tarification en contexte long de GPT-5.6 s'applique-t-elle ?
La page actuelle du modèle indique que les invites contenant plus de 272 000 jetons d'entrée bénéficieront de tarifs d'entrée et de sortie plus élevés pour l'ensemble de la requête. Les développeurs doivent prendre en compte ce seuil lors de l'estimation des coûts pour les invites très volumineuses.
Quel modèle GPT-5.6 convient le mieux aux charges de travail à haut débit ?
OpenAI positionne Luna comme le modèle destiné aux tâches sensibles aux coûts et à haut débit. Lorsque Luna ne fournit pas une qualité suffisante, Terra constitue le choix équilibré, tandis que Sol est destiné aux tâches professionnelles les plus difficiles.
La baisse des prix réduit-elle les frais d'abonnement de ChatGPT et Codex ?
Non. OpenAI indique que les prix d'abonnement et les budgets de quotas restent inchangés. Terra et Luna consomment désormais moins de crédits dans les flux de travail pris en charge par les produits payants.
Tous les fournisseurs cloud proposent-ils immédiatement les nouveaux prix ?
Les prix directs de l'API OpenAI ont changé le 30 juillet. OpenAI indique que la tarification AWS commencera à être déployée plus tard dans la journée, mais les prix et la disponibilité des plateformes tierces peuvent varier. Les utilisateurs doivent donc vérifier les grilles tarifaires actuelles de leur fournisseur.
Outils associés
- GPT-5.6 Sol : le modèle GPT-5.6 phare d'OpenAI pour les tâches professionnelles complexes.
- GPT-5.6 Terra : le modèle GPT-5.6 équilibré
adapté aux charges de travail nécessitant à la fois intelligence et réduction des coûts.
- GPT-5.6 Luna : le modèle GPT-5.6 le plus rapide et le plus économique pour les tâches à haut débit et sensibles aux coûts.
- API Responses : l'API principale d'OpenAI pour les flux de travail de raisonnement, d'outils, multi-tours et les applications d'agents.
- Codex : l'environnement d'ingénierie logicielle par agents d'OpenAI basé sur la famille de modèles GPT-5.6.
- Tableau de bord API OpenAI : l'espace de travail officiel pour gérer les clés API, les projets, l'utilisation, les limites et la facturation.
Liens associés
Tarification complète de l'API OpenAI : taux actuels standard, par lots, rapides, d'entrée en cache, d'écriture en cache et de jetons en contexte long.
Documentation sur le mode Fast : instructions officielles de configuration, détails de compatibilité et guide d'utilisation du niveau de service renommé.
[Guide des modèles GPT-5.6](https://developers.openai.
Guide des derniers modèles : recommandations officielles pour la sélection, la migration, l'inférence, la mise en cache et les workflows des modèles.
Annonce de la sortie de GPT-5.6 : lancement de la gamme de modèles d'origine, capacités des modèles, tarifs initiaux, disponibilité et benchmarks.
Ingénierie d'efficacité de GPT-5.6 : explication par OpenAI du travail sur les modèles et l'infrastructure derrière les gains d'efficacité.
Guide de mise en cache des prompts : documentation officielle sur la mise en cache automatique et explicite des prompts.
Journal des mises à jour de l'API OpenAI : mises à jour de prix, sorties en mode rapide et autres modifications de l'API, datées.
Résumé
Dans sa mise à jour du 30 juillet, OpenAI a réduit de 80 % le prix standard de l'API de GPT-5.6 Luna et de 20 % celui de Terra. Le prix standard de Sol reste inchangé, tandis que le nouveau mode rapide peut multiplier par 2,5 la vitesse de réponse de l'API, avec un taux de tokens doublé.
Cette annonce s'inscrit dans une stratégie plus large de rapport qualité-prix. OpenAI indique qu'il améliore les modèles, la pile d'inférence, le routage, la gestion du contexte et les frameworks d'agents afin de réduire le temps, le nombre de tokens ou la puissance de calcul nécessaires à chaque tâche réussie.
Pour les développeurs, le bon choix ne consiste pas simplement à sélectionner le modèle le moins cher. Luna est conçu pour l'exécution à haut débit, Terra établit un équilibre entre coût et intelligence, et Sol gère les tâches les plus complexes. Les économies réalisées grâce au routage hybride des modèles, à la mise en cache, aux évaluations et à la mesure du coût par succès peuvent largement dépasser celles d'un simple changement de modèle.
Le changement fondamental est que GPT-5.6 offre désormais une plage de travail plus large : les niveaux Luna et Terra fournissent une intelligence quotidienne plus économique, tandis que Sol permet d'accéder à une intelligence de pointe plus rapide lorsque la latence justifie un coût plus élevé.
Ce fichier Markdown est une adaptation éditoriale indépendante de l'article officiel. Il conserve le thème, l'ordre des faits et le sens réel, sans copier mot pour mot la formulation d'OpenAI ni les citations des clients.