OpenAI a livré GPT-5.6 en disponibilité générale le 9 juillet 2026, et pour la première fois, une version phare de GPT est arrivée sous la forme de trois modèles avec trois prix distincts. Sol gère le raisonnement le plus difficile à 5 $ par million de tokens d'entrée et 30 $ par million de tokens de sortie. Terra se situe au milieu à 2,50 $ et 15 $. Luna couvre le travail à grand volume à 1 $ et 6 $. C'est un écart de 5x du haut vers le bas, ce qui fait du choix du modèle le plus grand levier unique sur votre facture d'API cette année.
Il y a un piège caché dans la nomenclature. L'alias simple gpt-5.6 redirige vers Sol, le niveau de raisonnement phare. Copiez un guide de démarrage rapide, laissez la chaîne de modèle telle quelle, et chaque requête de production paiera les tarifs phares pour un travail que Luna pourrait gérer à un cinquième du coût. Le défaut est le plus cher, et rien dans la réponse ne vous avertira.
Ce guide présente la grille tarifaire complète, exécute des exemples de coûts pour chaque niveau, explique le calcul de la mise en cache, comment l'effort de raisonnement et le mode ultra modifient les dépenses, et se termine par des modèles de routage qui maintiennent la facture stable sans sacrifier la qualité là où cela compte.
En bref
- Prix de GPT-5.6 par 1M de tokens : Sol 5 $ entrée / 30 $ sortie, Terra 2,50 $ / 15 $, Luna 1 $ / 6 $.
- L'alias simple
gpt-5.6redirige vers Sol. Épinglezgpt-5.6-terraougpt-5.6-lunaà moins que vous ne vouliez des tarifs phares par défaut. - OpenAI positionne Terra comme compétitif par rapport à GPT-5.5 à environ la moitié du prix, ce qui en fait la cible de migration naturelle.
- Mise en cache des prompts : les écritures sont facturées à 1,25x le taux d'entrée, les lectures bénéficient d'une réduction de 90 %, et la durée de vie minimale du cache est de 30 minutes. La mise en cache est rentable dès la deuxième requête.
- Un effort de raisonnement plus élevé signifie plus de tokens de sortie ; le mode ultra exécute quatre agents en parallèle et multiplie délibérément les dépenses en tokens.
- Les plans ChatGPT Gratuit et Go obtiennent Terra ; Plus et au-delà peuvent choisir entre les trois.
- Comparez les niveaux côte à côte et surveillez l'utilisation des tokens par requête dans Apidog avant de valider un ID de modèle pour la production.
La grille tarifaire GPT-5.6
Voici le coût de chaque modèle par million de tokens, y compris les taux de mise en cache dérivés (lectures à 10 % du prix d'entrée, écritures à 125 %) :
| Modèle | Entrée / 1M | Sortie / 1M | Lecture d'entrée mise en cache / 1M | Écriture dans le cache / 1M |
|---|---|---|---|---|
gpt-5.6-sol (alias: gpt-5.6) |
5,00 $ | 30,00 $ | 0,50 $ | 6,25 $ |
gpt-5.6-terra |
2,50 $ | 15,00 $ | 0,25 $ | 3,13 $ |
gpt-5.6-luna |
1,00 $ | 6,00 $ | 0,10 $ | 1,25 $ |
Les identifiants de modèle sont confirmés dans la documentation développeur d'OpenAI, et l'accès à l'API est en libre-service pour tout compte API. Il n'y a pas de restriction de plan côté API ; la restriction d'aperçu de juin a pris fin avant la GA et appartient au passé.
Encore une fois, car cela frappera quelqu'un dans votre équipe : gpt-5.6 sans suffixe est Sol. Si votre configuration, votre défaut de SDK ou votre exemple copié utilise l'alias simple, vous payez les tarifs de 5 $/30 $ que la tâche en ait besoin ou non. Épinglez l'ID de modèle complet partout et rendez le choix du niveau explicite lors de la révision de code.
Ce que signifie la hiérarchisation
Le numéro est la génération ; Sol, Terra et Luna sont des niveaux de capacité durables qui évolueront à leur propre rythme. Savoir à quoi sert chaque niveau est la majeure partie de la décision de coût.
Terra est la tête d'affiche en termes de rapport qualité-prix. OpenAI le positionne comme compétitif par rapport à GPT-5.5 à environ 2x moins cher. Si vous utilisez GPT-5.5 en production aujourd'hui, Terra est le candidat de remplacement qui réduit votre grille tarifaire de moitié ; vérifiez vos dépenses actuelles par rapport à la ventilation des prix de GPT-5.5 pour évaluer l'économie avant de migrer. Considérez la revendication de qualité comme celle d'OpenAI jusqu'à ce que vos propres évaluations la confirment, mais la réduction de prix est inconditionnelle.
Luna est le niveau de volume. À 1 $/6 $, il est conçu pour la classification, l'extraction, le routage et la rédaction de première passe : le travail à haute fréquence et sensible à la latence où le coût par requête domine toutes les autres préoccupations.
Sol est destiné aux problèmes qui échouent ailleurs. Raisonnement le plus profond, taux les plus élevés. L'avis de Simon Willison le jour du lancement vaut la peine d'être lu pour le point de vue d'un praticien sur où le produit phare justifie sa prime et où il ne le fait pas.
Les trois partageraient une fenêtre de contexte de 1 million de tokens et une sortie maximale de 128 000, selon la couverture de la documentation précoce, vous ne sacrifiez donc pas la capacité lorsque vous passez à un niveau inférieur. Vous échangez la profondeur de raisonnement contre le prix.
Ce que coûtent les requêtes en pratique
Les tarifs par million sont abstraits tant que vous ne fixez pas le prix d'une requête réelle. Prenons un appel typique de type RAG : 10 000 tokens d'entrée (prompt système, contexte récupéré, question de l'utilisateur) et 1 000 tokens de sortie.
| Modèle | Coût d'entrée | Coût de sortie | Total par requête |
|---|---|---|---|
| Sol | 0,050 $ | 0,030 $ | 0,080 $ |
| Terra | 0,025 $ | 0,015 $ | 0,040 $ |
| Luna | 0,010 $ | 0,006 $ | 0,016 $ |
Une requête semble bon marché partout. Le volume est l'endroit où les niveaux se séparent. Fixons le prix d'une charge de travail de classification : 1 million de requêtes par mois, 500 tokens d'entrée et 50 tokens de sortie chacun. Cela représente 500 millions de tokens d'entrée et 50 millions de tokens de sortie par mois.
| Modèle | Entrée | Sortie | Total mensuel |
|---|---|---|---|
| Luna | 500 $ | 300 $ | 800 $ |
| Terra | 1 250 $ | 750 $ | 2 000 $ |
| Sol | 2 500 $ | 1 500 $ | 4 000 $ |
Exécutez cette charge de travail sur l'alias simple gpt-5.6 et vous paierez 4 000 $ par mois pour un travail que Luna effectue pour 800 $. Le défaut de l'alias est une erreur de frappe de 3 200 $ par mois, chaque mois, jusqu'à ce que quelqu'un lise la facture.
L'économie de la mise en cache, avec des calculs réels
GPT-5.6 utilise des points d'arrêt de cache explicites : vous optez pour prompt_cache_options.mode: "explicit" et un champ ttl, au lieu de vous fier à la détection automatique des préfixes. Trois chiffres régissent l'économie. Les écritures dans le cache sont facturées à 1,25x le taux d'entrée non mis en cache. Les lectures de cache conservent la réduction de 90 %. La durée de vie minimale du cache est de 30 minutes.
{
"model": "gpt-5.6-terra",
"input": [
{ "role": "system", "content": "You are a support triage assistant. Classify each ticket..." },
{ "role": "user", "content": "Ticket #4821: webhook retries firing twice after 502s" }
],
"prompt_cache_options": { "mode": "explicit", "ttl": "30m" }
}
Maintenant, l'exemple travaillé. Supposons que vous ayez un prompt système de 5 000 tokens réutilisé sur 100 requêtes dans la fenêtre de cache, exécuté sur Sol.
- Non mis en cache : 100 requêtes x 5 000 tokens = 500 000 tokens de préfixe à 5 $ par 1M = 2,50 $
- Mis en cache : une écriture (5 000 tokens à 6,25 $ par 1M = 0,031 $) plus 99 lectures (495 000 tokens à 0,50 $ par 1M = 0,248 $) = environ 0,28 $
C'est environ 89 % de réduction sur la partie préfixe de la facture. Le seuil de rentabilité se situe à la deuxième requête : la prime d'écriture coûte 25 % d'un passage non mis en cache, tandis que chaque lecture économise 90 % d'un passage. Un préfixe utilisé deux fois est déjà moins cher mis en cache.
Le seuil de 30 minutes fonctionne dans les deux sens. Un assistant de chat ou un pipeline de support qui déclenche des requêtes toutes les quelques minutes maintient le cache à chaud gratuitement. Un travail par lots qui s'exécute une fois par nuit ne gagne rien et paie la prime d'écriture de 1,25x à chaque démarrage à froid ; désactivez la mise en cache dans ce cas. Mettez en cache le préfixe stable (prompt système, définitions d'outils, exemples peu fréquents) et conservez la partie volatile (entrée utilisateur, documents récupérés qui changent par requête) après le point d'arrêt.
Effort de raisonnement, mode pro et ultra
GPT-5.6 expose six niveaux d'effort de raisonnement : none, low, medium, high, xhigh et max. L'effort est un réglage de coût, pas seulement un réglage de qualité. Des réglages plus élevés produisent plus de tokens de sortie par requête, et la sortie est la direction coûteuse : 30 $ par million sur Sol, cinq fois le taux d'entrée. Deux requêtes avec des prompts identiques peuvent différer de plusieurs fois en coût purement sur le réglage de l'effort.
Les propres directives de migration d'OpenAI conseillent de traiter le déménagement comme un passage d'ajustement, pas seulement un changement de nom de modèle : comparez votre niveau d'effort actuel et un niveau inférieur sur des tâches représentatives. De nombreuses charges de travail maintiennent la qualité au réglage inférieur, et l'économie se cumule à chaque requête.
Le mode Pro (reasoning.mode: "pro") est un réglage disponible sur les trois modèles, pas un modèle séparé avec sa propre ligne tarifaire. Vous payez les mêmes prix par token ; le modèle dépense plus de tokens en réflexion, alors prévoyez une sortie plus importante pour les charges de travail axées sur la qualité.
Ultra est la dépense délibérée. Il exécute quatre agents en parallèle par défaut, multipliant délibérément la dépense en tokens en échange de résultats plus rapides et d'une amélioration mesurable de la qualité : selon OpenAI, il élève le score Terminal-Bench 2.1 de Sol de 88,8 % à 91,9 %. En première approximation, prévoyez environ quatre fois les tokens d'une exécution à agent unique et réservez-le pour le travail où le temps de réponse compte plus que le coût par réponse. La ventilation complète de la rentabilité de la dépense parallèle se trouve dans notre explicateur du mode ultra de GPT-5.6. Ultra est livré dans ChatGPT Work sur les plans Pro et Entreprise, et dans Codex à partir de Plus.
Ce que les plans ChatGPT offrent
Si votre utilisation de GPT-5.6 est conversationnelle plutôt que programmatique, un abonnement peut être plus avantageux que l'API en termes de coûts. Voici comment l'accès au modèle se mappe aux plans :
| Plan | Accès à GPT-5.6 |
|---|---|
| Gratuit / Go | Terra |
| Plus | Sol, Terra, Luna ; contrôle de l'effort par modèle (Sol à effort moyen et supérieur) |
| Pro / Business / Entreprise | Les trois, plus Sol Pro |
| ChatGPT Work (Pro / Entreprise) | Ajoute ultra |
Le fait que les utilisateurs gratuits et Go accèdent à Terra est un excellent défaut ; c'est le niveau qu'OpenAI compare à GPT-5.5. Le plan Plus est le niveau où apparaît le contrôle de l'effort par modèle, ce qui est important si vous vous appuyez sur Sol pour les problèmes difficiles au sein de ChatGPT. Les équipes de codage qui comparent les sièges Codex aux dépenses brutes de l'API doivent noter qu'ultra est livré avec Codex à partir de Plus ; la ventilation des prix de Codex explique comment ces sièges se comparent au paiement par token.
Des stratégies pour réduire la facture
La grille tarifaire récompense la discipline de routage plus que le prompt golf. Les stratégies qui font bouger les chiffres :
- Routez par tâche, pas par habitude. Luna pour la classification, l'extraction et le routage ; Terra par défaut pour tout le reste ; Sol uniquement pour les problèmes où Terra échoue manifestement. La plupart des équipes constatent que la part digne de Sol est faible.
- Épinglez les ID de modèle complets. Bannissez l'alias simple
gpt-5.6lors de la révision de code. Chaque chaîne de modèle dans votre base de code devrait indiquer le niveau choisi et pourquoi. - Mettez en cache les préfixes longs. Tout préfixe stable de plus de quelques milliers de tokens qui se répète dans les 30 minutes devrait être mis en cache avec un point d'arrêt explicite. Le calcul ci-dessus indique que cela est rentable dès la deuxième requête.
- Réduisez l'effort d'un niveau. Comparez l'effort actuel à un niveau inférieur avant de livrer. C'est le propre conseil d'OpenAI, et c'est de l'argent gratuit si la qualité est maintenue.
- Laissez les réponses courtes rester courtes. GPT-5.6 écrit des réponses nettement plus courtes avec moins d'introductions génériques que les générations précédentes. Supprimez les formules "soyez concis" des anciens prompts ; les instructions redondantes ajoutent des tokens d'entrée pour résoudre un problème qui n'existe plus.
- Mesurez avant de vous engager. Enregistrez
gpt-5.6-sol,gpt-5.6-terraetgpt-5.6-lunacomme variables d'environnement dans Apidog, envoyez la même requête à chaque niveau, et lisez les champs d'utilisation des tokens dans les réponses côte à côte. Les chiffres réels de vos propres prompts l'emportent sur toute estimation de cet article, y compris les tableaux ci-dessus.
FAQ
GPT-5.6 est-il moins cher que GPT-5.5 ?
Le point de comparaison est Terra, qu'OpenAI positionne comme compétitif par rapport à GPT-5.5 à environ 2x moins cher, à 2,50 $ d'entrée et 15 $ de sortie par million de tokens. Sol coûte plus cher que Terra mais offre un raisonnement plus profond. Effectuez vos propres évaluations avant de migrer des charges de travail sensibles à la qualité, mais sur le seul prix, Terra réduit de moitié la grille tarifaire de GPT-5.5.
Combien coûte l'ID de modèle simple gpt-5.6 ?
L'alias gpt-5.6 redirige vers Sol, vous payez donc les tarifs les plus élevés : 5 $ par million de tokens d'entrée et 30 $ par million de tokens de sortie. Ce défaut piège les équipes qui copient les codes de démarrage rapide sans les modifier. Épinglez explicitement gpt-5.6-terra ou gpt-5.6-luna lorsque la tâche n'a pas besoin d'un raisonnement phare.
Les tokens de raisonnement sont-ils comptés dans le prix de sortie ?
Oui. Des réglages d'effort plus élevés génèrent plus de tokens côté sortie, facturés au taux de sortie, qui est de 30 $ par million sur Sol et de 6 $ sur Luna. Le réglage de l'effort est l'un des plus grands leviers de coût dans GPT-5.6, alors évaluez votre charge de travail au niveau actuel et à un niveau inférieur avant de la figer.
Quelle est la manière la moins chère de commencer à tester GPT-5.6 ?
Dirigez vos premières requêtes vers gpt-5.6-luna : une requête de 10 000 tokens d'entrée et 1 000 tokens de sortie coûte environ 0,016 $, donc un après-midi complet d'expérimentation coûtera bien moins d'un dollar. Notre guide d'utilisation de l'API GPT-5.6 vous explique pas à pas l'authentification, la forme d'appel de l'API Responses et la sélection des niveaux.
Où cela vous mène
Faites de Terra votre valeur par défaut, dirigez les travaux de volume vers Luna et réservez Sol pour les problèmes qui justifient 30 $ par million de tokens de sortie. Ajoutez une mise en cache explicite à tout préfixe qui se répète dans les 30 minutes, et testez un niveau d'effort inférieur à celui où vous travaillez aujourd'hui. Ces quatre actions réduisent régulièrement une facture GPT-5.6 de plus de moitié sans affecter la qualité.
Avant que tout cela n'atteigne la production, obtenez des chiffres réels à partir de vos propres prompts. Téléchargez Apidog, enregistrez les trois ID de modèle comme variables d'environnement, envoyez la même requête via chaque niveau et comparez les champs d'utilisation des tokens dans les réponses. Dix minutes de tests côte à côte vous en diront plus sur votre facture que n'importe quelle grille tarifaire, y compris celle-ci.
