GPT-5.6 : Prix, coût de Sol, Terra et Luna, et comment réduire la facture

Explication des tarifs de GPT-5.6 : Sol 5 $/30 $, Terra 2,50 $/15 $, Luna 1 $/6 $ par million de jetons, plus les calculs de mise en cache, les coûts d'effort de raisonnement, et des moyens de réduire votre facture d'API.

Ashley Innocent

Ashley Innocent

10 July 2026

GPT-5.6 : Prix, coût de Sol, Terra et Luna, et comment réduire la facture

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

OpenAI a livré GPT-5.6 en disponibilité générale le 9 juillet 2026, et pour la première fois, une version phare de GPT est arrivée sous la forme de trois modèles avec trois prix distincts. Sol gère le raisonnement le plus difficile à 5 $ par million de tokens d'entrée et 30 $ par million de tokens de sortie. Terra se situe au milieu à 2,50 $ et 15 $. Luna couvre le travail à grand volume à 1 $ et 6 $. C'est un écart de 5x du haut vers le bas, ce qui fait du choix du modèle le plus grand levier unique sur votre facture d'API cette année.

Il y a un piège caché dans la nomenclature. L'alias simple gpt-5.6 redirige vers Sol, le niveau de raisonnement phare. Copiez un guide de démarrage rapide, laissez la chaîne de modèle telle quelle, et chaque requête de production paiera les tarifs phares pour un travail que Luna pourrait gérer à un cinquième du coût. Le défaut est le plus cher, et rien dans la réponse ne vous avertira.

Ce guide présente la grille tarifaire complète, exécute des exemples de coûts pour chaque niveau, explique le calcul de la mise en cache, comment l'effort de raisonnement et le mode ultra modifient les dépenses, et se termine par des modèles de routage qui maintiennent la facture stable sans sacrifier la qualité là où cela compte.

bouton

En bref

La grille tarifaire GPT-5.6

Voici le coût de chaque modèle par million de tokens, y compris les taux de mise en cache dérivés (lectures à 10 % du prix d'entrée, écritures à 125 %) :

Modèle Entrée / 1M Sortie / 1M Lecture d'entrée mise en cache / 1M Écriture dans le cache / 1M
gpt-5.6-sol (alias: gpt-5.6) 5,00 $ 30,00 $ 0,50 $ 6,25 $
gpt-5.6-terra 2,50 $ 15,00 $ 0,25 $ 3,13 $
gpt-5.6-luna 1,00 $ 6,00 $ 0,10 $ 1,25 $

Les identifiants de modèle sont confirmés dans la documentation développeur d'OpenAI, et l'accès à l'API est en libre-service pour tout compte API. Il n'y a pas de restriction de plan côté API ; la restriction d'aperçu de juin a pris fin avant la GA et appartient au passé.

Encore une fois, car cela frappera quelqu'un dans votre équipe : gpt-5.6 sans suffixe est Sol. Si votre configuration, votre défaut de SDK ou votre exemple copié utilise l'alias simple, vous payez les tarifs de 5 $/30 $ que la tâche en ait besoin ou non. Épinglez l'ID de modèle complet partout et rendez le choix du niveau explicite lors de la révision de code.

Ce que signifie la hiérarchisation

Le numéro est la génération ; Sol, Terra et Luna sont des niveaux de capacité durables qui évolueront à leur propre rythme. Savoir à quoi sert chaque niveau est la majeure partie de la décision de coût.

Terra est la tête d'affiche en termes de rapport qualité-prix. OpenAI le positionne comme compétitif par rapport à GPT-5.5 à environ 2x moins cher. Si vous utilisez GPT-5.5 en production aujourd'hui, Terra est le candidat de remplacement qui réduit votre grille tarifaire de moitié ; vérifiez vos dépenses actuelles par rapport à la ventilation des prix de GPT-5.5 pour évaluer l'économie avant de migrer. Considérez la revendication de qualité comme celle d'OpenAI jusqu'à ce que vos propres évaluations la confirment, mais la réduction de prix est inconditionnelle.

Luna est le niveau de volume. À 1 $/6 $, il est conçu pour la classification, l'extraction, le routage et la rédaction de première passe : le travail à haute fréquence et sensible à la latence où le coût par requête domine toutes les autres préoccupations.

Sol est destiné aux problèmes qui échouent ailleurs. Raisonnement le plus profond, taux les plus élevés. L'avis de Simon Willison le jour du lancement vaut la peine d'être lu pour le point de vue d'un praticien sur où le produit phare justifie sa prime et où il ne le fait pas.

Les trois partageraient une fenêtre de contexte de 1 million de tokens et une sortie maximale de 128 000, selon la couverture de la documentation précoce, vous ne sacrifiez donc pas la capacité lorsque vous passez à un niveau inférieur. Vous échangez la profondeur de raisonnement contre le prix.

Ce que coûtent les requêtes en pratique

Les tarifs par million sont abstraits tant que vous ne fixez pas le prix d'une requête réelle. Prenons un appel typique de type RAG : 10 000 tokens d'entrée (prompt système, contexte récupéré, question de l'utilisateur) et 1 000 tokens de sortie.

Modèle Coût d'entrée Coût de sortie Total par requête
Sol 0,050 $ 0,030 $ 0,080 $
Terra 0,025 $ 0,015 $ 0,040 $
Luna 0,010 $ 0,006 $ 0,016 $

Une requête semble bon marché partout. Le volume est l'endroit où les niveaux se séparent. Fixons le prix d'une charge de travail de classification : 1 million de requêtes par mois, 500 tokens d'entrée et 50 tokens de sortie chacun. Cela représente 500 millions de tokens d'entrée et 50 millions de tokens de sortie par mois.

Modèle Entrée Sortie Total mensuel
Luna 500 $ 300 $ 800 $
Terra 1 250 $ 750 $ 2 000 $
Sol 2 500 $ 1 500 $ 4 000 $

Exécutez cette charge de travail sur l'alias simple gpt-5.6 et vous paierez 4 000 $ par mois pour un travail que Luna effectue pour 800 $. Le défaut de l'alias est une erreur de frappe de 3 200 $ par mois, chaque mois, jusqu'à ce que quelqu'un lise la facture.

L'économie de la mise en cache, avec des calculs réels

GPT-5.6 utilise des points d'arrêt de cache explicites : vous optez pour prompt_cache_options.mode: "explicit" et un champ ttl, au lieu de vous fier à la détection automatique des préfixes. Trois chiffres régissent l'économie. Les écritures dans le cache sont facturées à 1,25x le taux d'entrée non mis en cache. Les lectures de cache conservent la réduction de 90 %. La durée de vie minimale du cache est de 30 minutes.

{
  "model": "gpt-5.6-terra",
  "input": [
    { "role": "system", "content": "You are a support triage assistant. Classify each ticket..." },
    { "role": "user", "content": "Ticket #4821: webhook retries firing twice after 502s" }
  ],
  "prompt_cache_options": { "mode": "explicit", "ttl": "30m" }
}

Maintenant, l'exemple travaillé. Supposons que vous ayez un prompt système de 5 000 tokens réutilisé sur 100 requêtes dans la fenêtre de cache, exécuté sur Sol.

C'est environ 89 % de réduction sur la partie préfixe de la facture. Le seuil de rentabilité se situe à la deuxième requête : la prime d'écriture coûte 25 % d'un passage non mis en cache, tandis que chaque lecture économise 90 % d'un passage. Un préfixe utilisé deux fois est déjà moins cher mis en cache.

Le seuil de 30 minutes fonctionne dans les deux sens. Un assistant de chat ou un pipeline de support qui déclenche des requêtes toutes les quelques minutes maintient le cache à chaud gratuitement. Un travail par lots qui s'exécute une fois par nuit ne gagne rien et paie la prime d'écriture de 1,25x à chaque démarrage à froid ; désactivez la mise en cache dans ce cas. Mettez en cache le préfixe stable (prompt système, définitions d'outils, exemples peu fréquents) et conservez la partie volatile (entrée utilisateur, documents récupérés qui changent par requête) après le point d'arrêt.

Effort de raisonnement, mode pro et ultra

GPT-5.6 expose six niveaux d'effort de raisonnement : none, low, medium, high, xhigh et max. L'effort est un réglage de coût, pas seulement un réglage de qualité. Des réglages plus élevés produisent plus de tokens de sortie par requête, et la sortie est la direction coûteuse : 30 $ par million sur Sol, cinq fois le taux d'entrée. Deux requêtes avec des prompts identiques peuvent différer de plusieurs fois en coût purement sur le réglage de l'effort.

Les propres directives de migration d'OpenAI conseillent de traiter le déménagement comme un passage d'ajustement, pas seulement un changement de nom de modèle : comparez votre niveau d'effort actuel et un niveau inférieur sur des tâches représentatives. De nombreuses charges de travail maintiennent la qualité au réglage inférieur, et l'économie se cumule à chaque requête.

Le mode Pro (reasoning.mode: "pro") est un réglage disponible sur les trois modèles, pas un modèle séparé avec sa propre ligne tarifaire. Vous payez les mêmes prix par token ; le modèle dépense plus de tokens en réflexion, alors prévoyez une sortie plus importante pour les charges de travail axées sur la qualité.

Ultra est la dépense délibérée. Il exécute quatre agents en parallèle par défaut, multipliant délibérément la dépense en tokens en échange de résultats plus rapides et d'une amélioration mesurable de la qualité : selon OpenAI, il élève le score Terminal-Bench 2.1 de Sol de 88,8 % à 91,9 %. En première approximation, prévoyez environ quatre fois les tokens d'une exécution à agent unique et réservez-le pour le travail où le temps de réponse compte plus que le coût par réponse. La ventilation complète de la rentabilité de la dépense parallèle se trouve dans notre explicateur du mode ultra de GPT-5.6. Ultra est livré dans ChatGPT Work sur les plans Pro et Entreprise, et dans Codex à partir de Plus.

Ce que les plans ChatGPT offrent

Si votre utilisation de GPT-5.6 est conversationnelle plutôt que programmatique, un abonnement peut être plus avantageux que l'API en termes de coûts. Voici comment l'accès au modèle se mappe aux plans :

Plan Accès à GPT-5.6
Gratuit / Go Terra
Plus Sol, Terra, Luna ; contrôle de l'effort par modèle (Sol à effort moyen et supérieur)
Pro / Business / Entreprise Les trois, plus Sol Pro
ChatGPT Work (Pro / Entreprise) Ajoute ultra

Le fait que les utilisateurs gratuits et Go accèdent à Terra est un excellent défaut ; c'est le niveau qu'OpenAI compare à GPT-5.5. Le plan Plus est le niveau où apparaît le contrôle de l'effort par modèle, ce qui est important si vous vous appuyez sur Sol pour les problèmes difficiles au sein de ChatGPT. Les équipes de codage qui comparent les sièges Codex aux dépenses brutes de l'API doivent noter qu'ultra est livré avec Codex à partir de Plus ; la ventilation des prix de Codex explique comment ces sièges se comparent au paiement par token.

Des stratégies pour réduire la facture

La grille tarifaire récompense la discipline de routage plus que le prompt golf. Les stratégies qui font bouger les chiffres :

FAQ

GPT-5.6 est-il moins cher que GPT-5.5 ?

Le point de comparaison est Terra, qu'OpenAI positionne comme compétitif par rapport à GPT-5.5 à environ 2x moins cher, à 2,50 $ d'entrée et 15 $ de sortie par million de tokens. Sol coûte plus cher que Terra mais offre un raisonnement plus profond. Effectuez vos propres évaluations avant de migrer des charges de travail sensibles à la qualité, mais sur le seul prix, Terra réduit de moitié la grille tarifaire de GPT-5.5.

Combien coûte l'ID de modèle simple gpt-5.6 ?

L'alias gpt-5.6 redirige vers Sol, vous payez donc les tarifs les plus élevés : 5 $ par million de tokens d'entrée et 30 $ par million de tokens de sortie. Ce défaut piège les équipes qui copient les codes de démarrage rapide sans les modifier. Épinglez explicitement gpt-5.6-terra ou gpt-5.6-luna lorsque la tâche n'a pas besoin d'un raisonnement phare.

Les tokens de raisonnement sont-ils comptés dans le prix de sortie ?

Oui. Des réglages d'effort plus élevés génèrent plus de tokens côté sortie, facturés au taux de sortie, qui est de 30 $ par million sur Sol et de 6 $ sur Luna. Le réglage de l'effort est l'un des plus grands leviers de coût dans GPT-5.6, alors évaluez votre charge de travail au niveau actuel et à un niveau inférieur avant de la figer.

Quelle est la manière la moins chère de commencer à tester GPT-5.6 ?

Dirigez vos premières requêtes vers gpt-5.6-luna : une requête de 10 000 tokens d'entrée et 1 000 tokens de sortie coûte environ 0,016 $, donc un après-midi complet d'expérimentation coûtera bien moins d'un dollar. Notre guide d'utilisation de l'API GPT-5.6 vous explique pas à pas l'authentification, la forme d'appel de l'API Responses et la sélection des niveaux.

Où cela vous mène

Faites de Terra votre valeur par défaut, dirigez les travaux de volume vers Luna et réservez Sol pour les problèmes qui justifient 30 $ par million de tokens de sortie. Ajoutez une mise en cache explicite à tout préfixe qui se répète dans les 30 minutes, et testez un niveau d'effort inférieur à celui où vous travaillez aujourd'hui. Ces quatre actions réduisent régulièrement une facture GPT-5.6 de plus de moitié sans affecter la qualité.

Avant que tout cela n'atteigne la production, obtenez des chiffres réels à partir de vos propres prompts. Téléchargez Apidog, enregistrez les trois ID de modèle comme variables d'environnement, envoyez la même requête via chaque niveau et comparez les champs d'utilisation des tokens dans les réponses. Dix minutes de tests côte à côte vous en diront plus sur votre facture que n'importe quelle grille tarifaire, y compris celle-ci.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API