OpenAI a lancé GPT-6 Astra le 3 septembre 2026, d'abord à un ensemble limité d'organisations, puis, les jours suivants, à tous les utilisateurs de ChatGPT Plus, Pro, Business et Enterprise, à l'API OpenAI, à Microsoft Azure et à AWS Bedrock. L'ID du modèle est gpt-6-astra, il dispose d'une fenêtre contextuelle de 1 050 000 jetons, et OpenAI le qualifie de "meilleur modèle pour l'ingénierie logicielle à ce jour". C'est aussi le premier modèle qu'OpenAI a classé comme Critique pour ses capacités de cybersécurité, ce qui influence son comportement dans l'API.
Ceci est le guide pratique. Il couvre l'ID du modèle et les points d'accès, votre première requête, les cinq niveaux d'effort de raisonnement, le tableau complet des prix incluant les tarifs pour les contextes longs et le mode Rapide, les changements qui rompent une intégration de GPT-5.6 Sol, et si le prix 2,5 fois plus élevé que le tarif promotionnel de Sol en vaut la peine. La page du modèle OpenAI est la source de référence pour les chiffres ci-dessous. Pour une expérience d'utilisation, lisez notre prise en main de deux jours ; cet article se concentre sur l'API.
En bref
- ID du modèle
gpt-6-astra, un seul instantané. Chat Completions, Responses et Batch. Pas de temps réel, pas d'Assistants, pas de fine-tuning. L'appel d'outils nécessite l'API Responses. - Contexte de 1 050 000 jetons, 128 000 jetons de sortie max, date de coupure des connaissances le 30 avril 2026. Entrée texte et image, sortie texte.
- Tarification standard : 10 $ en entrée, 1 $ pour la lecture en cache, 12,50 $ pour l'écriture en cache, 50 $ en sortie par million de jetons. Les requêtes de plus de 272K jetons en entrée sont facturées 20 $ / 2 $ / 75 $. Batch et Flex sont à moitié prix. Le mode Rapide est double.
- Effort de raisonnement :
low,medium,high,xhigh,max.noneetminimalont disparu. - Changements par rapport à Sol :
temperature,top_petlogprobssont supprimés ;prompt_cache_retentiondevientprompt_cache_options.ttl. - GPT-5.6 Sol est à 4 $ / 20 $ en promotion au moins jusqu'au 21 novembre 2026, donc Astra coûte 2,5 fois plus cher des deux côtés.
GPT-6 Astra en un coup d'œil
| Élément | Valeur |
|---|---|
| ID du modèle | gpt-6-astra |
| Fenêtre contextuelle | 1 050 000 jetons |
| Sortie maximale | 128 000 jetons |
| Coupure des connaissances | 30 avril 2026 |
| Modalités | Entrée : texte, image. Sortie : texte |
| Points d'accès | Chat Completions, Responses, Batch |
| Non supporté | Temps réel, Assistants, fine-tuning |
| Fonctionnalités | Streaming, sorties structurées, appel de fonction, recherche de fichiers, recherche web, mise en cache de prompts, entrée d'images |
| Outils intégrés | Utilisation d'ordinateur, recherche web, recherche de fichiers, interpréteur de code, génération d'images |
| Effort de raisonnement | low, medium, high, xhigh, max |
| Limites de débit (Tier 5) | 15 000 RPM, 40 000 000 TPM |
| Également disponible sur | Microsoft Azure, AWS Bedrock ; OpenRouter sous openai/gpt-6-astra |
| Gestion des données | Rétention de données nulle pour les clients API éligibles |
Les espaces de travail d'entreprise ont Astra désactivé par défaut ; un administrateur doit l'activer. Sur ChatGPT, l'utilisation d'Astra est décomptée de l'allocation d'abonnement existante, et les forfaits Pro, Business et Enterprise reçoivent également GPT-6 Astra Pro.

Votre première requête
L'API Responses est l'interface principale, et elle est requise pour les outils. Un appel Python minimal :
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
reasoning={"effort": "medium"},
input=[
{"role": "developer", "content": "You are a senior API engineer. Bias towards action. Ask only when the answer would change the result."},
{"role": "user", "content": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."},
],
)
print(response.output_text)
print(response.usage)
La même requête en curl :
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."
}'
Chat Completions fonctionne toujours pour le texte brut : échangez le point d'accès et la forme du message, et supprimez tous les champs temperature ou top_p, que les directives d'OpenAI recommandent de retirer. Dès que vous avez besoin d'appels de fonction ou d'un outil intégré, passez à Responses. Notre guide de l'API Responses couvre en profondeur la forme de la requête.
Le message du développeur est plus important qu'avant. Les directives du modèle d'OpenAI indiquent qu'Astra "demande des éclaircissements plus facilement" que ses prédécesseurs et recommandent de lui dire de privilégier l'action. Il est également "plus sensible aux instructions contenues dans les compétences" et autres fichiers attachés, alors précisez que les instructions de l'utilisateur l'emportent en cas de conflit. Et il utilise par défaut des listes et des tableaux ; si vous voulez de la prose, demandez-le.
Effort de raisonnement : cinq niveaux, pas de « none »
GPT-5.6 exposait six niveaux d'effort, de none à max. Astra en expose cinq : low, medium, high, xhigh et max. Le conseil de migration d'OpenAI est direct : si vous utilisez none ou minimal aujourd'hui, passez à low et évaluez. Tout le reste conserve son réglage actuel.
Cette suppression modifie la partie la moins chère de votre charge de travail. Luna à none était l'option de complétion classique rapide de la famille GPT-5.6, et il n'y a pas d'équivalent Astra. Astra est un modèle de raisonnement à chaque réglage, c'est pourquoi acheminer le travail mécanique vers GPT-5.6 Terra ou Luna et réserver Astra pour les appels difficiles reste la méthode saine.
À l'autre extrémité, max est le niveau où les benchmarks de lancement ont été exécutés ("les scores d'évaluation sont le maximum à tout effort") et où Artificial Analysis a mesuré un temps jusqu'au premier jeton supérieur à sept minutes lors de son exécution à effort maximal. Prévoyez un budget pour la latence avant de prévoir un budget pour les jetons.
Ce que coûte GPT-6 Astra
Par million de jetons, d'après la page de tarification d'OpenAI :
| Niveau | Entrée | Entrée en cache | Sortie |
|---|---|---|---|
| Standard | 10,00 $ | 1,00 $ | 50,00 $ |
| Standard, contexte long (plus de 272K jetons d'entrée) | 20,00 $ | 2,00 $ | 75,00 $ |
| Batch / Flex | 5,00 $ | 0,50 $ | 25,00 $ |
| Batch, contexte long | 10,00 $ | 1,00 $ | 37,50 $ |
| Mode rapide | 20,00 $ | 2,00 $ | 100,00 $ |
| Mode rapide, contexte long | 40,00 $ | 4,00 $ | 150,00 $ |
Les écritures en cache sont facturées 12,50 $ par million. Le mode rapide offre "jusqu'à 2 fois la vitesse de traitement standard pour 2 fois le prix standard".
À titre de comparaison, la famille GPT-5.6 actuelle :
| Modèle | Entrée | Entrée en cache | Sortie |
|---|---|---|---|
| GPT-5.6 Sol (promo jusqu'au 21 nov. 2026 au moins) | 4,00 $ | 0,40 $ | 20,00 $ |
| GPT-5.6 Terra | 2,00 $ | 0,20 $ | 12,00 $ |
| GPT-5.6 Luna | 0,20 $ | 0,02 $ | 1,20 $ |
Le prix catalogue de Sol est de 5 $ et 30 $ ; le tarif de 4 $ et 20 $ est en vigueur depuis le 21 août et OpenAI indique qu'il le restera au moins jusqu'au 21 novembre. Comparé à cela, Astra est 2,5 fois plus cher en entrée et 2,5 fois plus cher en sortie. Par rapport au prix catalogue de Sol, il est de 2x et 1,67x.
Un exemple concret. Une exécution d'agent qui lit une fois un instantané de code de 200 000 jetons, le réutilise comme préfixe mis en cache sur 30 appels, et écrit 60 000 jetons de sortie au total :
- Astra : 2,00 $ pour la première lecture, puis 29 lectures en cache à 0,20 $ chacune (5,80 $), plus 3,00 $ de sortie. Environ 10,80 $.
- Sol en promotion : 0,80 $ pour la première lecture, 2,32 $ pour les lectures en cache, 1,20 $ de sortie. Environ 4,32 $.
Le ratio se maintient à 2,5x. Ce qu'OpenAI avance, et ce que vous devriez mesurer, c'est qu'Astra termine en moins d'appels et moins de jetons de sortie. Sur Terminal-Bench 4.0, il revendique un coût par tâche environ 9 % inférieur à Sol malgré le taux plus élevé, et environ 65 % moins de jetons de sortie que Claude Opus 5 sur Agents' Last Exam. Si ces chiffres tiennent pour votre charge de travail, la facture par tâche peut être équivalente. Sinon, vous payez 2,5x.
Deux leviers permettent de réduire la facture. Le seuil de 272K est celui à surveiller : une requête qui le dépasse double les taux d'entrée et de cache, alors réduisez les sorties d'outils et mettez en cache le préfixe statique. Et Batch divise tout par deux pour le travail qui peut attendre.
Migration depuis GPT-5.6 Sol : ce qui ne fonctionne plus
OpenAI a publié une courte liste, et il est important de la prendre au pied de la lettre.
- Les paramètres d'échantillonnage ont disparu. Supprimez
temperature,top_pettop_logprobs. Sur Chat Completions, supprimez égalementlogprobs; sur Responses, supprimezmessage.output_text.logprobsdeinclude. Les directives d'OpenAI sont de les supprimer plutôt que de compter sur le fait que l'API les ignore, alors faites une recherche dans votre code client. - Le niveau d'effort minimum est
low. Tout réglagenoneouminimalpasse àlow. - La rétention du cache a changé de forme. Remplacez
prompt_cache_retentionparprompt_cache_options.ttldéfini sur"30m". Le mode de mise en cache explicite que vous avez configuré pour GPT-5.6 est transféré sinon. - Les outils nécessitent Responses. Chat Completions est pris en charge pour le texte, mais l'appel de fonction et les outils intégrés résident sur l'API Responses.
- Les prompts veulent moins de précautions de votre part et plus de sa part. Ajoutez la ligne "bias-towards-action" (privilégier l'action), déclarez que les instructions de l'utilisateur priment sur les fichiers de compétences, et demandez de la prose là où votre interface utilisateur s'attend à de la prose.
Rien dans la liste ne touche aux sorties structurées ou aux définitions de fonctions, donc un schéma qui fonctionnait sur Sol fonctionne sur Astra. Le changement de comportement que la plupart des équipes remarquent en premier est l'interrogation : une requête Sol qui s'exécutait jusqu'au bout peut maintenant s'arrêter avec une question de clarification. Répondez-y dans le message du développeur en amont et il cessera de poser des questions.
Vaut-il 2,5 fois le prix de Sol ?
Pour le travail d'agent et de contexte long, les chiffres de lancement disent oui. Tous les chiffres ci-dessous sont ceux d'OpenAI, au meilleur effort pour chaque modèle :
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| FrontierCode 1.1 Extended | 64.5% | 60.6% | 63.6% |
| Tâches internes de migration de base de données | 63.9% | 42.7% | 57.8% |
| OSWorld 2.0 | 72.6% | 65.7% | - |
| MRCR v2 8-aiguilles, 512K à 1M | 96.3% | 73.8% | - |
| GPQA Diamond | 96.0% | 94.6% | 93.7% |
| Examen final de l'humanité (avec outils) | 57.2% | - | 65.0% |
Les écarts de Terminal-Bench et de migration de base de données sont ceux qui importent pour les développeurs : 20 points de plus que Sol sur le travail de terminal agentique, et un score de récupération de contexte long qui rend la fenêtre de 1M utilisable au lieu d'être nominale. L'écart de DeepSWE est faible, et Claude Fable 5.1 domine toujours l'Examen final de l'humanité de près de huit points, ce n'est donc pas une victoire totale. Sur l'indice indépendant d'Artificial Analysis, Astra se classe deuxième parmi 202 modèles. Notre analyse des benchmarks de Fable 5.1 présente l'autre côté de cette comparaison.
Là où Sol conserve son utilité : les appels courts et à grand volume où le niveau d'effort minimum et le taux 2,5x dominent, et tout ce qui nécessite une latence de type none. Là où Astra le mérite : les longues exécutions d'agents, le contexte de référentiel entier, l'utilisation d'ordinateurs, et toute tâche où le mode d'échec de Sol était la dérive ou l'abandon.
Testez le changement avant de le déployer
La migration est suffisamment simple pour être réalisée en une après-midi et suffisamment importante pour être mesurée. Dans Apidog, conservez l'ID du modèle comme variable d'environnement afin que la même requête enregistrée s'exécute avec gpt-5.6-sol et gpt-6-astra avec un seul interrupteur. Ajoutez des assertions sur usage.input_tokens, usage.output_tokens, et le nombre de jetons mis en cache, puis envoyez un ensemble de tâches représentatif via les deux et comparez les totaux ; c'est la question du 2,5x répondue avec votre propre trafic au lieu d'un tableau de lancement.
Deux vérifications supplémentaires appartiennent au même projet. Envoyez une requête qui contient toujours temperature et enregistrez ce qui est renvoyé, afin d'apprendre le comportement lors d'un test plutôt qu'en production. Et assurez-vous qu'une longue requête reste en dessous de 272K jetons d'entrée, car le dépassement de cette ligne double silencieusement le tarif. Planifiez l'ensemble comme une régression et Téléchargez Apidog si vous ne l'avez pas encore ; le guide API de GPT-5.6 montre la même configuration sur la génération précédente.
FAQ
Quel est l'ID du modèle GPT-6 Astra ? gpt-6-astra, avec un seul instantané. Il est également exposé via Azure et AWS Bedrock, et sur OpenRouter sous openai/gpt-6-astra.
GPT-6 Astra prend-il en charge le fine-tuning ou l'API Realtime ? Non. La page du modèle liste Chat Completions, Responses et Batch comme pris en charge, avec Realtime, Assistants et fine-tuning non pris en charge.
Quelle est la fenêtre contextuelle et la sortie maximale ? 1 050 000 jetons d'entrée et 128 000 jetons de sortie. Les prompts dépassant 272K jetons d'entrée sont facturés au tarif de contexte long.
Pourquoi ma requête a-t-elle échoué après être passée de Sol ? Très probablement un temperature ou top_p résiduel, un niveau d'effort none, ou prompt_cache_retention. Astra a supprimé les trois ; voir la liste de migration ci-dessus.
Une requête peut-elle s'arrêter d'elle-même ? Oui. OpenAI exécute un moniteur de désalignement sur les requêtes utilisant des outils, et dans l'API, une tâche signalée s'arrête au lieu de se mettre en pause pour examen. Les longues exécutions d'agents sont les plus exposées, alors rendez-les re-exécutables. L'article sur le seuil cyber critique explique les garde-fous derrière ce comportement.
Ce qu'il faut faire cette semaine
Déplacez une charge de travail d'agent vers gpt-6-astra sur l'API Responses, supprimez les paramètres d'échantillonnage, définissez l'effort sur medium, et mesurez les jetons et le temps réel par rapport à Sol sur les mêmes entrées. Si le coût par tâche est égal ou meilleur, migrez le reste. Sinon, vous aurez un chiffre, ce qui est plus que ce que la plupart des équipes auront d'ici vendredi.
