GPT-6 Astra pour développeurs : API, tarification, contexte 1M et migration depuis GPT-5.6 Sol

Guide de l'API GPT-6 Astra : ID du modèle gpt-6-astra, tarification à 10 $/50 $ avec un contexte long, tarifs des modes Batch et Fast, 1,05 million de jetons de contexte, cinq niveaux d'effort, et les changements majeurs par rapport à GPT-5.6 Sol.

Medy Evrard

5 September 2026

GPT-6 Astra pour développeurs : API, tarification, contexte 1M et migration depuis GPT-5.6 Sol

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

OpenAI a lancé GPT-6 Astra le 3 septembre 2026, d'abord à un ensemble limité d'organisations, puis, les jours suivants, à tous les utilisateurs de ChatGPT Plus, Pro, Business et Enterprise, à l'API OpenAI, à Microsoft Azure et à AWS Bedrock. L'ID du modèle est gpt-6-astra, il dispose d'une fenêtre contextuelle de 1 050 000 jetons, et OpenAI le qualifie de "meilleur modèle pour l'ingénierie logicielle à ce jour". C'est aussi le premier modèle qu'OpenAI a classé comme Critique pour ses capacités de cybersécurité, ce qui influence son comportement dans l'API.

Ceci est le guide pratique. Il couvre l'ID du modèle et les points d'accès, votre première requête, les cinq niveaux d'effort de raisonnement, le tableau complet des prix incluant les tarifs pour les contextes longs et le mode Rapide, les changements qui rompent une intégration de GPT-5.6 Sol, et si le prix 2,5 fois plus élevé que le tarif promotionnel de Sol en vaut la peine. La page du modèle OpenAI est la source de référence pour les chiffres ci-dessous. Pour une expérience d'utilisation, lisez notre prise en main de deux jours ; cet article se concentre sur l'API.

En bref

GPT-6 Astra en un coup d'œil

Élément Valeur
ID du modèle gpt-6-astra
Fenêtre contextuelle 1 050 000 jetons
Sortie maximale 128 000 jetons
Coupure des connaissances 30 avril 2026
Modalités Entrée : texte, image. Sortie : texte
Points d'accès Chat Completions, Responses, Batch
Non supporté Temps réel, Assistants, fine-tuning
Fonctionnalités Streaming, sorties structurées, appel de fonction, recherche de fichiers, recherche web, mise en cache de prompts, entrée d'images
Outils intégrés Utilisation d'ordinateur, recherche web, recherche de fichiers, interpréteur de code, génération d'images
Effort de raisonnement low, medium, high, xhigh, max
Limites de débit (Tier 5) 15 000 RPM, 40 000 000 TPM
Également disponible sur Microsoft Azure, AWS Bedrock ; OpenRouter sous openai/gpt-6-astra
Gestion des données Rétention de données nulle pour les clients API éligibles

Les espaces de travail d'entreprise ont Astra désactivé par défaut ; un administrateur doit l'activer. Sur ChatGPT, l'utilisation d'Astra est décomptée de l'allocation d'abonnement existante, et les forfaits Pro, Business et Enterprise reçoivent également GPT-6 Astra Pro.

Votre première requête

L'API Responses est l'interface principale, et elle est requise pour les outils. Un appel Python minimal :

from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "medium"},
    input=[
        {"role": "developer", "content": "You are a senior API engineer. Bias towards action. Ask only when the answer would change the result."},
        {"role": "user", "content": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."},
    ],
)

print(response.output_text)
print(response.usage)

La même requête en curl :

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "reasoning": {"effort": "medium"},
    "input": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."
  }'

Chat Completions fonctionne toujours pour le texte brut : échangez le point d'accès et la forme du message, et supprimez tous les champs temperature ou top_p, que les directives d'OpenAI recommandent de retirer. Dès que vous avez besoin d'appels de fonction ou d'un outil intégré, passez à Responses. Notre guide de l'API Responses couvre en profondeur la forme de la requête.

Le message du développeur est plus important qu'avant. Les directives du modèle d'OpenAI indiquent qu'Astra "demande des éclaircissements plus facilement" que ses prédécesseurs et recommandent de lui dire de privilégier l'action. Il est également "plus sensible aux instructions contenues dans les compétences" et autres fichiers attachés, alors précisez que les instructions de l'utilisateur l'emportent en cas de conflit. Et il utilise par défaut des listes et des tableaux ; si vous voulez de la prose, demandez-le.

Effort de raisonnement : cinq niveaux, pas de « none »

GPT-5.6 exposait six niveaux d'effort, de none à max. Astra en expose cinq : low, medium, high, xhigh et max. Le conseil de migration d'OpenAI est direct : si vous utilisez none ou minimal aujourd'hui, passez à low et évaluez. Tout le reste conserve son réglage actuel.

Cette suppression modifie la partie la moins chère de votre charge de travail. Luna à none était l'option de complétion classique rapide de la famille GPT-5.6, et il n'y a pas d'équivalent Astra. Astra est un modèle de raisonnement à chaque réglage, c'est pourquoi acheminer le travail mécanique vers GPT-5.6 Terra ou Luna et réserver Astra pour les appels difficiles reste la méthode saine.

À l'autre extrémité, max est le niveau où les benchmarks de lancement ont été exécutés ("les scores d'évaluation sont le maximum à tout effort") et où Artificial Analysis a mesuré un temps jusqu'au premier jeton supérieur à sept minutes lors de son exécution à effort maximal. Prévoyez un budget pour la latence avant de prévoir un budget pour les jetons.

Ce que coûte GPT-6 Astra

Par million de jetons, d'après la page de tarification d'OpenAI :

Niveau Entrée Entrée en cache Sortie
Standard 10,00 $ 1,00 $ 50,00 $
Standard, contexte long (plus de 272K jetons d'entrée) 20,00 $ 2,00 $ 75,00 $
Batch / Flex 5,00 $ 0,50 $ 25,00 $
Batch, contexte long 10,00 $ 1,00 $ 37,50 $
Mode rapide 20,00 $ 2,00 $ 100,00 $
Mode rapide, contexte long 40,00 $ 4,00 $ 150,00 $

Les écritures en cache sont facturées 12,50 $ par million. Le mode rapide offre "jusqu'à 2 fois la vitesse de traitement standard pour 2 fois le prix standard".

À titre de comparaison, la famille GPT-5.6 actuelle :

Modèle Entrée Entrée en cache Sortie
GPT-5.6 Sol (promo jusqu'au 21 nov. 2026 au moins) 4,00 $ 0,40 $ 20,00 $
GPT-5.6 Terra 2,00 $ 0,20 $ 12,00 $
GPT-5.6 Luna 0,20 $ 0,02 $ 1,20 $

Le prix catalogue de Sol est de 5 $ et 30 $ ; le tarif de 4 $ et 20 $ est en vigueur depuis le 21 août et OpenAI indique qu'il le restera au moins jusqu'au 21 novembre. Comparé à cela, Astra est 2,5 fois plus cher en entrée et 2,5 fois plus cher en sortie. Par rapport au prix catalogue de Sol, il est de 2x et 1,67x.

Un exemple concret. Une exécution d'agent qui lit une fois un instantané de code de 200 000 jetons, le réutilise comme préfixe mis en cache sur 30 appels, et écrit 60 000 jetons de sortie au total :

Le ratio se maintient à 2,5x. Ce qu'OpenAI avance, et ce que vous devriez mesurer, c'est qu'Astra termine en moins d'appels et moins de jetons de sortie. Sur Terminal-Bench 4.0, il revendique un coût par tâche environ 9 % inférieur à Sol malgré le taux plus élevé, et environ 65 % moins de jetons de sortie que Claude Opus 5 sur Agents' Last Exam. Si ces chiffres tiennent pour votre charge de travail, la facture par tâche peut être équivalente. Sinon, vous payez 2,5x.

Deux leviers permettent de réduire la facture. Le seuil de 272K est celui à surveiller : une requête qui le dépasse double les taux d'entrée et de cache, alors réduisez les sorties d'outils et mettez en cache le préfixe statique. Et Batch divise tout par deux pour le travail qui peut attendre.

Migration depuis GPT-5.6 Sol : ce qui ne fonctionne plus

OpenAI a publié une courte liste, et il est important de la prendre au pied de la lettre.

  1. Les paramètres d'échantillonnage ont disparu. Supprimez temperature, top_p et top_logprobs. Sur Chat Completions, supprimez également logprobs ; sur Responses, supprimez message.output_text.logprobs de include. Les directives d'OpenAI sont de les supprimer plutôt que de compter sur le fait que l'API les ignore, alors faites une recherche dans votre code client.
  2. Le niveau d'effort minimum est low. Tout réglage none ou minimal passe à low.
  3. La rétention du cache a changé de forme. Remplacez prompt_cache_retention par prompt_cache_options.ttl défini sur "30m". Le mode de mise en cache explicite que vous avez configuré pour GPT-5.6 est transféré sinon.
  4. Les outils nécessitent Responses. Chat Completions est pris en charge pour le texte, mais l'appel de fonction et les outils intégrés résident sur l'API Responses.
  5. Les prompts veulent moins de précautions de votre part et plus de sa part. Ajoutez la ligne "bias-towards-action" (privilégier l'action), déclarez que les instructions de l'utilisateur priment sur les fichiers de compétences, et demandez de la prose là où votre interface utilisateur s'attend à de la prose.

Rien dans la liste ne touche aux sorties structurées ou aux définitions de fonctions, donc un schéma qui fonctionnait sur Sol fonctionne sur Astra. Le changement de comportement que la plupart des équipes remarquent en premier est l'interrogation : une requête Sol qui s'exécutait jusqu'au bout peut maintenant s'arrêter avec une question de clarification. Répondez-y dans le message du développeur en amont et il cessera de poser des questions.

Vaut-il 2,5 fois le prix de Sol ?

Pour le travail d'agent et de contexte long, les chiffres de lancement disent oui. Tous les chiffres ci-dessous sont ceux d'OpenAI, au meilleur effort pour chaque modèle :

Benchmark GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1
Terminal-Bench 4.0 57.9% 37.3% 55.8%
DeepSWE v1.1 74.1% 72.7% 67.4%
FrontierCode 1.1 Extended 64.5% 60.6% 63.6%
Tâches internes de migration de base de données 63.9% 42.7% 57.8%
OSWorld 2.0 72.6% 65.7% -
MRCR v2 8-aiguilles, 512K à 1M 96.3% 73.8% -
GPQA Diamond 96.0% 94.6% 93.7%
Examen final de l'humanité (avec outils) 57.2% - 65.0%

Les écarts de Terminal-Bench et de migration de base de données sont ceux qui importent pour les développeurs : 20 points de plus que Sol sur le travail de terminal agentique, et un score de récupération de contexte long qui rend la fenêtre de 1M utilisable au lieu d'être nominale. L'écart de DeepSWE est faible, et Claude Fable 5.1 domine toujours l'Examen final de l'humanité de près de huit points, ce n'est donc pas une victoire totale. Sur l'indice indépendant d'Artificial Analysis, Astra se classe deuxième parmi 202 modèles. Notre analyse des benchmarks de Fable 5.1 présente l'autre côté de cette comparaison.

Là où Sol conserve son utilité : les appels courts et à grand volume où le niveau d'effort minimum et le taux 2,5x dominent, et tout ce qui nécessite une latence de type none. Là où Astra le mérite : les longues exécutions d'agents, le contexte de référentiel entier, l'utilisation d'ordinateurs, et toute tâche où le mode d'échec de Sol était la dérive ou l'abandon.

Testez le changement avant de le déployer

La migration est suffisamment simple pour être réalisée en une après-midi et suffisamment importante pour être mesurée. Dans Apidog, conservez l'ID du modèle comme variable d'environnement afin que la même requête enregistrée s'exécute avec gpt-5.6-sol et gpt-6-astra avec un seul interrupteur. Ajoutez des assertions sur usage.input_tokens, usage.output_tokens, et le nombre de jetons mis en cache, puis envoyez un ensemble de tâches représentatif via les deux et comparez les totaux ; c'est la question du 2,5x répondue avec votre propre trafic au lieu d'un tableau de lancement.

Deux vérifications supplémentaires appartiennent au même projet. Envoyez une requête qui contient toujours temperature et enregistrez ce qui est renvoyé, afin d'apprendre le comportement lors d'un test plutôt qu'en production. Et assurez-vous qu'une longue requête reste en dessous de 272K jetons d'entrée, car le dépassement de cette ligne double silencieusement le tarif. Planifiez l'ensemble comme une régression et Téléchargez Apidog si vous ne l'avez pas encore ; le guide API de GPT-5.6 montre la même configuration sur la génération précédente.

FAQ

Quel est l'ID du modèle GPT-6 Astra ? gpt-6-astra, avec un seul instantané. Il est également exposé via Azure et AWS Bedrock, et sur OpenRouter sous openai/gpt-6-astra.

GPT-6 Astra prend-il en charge le fine-tuning ou l'API Realtime ? Non. La page du modèle liste Chat Completions, Responses et Batch comme pris en charge, avec Realtime, Assistants et fine-tuning non pris en charge.

Quelle est la fenêtre contextuelle et la sortie maximale ? 1 050 000 jetons d'entrée et 128 000 jetons de sortie. Les prompts dépassant 272K jetons d'entrée sont facturés au tarif de contexte long.

Pourquoi ma requête a-t-elle échoué après être passée de Sol ? Très probablement un temperature ou top_p résiduel, un niveau d'effort none, ou prompt_cache_retention. Astra a supprimé les trois ; voir la liste de migration ci-dessus.

Une requête peut-elle s'arrêter d'elle-même ? Oui. OpenAI exécute un moniteur de désalignement sur les requêtes utilisant des outils, et dans l'API, une tâche signalée s'arrête au lieu de se mettre en pause pour examen. Les longues exécutions d'agents sont les plus exposées, alors rendez-les re-exécutables. L'article sur le seuil cyber critique explique les garde-fous derrière ce comportement.

Ce qu'il faut faire cette semaine

Déplacez une charge de travail d'agent vers gpt-6-astra sur l'API Responses, supprimez les paramètres d'échantillonnage, définissez l'effort sur medium, et mesurez les jetons et le temps réel par rapport à Sol sur les mêmes entrées. Si le coût par tâche est égal ou meilleur, migrez le reste. Sinon, vous aurez un chiffre, ce qui est plus que ce que la plupart des équipes auront d'ici vendredi.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API