Si vous avez migré une charge de travail d'agent vers GPT-6 Astra début septembre, vous avez maintenant trois semaines de factures et vous connaissez déjà l'ampleur du problème. Astra facture 10 $ par million de jetons d'entrée et 50 $ par million de jetons de sortie. Une boucle longue avec un prompt système volumineux et un schéma d'outil attaché consomme cela plus rapidement que n'importe quelle prédiction de feuille de calcul.
Le 22 septembre, OpenAI a lancé GPT-6 Sol à 2 $ et 10 $. Même famille de modèles, même surface d'API, un cinquième du prix sur chaque ligne de la facture.
C'est la migration. Ce qui change dans votre code ? Presque rien. Ce qui change dans votre facture ? Tout. Et la partie que la plupart des couvertures du jour du lancement ont ignorée : OpenAI affirme toujours qu'Astra est le meilleur modèle, et la comparaison directe publiée entre les deux n'est pas ce qu'elle semble être.
TL;DR
gpt-6-astraversgpt-6-solest un simple remplacement de chaîne de modèle pour la plupart des appelants. Fenêtre de contexte, sortie maximale, points d'extrémité, outils intégrés, fonctionnalités prises en charge et niveaux de limite de débit sont identiques.- Chaque tarif est divisé par 5 exactement : entrée de 10 $ à 2 $, entrée mise en cache de 1 $ à 0,20 $, écritures en cache de 12,50 $ à 2,50 $, sortie de 50 $ à 10 $. Votre facture est divisée par cinq quelle que soit la composition des jetons.
- Sol ajoute un niveau d'effort de raisonnement
none. Il restreint également l'appel de fonction des complétions de chat àreasoning_effort: "none", le seul changement qui peut casser une intégration fonctionnelle. - La date de coupure des connaissances de Sol est le 20 avril 2026. Celle d'Astra est le 30 avril 2026.
- OpenAI affirme qu'Astra « continue d'être notre meilleur modèle, toutes catégories confondues ». Le benchmark Sol contre Astra publié exécute Astra à
lowcontre Sol àxhigh, il mesure donc l'efficacité des coûts, et non le plafond de capacité.
Le tableau des prix
Les deux ensembles de tarifs proviennent des pages des modèles d'OpenAI, gpt-6-astra et gpt-6-sol, consultées le 23 septembre 2026.
| Métrique, par 1M de jetons | GPT-6 Astra | GPT-6 Sol | Changement |
|---|---|---|---|
| Entrée | $10 | $2 | 5x moins cher |
| Entrée mise en cache | $1 | $0.20 | 5x moins cher |
| Écritures en cache | $12.50 | $2.50 | 5x moins cher |
| Sortie | $50 | $10 | 5x moins cher |
Les modificateurs de facturation correspondent sur les deux modèles. Les prompts de plus de 272K jetons d'entrée sont facturés 2x les tarifs d'entrée et de cache et 1,5x la sortie pour l'ensemble de la requête. Batch et Flex sont à moitié prix. Le mode rapide est au double, et sur Astra, il n'y a pas de SLA de latence.

Parce que les quatre tarifs baissent du même facteur, vous n'avez pas besoin de modéliser votre mélange de jetons pour prédire les économies. Prenons une charge de travail d'agent concrète : 10 000 requêtes par jour, chacune avec un préfixe mis en cache de 30 000 jetons, 10 000 jetons d'entrée fraîche et 3 000 jetons de sortie.
| Composant | Jetons quotidiens | Astra | Sol |
|---|---|---|---|
| Entrée mise en cache | 300M | $300 | $60 |
| Entrée fraîche | 100M | $1,000 | $200 |
| Sortie | 30M | $1,500 | $300 |
| Total | $2,800 | $560 |
Déplacez le mélange vers la sortie, déplacez-le vers le cache, exécutez-le avec un contexte de 272K et payez le multiplicateur de prompt long : le ratio reste à cinq.
Pour situer l'importance de cela, OpenAI a rapporté que son propre chercheur médian dépense plus de 600 $ par jour en agents de codage, le 90e percentile étant à 7 000 $ par jour. Divisez ces montants par cinq et le nombre d'expériences qu'une équipe peut se permettre change. Le contexte plus large des deux lancements se trouve dans notre analyse de la guerre des prix des modèles de septembre 2026.
Une précision à garder à l'esprit : OpenAI décrit Sol comme 50 % moins cher que GPT-5.6, et la comparaison se fait par rapport aux tarifs promotionnels de GPT-5.6, selon les propres termes d'OpenAI. Par rapport aux tarifs de base de GPT-5.6 que nous avons documentés à l'époque dans notre article sur la tarification de GPT-5.6, la réduction est plus importante. Contre Astra, c'est un facteur 5 direct.
Ce qui reste exactement le même
C'est la section qui rend la migration peu coûteuse.
| GPT-6 Astra | GPT-6 Sol | |
|---|---|---|
| ID du modèle | gpt-6-astra |
gpt-6-sol |
| Fenêtre de contexte | 1,050,000 | 1,050,000 |
| Jetons d'entrée max. | 922,000 | 922,000 |
| Jetons de sortie max. | 128,000 | 128,000 |
| Modalités | texte, image en entrée ; texte en sortie | texte, image en entrée ; texte en sortie |
| Points d'extrémité (Endpoints) | Chat Completions, Responses, Batch | Chat Completions, Responses, Batch |
| Non pris en charge | temps réel, Assistants, affinage, embeddings, audio | identique |
| Outils intégrés | recherche web, recherche de fichiers, génération d'images, interpréteur de code, shell hébergé, application de patchs, compétences, utilisation d'ordinateur, MCP, recherche d'outils | liste identique |
| Fonctionnalités | streaming, sorties structurées, appel de fonction, recherche de fichiers, entrée d'images, recherche web, mise en cache de prompts | liste identique |
| Limites de débit de niveau 5 | 15,000 RPM, 40M TPM | 15,000 RPM, 40M TPM |
| Instantanés | gpt-6-astra |
gpt-6-sol |
La fenêtre de contexte est le point central. Sol n'est pas un modèle à contexte plus court : il conserve la même fenêtre de 1 050 000 jetons et le même plafond d'entrée de 922 000 jetons qu'Astra. Rien concernant votre découpage, votre budget de récupération ou votre stratégie de compaction n'a besoin de changer.
Ce qui change réellement dans votre code
Quatre choses, dans l'ordre où elles sont susceptibles de poser problème.
- 1. Appel de fonction des complétions de chat. Sur Astra, les complétions de chat fonctionnent et l'appel d'outil nécessite l'API Responses. Sur Sol, les complétions de chat ne prennent en charge l'appel de fonction que lorsque
reasoning_effortest"none". Si vous appelez des outils via les complétions de chat avec un autre effort, cette requête cesse de fonctionner comme elle le faisait. Le guide GPT-6 d'OpenAI indique d'utiliser Responses pour le raisonnement avec des outils. Si vous utilisez déjà Responses, cela ne vous coûte rien. - 2. Le niveau d'effort
none. Astra prend en charge delowàmax. Sol prend en charge tous ceux-ci plusnone, qui est le levier qui le rend viable pour les tâches de classification et d'extraction où les jetons de raisonnement sont de la pure surcharge. Le défaut sur les deux estmedium. - 3. Date de coupure des connaissances. Astra est entraîné jusqu'au 30 avril 2026, Sol jusqu'au 20 avril 2026. Dix jours, c'est peu, mais si un prompt suppose des connaissances de fin avril, testez cette hypothèse.
- 4. Paramètres non pris en charge. Chaque fois que l'effort de raisonnement n'est pas
none,temperature,top_pettop_logprobsdoivent être absents, et les complétions de chat suppriment égalementlogprobs. Astra applique la même règle, donc une intégration Astra propre est déjà conforme. Cela n'importe que si vous passez àreasoning_effort: "none"sur Sol et envisagez de remettretemperature.
Voici l'avant et l'après pour un appel Responses typique. La différence est d'une seule ligne.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
- model="gpt-6-astra",
+ model="gpt-6-sol",
reasoning={"effort": "xhigh"},
tools=[{"type": "function", "name": "run_api_test", "parameters": {...}}],
input=[
{"role": "developer", "content": "You are a senior API engineer. Bias towards action."},
{"role": "user", "content": "Read this OpenAPI operation and propose three negative test cases."},
],
)
Notez le niveau d'effort dans cet exemple. Migrer vers Sol en gardant le même effort n'est pas la migration intéressante. Migrer vers Sol et **augmenter** l'effort l'est, car vous avez cinq fois le budget à dépenser en jetons de raisonnement pour le même prix.
Ce à quoi vous renoncez
Soyez honnête sur ce point, car les chiffres de lancement sont faciles à mal interpréter.
OpenAI affirme qu'Astra est toujours le meilleur modèle. L'article de lancement déclare qu'Astra « continue d'être notre meilleur modèle, toutes catégories confondues ». C'est la propre formulation du vendeur concernant sa nouvelle version, et c'est la phrase à citer à quiconque vous dit que Sol remplace Astra.
La comparaison directe publiée n'est pas une comparaison de capacités. Sur AutomationBench 1.0.6, Sol à xhigh obtient 33,2 % à 0,27 $ par tâche, et Astra à low obtient 30,3 % à 3,9 fois le coût par tâche de Sol. Lisez les niveaux d'effort. Sol est réglé au maximum, Astra au minimum. Ce que ce jumelage démontre, c'est que le plafond de Sol dépasse le plancher d'Astra à environ un quart du coût par tâche, ce qui est un résultat réel et utile. Cela ne dit rien sur Sol à xhigh contre Astra à max. Aucun chiffre publié ne couvre cette confrontation. Si votre charge de travail est telle qu'Astra à fort effort a finalement permis de la faire fonctionner, Sol est un test, pas un remplacement.
Latence à l'extrémité supérieure. Artificial Analysis a mesuré la variante à raisonnement maximal de GPT-6 Sol à 115,2 jetons de sortie par seconde avec un temps de première jeton de 102,15 secondes. Ce chiffre provient d'un tiers, et non d'OpenAI, et il décrit spécifiquement la variante max, donc il ne vous dit pas ce que font medium ou none. Considérez cela comme un avertissement que le modèle bon marché n'est pas automatiquement le modèle rapide à fort effort, et mesurez votre propre niveau d'effort plutôt que d'hériter du chiffre.
Disponibilité. Sol est disponible pour ChatGPT Work et Codex pour les utilisateurs Plus, Pro, Business, Enterprise et Edu, et n'est pas encore dans le Chat. L'API est prête ; la surface de Chat ne l'est pas.
Quant à ce qu'Astra apporte pour justifier de le conserver quelque part dans la pile, notre test pratique de deux jours, l'article sur l'utilisation de l'ordinateur et l'explicatif sur le seuil cyber critique sont tous valables, et la fiche technique complète se trouve dans notre guide API GPT-6 Astra.
Décidez avec vos propres requêtes, pas avec des benchmarks
AutomationBench n'exécute pas vos prompts. La seule comparaison qui règle une migration est le même ensemble de requêtes, envoyé aux deux ID de modèle, et évalué selon vos propres critères. Configurez cela une fois et cela se rentabilisera à chaque lancement futur. Dans Apidog, placez l'ID du modèle dans une variable d'environnement, enregistrez la requête une fois, et changez d'environnement pour la recibler :
{
"model": "{{MODEL_ID}}",
"reasoning": { "effort": "xhigh" },
"input": [
{ "role": "user", "content": "{{TEST_PROMPT}}" }
]
}
Créez un scénario de test à partir de 20 ou 30 prompts de production réels, ajoutez des assertions pour la forme de réponse dont votre parseur dépend (output_text présent, arguments d'appel d'outil valides par rapport à votre schéma JSON, pas de troncature à max_output_tokens), puis exécutez-le deux fois, une fois par environnement. Apidog enregistre le corps et le temps écoulé pour chaque requête, de sorte que vous obtenez la correction et la latence côte à côte sans écrire de harnais. Le bloc usage sur chaque réponse vous donne le nombre de jetons pour évaluer correctement la comparaison.
Deux assertions méritent d'être ajoutées spécifiquement pour cette migration : vérifiez que les appels d'outils arrivent toujours si vous utilisiez les Chat Completions, et jugez sur votre prompt le plus lent plutôt que sur votre prompt moyen, car le risque de latence se situe à fort effort sur les longues entrées.
Liste de contrôle de la migration
- Confirmez que vous utilisez l'API Responses partout où vous appelez des outils. Si vous appelez des outils via les Chat Completions, migrez avant de changer de modèle.
- Remplacez
gpt-6-astrapargpt-6-solet ne touchez à rien d'autre pour la première exécution. - Réexécutez votre série de régressions contre les deux IDs et comparez les sorties, pas seulement les codes de statut.
- Essayez d'augmenter d'un cran l'effort de raisonnement sur Sol. Vous avez le budget pour cela maintenant.
- Vérifiez à nouveau tout prompt qui dépend de connaissances de fin avril 2026.
- Gardez un chemin Astra derrière un drapeau pour les tâches où le plafond de performance était ce que vous payiez.
Le mot de la fin
D'Astra à Sol est la rare migration où la surface de l'API ne bouge pas, la fenêtre de contexte ne diminue pas, et le prix baisse d'un facteur fixe sur chaque mesure. Le travail n'est pas dans le code. Il est dans la vingtaine de prompts que vous exécutez sur les deux modèles pour savoir si votre tâche la plus difficile utilisait la marge d'Astra ou si vous la payiez simplement.
Effectuez cette comparaison avant de basculer le drapeau, et gardez à l'esprit la propre phrase d'OpenAI en lisant les résultats : Astra est toujours leur meilleur modèle. Sol est celui que vous pouvez vous permettre de laisser tourner.
