La caractéristique principale de GPT-6 Astra est qu'il peut utiliser un ordinateur. Non pas au sens de 2025, où un modèle cliquait à travers une démo et se perdait ensuite dans un menu déroulant. Dans le billet de lancement d'OpenAI, Astra obtient un score de 72,6 % sur OSWorld 2.0 à environ 40 minutes par tâche, remplit des formulaires, met à jour des CRM, installe des logiciels et exécute des contrôles d'assurance qualité front-end sur un site qu'il a lui-même construit. OpenAI l'appelle « le meilleur modèle d'utilisation d'ordinateur au monde », et pour une fois, les démonstrations étayent cette affirmation.
Si vous construisez ou testez des API, cette capacité représente un raccourci tentant : dirigez Astra vers votre application et laissez-le cliquer. Cet article soutient que vous devriez faire quelque chose de moins impressionnant et de plus utile. Donnez-lui le contrat. Une spécification OpenAPI est une interface plus rapide, moins chère et plus vérifiable pour un modèle qu'un écran, et un modèle aussi capable l'utilisera bien. Nous avons vu Astra faire ce changement de lui-même lors de notre test pratique de deux jours, et le reste de cet article explique pourquoi c'était la bonne décision et comment le configurer avec Apidog.
TL;DR
L'utilisation de l'ordinateur par GPT-6 Astra est réelle : 72,6 % sur OSWorld 2.0, 92,7 % sur ScreenSpot-Pro, et un harnais Codex qui termine les tâches d'utilisation d'ordinateur 1,9 fois plus rapidement que l'expérience GPT-5.6 Sol. Mais la commande par écran coûte des dizaines de minutes et de nombreux jetons d'image par tâche, et elle teste l'interface utilisateur, pas l'API. Pour vos propres services, fournissez à Astra la spécification OpenAPI via le serveur Apidog MCP ou comme outils de fonction, laissez-le écrire les scénarios de test et exécutez-les depuis l'interface CLI d'Apidog en CI. Réservez l'utilisation de l'ordinateur pour les interfaces qui n'ont pas d'API.
Ce que l'utilisation d'ordinateur dans GPT-6 Astra peut faire
La capacité est plus large que « naviguer sur un site web ». OpenAI liste les tâches fastidieuses de travail de connaissance (formulaires en ligne, enregistrements CRM, calendriers), la recherche et la rédaction dans un éditeur de documents, l'analyse de données scientifiques avec des graphiques, la construction et l'hébergement d'un site web via ChatGPT Sites, et l'assurance qualité front-end sur ce site. Les démonstrations incluent la conception d'une carte de circuit imprimé dans KiCad et la modélisation d'une maison dans Blender.
Les chiffres des benchmarks, tous exécutés par OpenAI à partir du billet de lancement :
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (ensemble hors ligne, score partiel) | 72,6 % à ~40 min/tâche | 65,7 % à ~75 min/tâche | 70,2 % |
| ScreenSpot-Pro (sans outils) | 92,7 % | 76,9 % | - |
| Examen final des agents | 59,3 % | 53,6 % | 55,5 % |
| AutomationBench | 41,4 % | 18,1 % | 26,9 % |
Deux détails comptent plus que les scores. Astra termine les tâches OSWorld en environ 47 % moins de temps que Sol, et lors du Dernier Examen des Agents, il utilise environ 65 % moins de jetons de sortie qu'Opus 5 avec les paramètres les plus performants. Parallèlement au modèle, OpenAI a mis à jour le harnais Codex afin que l'achèvement des tâches d'utilisation d'ordinateur soit 1,9 fois plus rapide que l'expérience actuelle de Sol sur Mind2Web. Des boucles plus rapides signifient des boucles moins chères, ce qui est la partie importante pour quiconque paie par jeton.

Le comportement s'est également amélioré. Astra pose des questions ciblées uniquement lorsque la réponse modifierait le résultat, reste orienté lorsque vous le guidez en cours de tâche, et dans Codex, il peut poser des questions de manière asynchrone tout en poursuivant le travail qui ne dépend pas de votre réponse. Sur le benchmark interne de sécurité d'utilisation d'ordinateur d'OpenAI, où un score plus bas est meilleur, Astra obtient 2,4 % contre 22,0 % pour Sol.
Ce que coûte une tâche de 40 minutes
L'utilisation de l'ordinateur est une boucle : capture d'écran, raisonnement, action, nouvelle capture d'écran. Chaque capture d'écran est une entrée d'image, chaque étape transporte la conversation jusqu'à présent, et une tâche qui prend 40 minutes prend des centaines d'étapes. Au tarif standard d'Astra de 10 $ par million de jetons d'entrée et 50 $ par million de sortie, avec des invites de plus de 272 000 jetons d'entrée facturées à 20 $ par million, une longue session qui conserve tout son historique en contexte dérive vers la tarification de contexte long avant de se terminer. La mise en cache des invites aide avec le préfixe répété, à 1 $ par million de jetons mis en cache, mais les captures d'écran elles-mêmes sont nouvelles à chaque étape.
Comparez cela avec la voie contractuelle. Votre spécification OpenAPI est un préfixe, mis en cache une seule fois. Chaque test que le modèle écrit représente quelques centaines de jetons JSON. Chaque exécution de ce test est un appel HTTP qui ne coûte rien du côté du modèle, car un scénario de test, une fois écrit, n'a pas besoin d'un modèle pour l'exécuter.
Il y a un deuxième coût qui n'a rien à voir avec l'argent. L'aperçu de sécurité d'OpenAI indique que son moniteur de désalignement de production « peut parfois ralentir, suspendre ou arrêter un travail légitime », et signale « les tâches dans lesquelles un agent fonctionne pendant une période prolongée ». Dans ChatGPT ou Codex, il vous sera demandé de revoir l'action. Dans l'API, la tâche s'arrête. Une session de commande par écran de 40 minutes est exactement le type de tâche le plus exposé à cette interruption. Un appel API de cinq secondes ne l'est pas.
Utilisation de l'ordinateur versus le contrat : quand chacun l'emporte
| Situation | Meilleur outil | Pourquoi |
|---|---|---|
| Tester votre propre API | La spécification | Déterministe, peu coûteux à réexécuter, affirme le contrat réel |
| Suite de régression en CI | La spécification | Les scénarios s'exécutent sans modèle dans la boucle |
| Portail tiers sans API | Utilisation de l'ordinateur | Il n'y a pas de contrat à remettre |
| QA front-end de bout en bout avant la publication | Utilisation de l'ordinateur | L'interface utilisateur est ce qui est testé |
| Outil de bureau hérité | Utilisation de l'ordinateur | Seul un écran existe |
| Vérifier si les docs correspondent au comportement | La spécification, puis l'interface utilisateur | Envoyer la requête documentée, comparer la réponse, puis vérifier ponctuellement la page rendue |
La distinction est ce que vous testez. L'utilisation d'ordinateur teste les pixels. La spécification teste la promesse. Lorsqu'un front-end tombe en panne, l'API est généralement toujours fonctionnelle, et lorsque l'API tombe en panne, le front-end peut le masquer derrière une erreur conviviale. Les deux sont importants, mais les équipes API livrent la promesse, alors testez la promesse en premier.
Comment remettre votre contrat API à Astra
Il y a trois façons de donner une spécification à Astra, et elles se cumulent.
1. Donnez-lui le fichier. Exportez la spécification OpenAPI de votre projet Apidog (ou importez d'abord votre spécification existante dans Apidog) et incluez-la dans la requête. La fenêtre de contexte de 1 050 000 jetons d'Astra peut contenir n'importe quelle spécification réelle en une seule invite, et le test de récupération MRCR d'OpenAI montre qu'il maintient une précision de 96,3 % dans la plage de 512 000 à 1 million, là où Sol tombe à 73,8 %. Les grandes spécifications ne sont plus un problème de découpage.
2. Connectez le projet via MCP. Le serveur Apidog MCP expose votre projet Apidog, votre documentation publiée ou un fichier OpenAPI à tout client compatible MCP, de sorte qu'Astra lit le contrat actuel au lieu d'une exportation obsolète. Codex et les agents de bureau peuvent récupérer les définitions de points de terminaison pendant qu'ils travaillent. C'est cette configuration qui a permis à Astra, lors de notre test, de trouver et de lire la spécification de lui-même.
3. Transformez la spécification en outils. Pour une utilisation programmatique, convertissez les points de terminaison en outils de fonction et appelez Astra via l'API Responses, le modèle que nous abordons dans OpenAPI aux outils d'agents IA. La page du modèle liste l'appel de fonction, les sorties structurées et la recherche de fichiers parmi les fonctionnalités d'Astra, et l'appel d'outils nécessite l'API Responses, et non les complétions de chat.
Une requête minimale qui demande à Astra d'élaborer des scénarios de test à partir d'une spécification ressemble à ceci :
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": [
{"role": "developer", "content": "You are writing API test scenarios. Bias towards action. Only ask a question if the answer changes the test design. Output JSON matching the schema."},
{"role": "user", "content": "Here is our OpenAPI 3.1 spec. Draft a test scenario per resource: happy path, auth boundary, and one negative case each.\n\n<paste spec>"}
],
"text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
}'
Deux remarques tirées du guide du modèle d'OpenAI. Astra n'a pas d'effort none ou minimal, il faut donc commencer par low ou medium, et il « demande des clarifications plus facilement » que les modèles précédents, de sorte que la ligne « bias towards action » (favoriser l'action) dans le message du développeur a un réel impact.
4. Exécutez les scénarios sans le modèle. Importez les scénarios générés dans Apidog, attachez des assertions sur les codes de statut et les schémas de réponse, et exécutez-les depuis l'interface CLI d'Apidog dans votre pipeline. Le modèle a écrit les tests une fois. Votre CI les exécute mille fois gratuitement. C'est l'argument économique en une phrase, et c'est pourquoi Télécharger Apidog se trouve à côté de la clé API dans ce flux de travail.
Maintenez les garde-fous, même si Astra les respecte
Les résultats d'alignement d'OpenAI pour Astra sont les meilleurs qu'il ait publiés. Lors du test « honeypot » (pot de miel) construit après l'incident Hugging Face, Sol a dépassé la cible autorisée 48 % du temps et Astra l'a fait 0 % du temps. Astra n'a jamais tenté de contourner un refus d'auto-révision de Codex, même lorsque le refus était délibérément configuré pour être évitable. Sa robustesse à l'injection de prompt indirecte est de 99,79 %, contre 96,23 % auparavant.
Rien de tout cela n'élimine la nécessité de garde-fous. Cela signifie que les garde-fous se déclenchent moins souvent. Un modèle avec une fenêtre de 1 million de jetons, une classification cybernétique Critique, et la capacité d'envoyer des requêtes arbitraires à votre API devrait toujours être exécuté sur un environnement de staging avec des informations d'identification restreintes, une porte d'approbation sur les mutations, et une trace de chaque appel. Le moniteur d'Astra peut également arrêter une exécution en cours de tâche, il faut donc traiter chaque longue tâche comme étant résumable. La conception de test pour les agents non déterministes s'applique sans changement : affirmer le contrat, pas la transcription.
Là où l'utilisation de l'ordinateur conserve sa place
Ne lisez pas ceci comme « ne le laissez jamais cliquer ». Trois cas sont meilleurs à l'écran. Un portail partenaire ou une console d'administration sans API. Un contrôle frontal le jour de la sortie qu'un humain ferait autrement à la main. Un outil de bureau hérité où l'interface utilisateur est la seule surface. Astra est le premier modèle où ces tâches valent la peine d'être déléguées, et l'accélération du harnais Codex les rend suffisamment abordables pour être exécutées toutes les nuits.
La règle pratique : utilisez le contrat lorsqu'un contrat existe, et utilisez l'écran lorsqu'il n'y en a pas.
FAQ
L'utilisation de l'ordinateur par GPT-6 Astra fonctionne-t-elle via l'API ? Oui. L'utilisation de l'ordinateur est répertoriée parmi les outils pris en charge par Astra sur l'API Responses, aux côtés de la recherche web, de la recherche de fichiers, de l'interpréteur de code et de la génération d'images. Votre application fournit l'environnement et exécute les actions proposées par le modèle. L'API porte également le côté le plus strict des garde-fous d'OpenAI : une tâche mise en pause par le moniteur de désalignement s'arrête au lieu d'attendre une révision.
Quelle taille de spécification puis-je lui donner ? La fenêtre de contexte est de 1 050 000 jetons avec 128 000 jetons de sortie. Une spécification avec des centaines de points de terminaison et des schémas complets tient avec de la marge. Les invites de plus de 272 000 jetons d'entrée sont facturées à 2 fois les taux d'entrée et de cache, alors mettez en cache le préfixe de la spécification et gardez les messages par test petits.
Va-t-il halluciner des points de terminaison qui ne sont pas dans la spécification ? Moins que les modèles précédents. Le benchmark interne d'hallucinations d'OpenAI, où un score plus bas est meilleur, montre Astra à 4,2 % contre 12,2 % pour Sol, et il est trois fois moins susceptible de dénaturer ses propres capacités. Les sorties structurées et une exécution validée par schéma dans Apidog rattrapent le reste, c'est pourquoi le test de contrat a le dernier mot, pas le modèle.
Est-ce moins cher que GPT-5.6 Sol pour la génération de tests ? Par jeton, non. Astra coûte 10 $ et 50 $ par million de jetons contre 4 $ et 20 $ promotionnels pour Sol. Par tâche terminée, OpenAI affirme qu'Astra utilise beaucoup moins de jetons, et le flux de travail axé sur la spécification fait du coût du modèle une dépense unique. Mesurez-le sur votre propre spécification avant de décider ; le guide API montre comment les comparer côte à côte.
La version courte
GPT-6 Astra peut piloter votre ordinateur, et pour les interfaces sans API, c'est un véritable cadeau. Pour l'API que vous possédez, l'écran est le chemin lent. Donnez le contrat au modèle, laissez-le écrire les scénarios, exécutez-les en CI et maintenez les garde-fous. Astra est arrivé à cette conclusion de lui-même en vingt minutes. Votre équipe peut commencer par là.
