OpenAI a enfoui la partie la plus intéressante du lancement de GPT-5.6 Sol sous les nouvelles concernant la porte gouvernementale. Parallèlement à la nouvelle famille de modèles, OpenAI a introduit deux nouveaux contrôles de raisonnement : un effort de raisonnement « max » qui donne à Sol le plus de temps pour réfléchir, et un mode « ultra » qui, selon les mots d'OpenAI, « va au-delà d'un seul agent en tirant parti de sous-agents pour accélérer les tâches complexes ». Cette deuxième fonctionnalité représente un véritable changement dans le comportement d'un appel de modèle unique.
Tout d'abord, la réalité de l'accès. GPT-5.6 Sol est en avant-première limitée via l'API OpenAI et Codex uniquement. Il n'est pas encore disponible dans ChatGPT et est restreint à environ 20 partenaires dont les noms ont été individuellement approuvés par le gouvernement américain. Vous ne pouvez donc pas activer le mode ultra aujourd'hui, à moins d'en faire partie. Cet article s'adresse aux développeurs qui souhaitent comprendre comment les sous-agents au sein d'un appel de modèle modifient la conception des agents, la latence et les coûts, afin que vous puissiez décider si cela vaut la peine d'attendre. OpenAI annonce une disponibilité générale dans ChatGPT, Codex et l'API dans les semaines à venir.
bouton
En bref
- L'effort de raisonnement « max » est une version plus approfondie d'un réglage existant : plus de temps de réflexion, un seul agent, une seule chaîne de travail.
- Le mode « ultra » est d'une nature nouvelle : le modèle génère ses propres sous-agents pour diviser le travail complexe, selon OpenAI.
- Vous ne pouvez pas encore utiliser l'un ou l'autre. GPT-5.6 est une préversion restreinte par le gouvernement, disponible uniquement via l'API et Codex, pas dans ChatGPT.
- Le coût de sortie de Sol est de 30 $ par million de tokens, donc le mode ultra qui se déploie en sous-agents n'est pas bon marché. Réservez-le pour les tâches difficiles et parallélisables.
- C'est la même idée d'orchestrateur multi-agents que d'autres laboratoires déploient, maintenant intégrée dans un seul appel de modèle. Pour tester le modèle d'orchestration aujourd'hui, vous devez utiliser un modèle auquel vous avez accès.
Ce que fait l'effort de raisonnement « max »
OpenAI vous permettait déjà d'ajuster l'intensité du travail d'un modèle de raisonnement via un paramètre d'effort de raisonnement. GPT-5.6 ajoute un nouveau niveau supérieur appelé « max ». Activez-le, et Sol dispose du temps le plus long pour raisonner en profondeur avant de répondre.
Considérez « max » comme le fait de tourner un bouton que vous connaissez déjà. Le modèle fonctionne toujours comme un agent unique et produit toujours une seule chaîne de raisonnement. Vous payez pour plus de ce raisonnement, en tokens et en temps réel, afin d'obtenir le dernier brin de précision sur un problème difficile. Le compromis est familier : une réflexion plus approfondie coûte plus cher et prend plus de temps, et la plupart des invites n'en ont pas besoin. « Max » est le bon réglage lorsqu'une question difficile unique justifie une délibération supplémentaire, comme une refactorisation subtile ou un plan fortement axé sur les mathématiques. Cela ne change pas la nature du travail. Cela change le temps que l'unique travailleur y consacre.
Ce que le mode « ultra » change
Le mode « ultra » est d'une nature différente. Selon OpenAI, le mode ultra « va au-delà d'un seul agent en tirant parti de sous-agents pour accélérer les tâches complexes ». Au lieu qu'un seul modèle ne traite un problème en une seule chaîne, le modèle orchestre plusieurs sous-agents qui s'attaquent à des parties de la tâche, puis rassemble leur travail.
Si vous avez construit des systèmes d'agents manuellement, vous l'avez déjà fait de la manière difficile. Vous écrivez un orchestrateur. Il décompose une tâche en sous-tâches, les distribue à des appels de modèle distincts, puis rassemble les résultats et produit une réponse finale. Vous gérez les invites, l'état, les tentatives et le code de liaison entre chaque étape.
Le mode Ultra intègre ce modèle à l'intérieur de l'appel de modèle. Vous ne demandez qu'une seule fois. Le modèle décide comment diviser le travail, exécute les sous-agents et renvoie un résultat. L'orchestration que vous gériez auparavant se déroule désormais derrière un seul appel API. C'est la partie véritablement novatrice. Pour un contexte familial plus large, l'aperçu de GPT-5.6 Sol couvre les niveaux, la nomenclature et les raisons pour lesquelles l'ensemble est bloqué derrière une préversion gouvernementale.
Ce que cela change pour la conception des agents
Déplacez l'orchestration dans le modèle et trois choses changent dans la façon dont vous construisez.
Moins de code de liaison. La logique de décomposition, de distribution et de fusion qui résidait auparavant dans votre application peut se réduire. Vous décrivez l'objectif et laissez le modèle gérer la répartition. Cela représente moins de surface à maintenir et moins d'endroits où votre orchestration risque de se désynchroniser avec le comportement du modèle.
Moins de contrôle. L'autre face de la médaille est que vous perdez en visibilité. Lorsque vous possédez l'orchestrateur, vous voyez chaque sous-tâche, résultat intermédiaire et tentative, et vous pouvez les enregistrer ou intervenir. Avec des sous-agents à l'intérieur d'un seul appel, ce mécanisme est opaque. Vous voyez l'entrée et la sortie finale, pas les bifurcations intermédiaires. Pour les flux de travail qui nécessitent une piste d'audit, un orchestrateur construit à la main reste préférable.
Modes de défaillance différents. Un agent unique échoue de manières que vous pouvez généralement retracer. Un modèle exécutant des sous-agents internes échoue de manières plus difficiles à attribuer. Un sous-agent s'est-il déréglé ? L'étape de fusion a-t-elle omis quelque chose ? Vous ne pourrez pas toujours le savoir de l'extérieur, ce qui est important lorsque vous déboguez un agent de production.
C'est la même tension qui traverse chaque système multi-agents, mais relocalisée. Pour voir comment les orchestrateurs dédiés l'abordent, Fugu Ultra versus Fable 5 versus Mythos présente un modèle construit explicitement comme un orchestrateur multi-agents, un contraste utile avec l'intégration de cette idée par OpenAI au sein d'un seul modèle.
Latence et coût : pourquoi l'ultra n'est pas gratuit
Les sous-agents travaillent en parallèle, donc pour la bonne tâche, l'ultra peut terminer plus vite qu'un agent avançant pas à pas séquentiellement. C'est l'argument de l'« accélération du travail complexe ».
Du côté des coûts, il faut être honnête. Sol est le niveau phare, et sa sortie est tarifée à 30 $ par million de tokens, avec une entrée à 5 $ par million (Terra et Luna sont des niveaux moins chers de la même famille). Imaginez maintenant l'ultra générant plusieurs sous-agents, chacun produisant son propre raisonnement et ses tokens de sortie. Ces tokens s'accumulent sur chaque sous-agent, de sorte qu'un seul appel ultra peut coûter bien plus qu'un seul appel max sur la même invite. L'ultra échange des tokens contre la vitesse et la profondeur sur des tâches difficiles et parallélisables. Si votre tâche ne se décompose pas en parties indépendantes, vous payez pour des sous-agents qui s'attendent les uns les autres ou dupliquent les efforts. C'est le cas de la surpuissance.
La mise en cache des invites réduit la facture. GPT-5.6 prend en charge les points d'arrêt de cache explicites avec une durée de vie minimale de 30 minutes. Les écritures en cache sont facturées à 1,25 fois le taux d'entrée non mis en cache, et les lectures en cache bénéficient d'une réduction de 90 % sur l'entrée mise en cache. Si vos sous-agents partagent un grand contexte commun, comme une grande invite système ou une base de code fixe, le mettre en cache une fois et le lire à faible coût lors d'appels successifs permet de réaliser de réelles économies. Cela ne modifie pas le coût des tokens de sortie, qui est la principale dépense du mode ultra.
Quand l'ultra est utile, et quand il est excessif
Utilisez l'ultra lorsque la tâche se divise en morceaux indépendants qui bénéficient du travail parallèle et où la précision justifie la dépense. Pensez à un changement de code important touchant de nombreux fichiers à la fois, une tâche de recherche qui s'étend sur plusieurs sources, ou un travail d'agent complexe avec des branches parallèles. Ce sont les tâches pour lesquelles OpenAI positionne Sol, y compris le codage et les travaux scientifiques.
Évitez l'ultra lorsque la tâche est séquentielle, petite ou sensible à la latence avec un budget limité : une réponse courte, une modification de fichier unique, une classification rapide. Pour celles-ci, l'ultra met en place des sous-agents qui n'ont rien à paralléliser, et l'effort de raisonnement maximal ou même l'effort par défaut est le choix honnête.
Voici une manière directe de décider. Si vous ne pouviez pas diviser la tâche entre plusieurs sous-traitants humains travaillant en même temps, le modèle ne peut probablement pas non plus tirer beaucoup de valeur des sous-agents. Le travail séquentiel reste séquentiel, peu importe le nombre d'agents que vous y consacrez.
Comment cela s'inscrit dans la tendance plus large des multi-agents
OpenAI n'est pas le premier à penser que plusieurs agents coordonnés sont plus efficaces qu'un seul. D'autres laboratoires ont lancé des modèles et des frameworks où un contrôleur délègue à des spécialistes et rassemble les résultats. Ce qui est nouveau, c'est l'emballage : OpenAI propose ce modèle comme un mode sur un seul modèle plutôt qu'un système séparé que vous assemblez.
C'est un pari sur l'orientation de la construction d'agents. Si l'orchestration intégrée au modèle devient suffisamment performante, de nombreuses couches d'orchestration développées à la main deviendront superflues pour les cas courants. Si elle reste opaque et difficile à déboguer, les équipes qui ont besoin de contrôle continueront à construire les leurs. Les deux peuvent être vrais à la fois, l'ultra gérant les cas faciles et l'orchestration personnalisée gérant ceux qui nécessitent une piste d'audit. La répartition des benchmarks de GPT-5.6 Sol examine si les chiffres étayent les affirmations d'orchestration, articulée autour de la seule décision que vous pouvez prendre actuellement : attendre ou passer à autre chose.
Ce que vous pouvez faire aujourd'hui
Vous ne pouvez pas exécuter le mode ultra, donc l'approche pratique consiste à construire et tester le modèle d'orchestration sur un modèle que vous pouvez appeler. Les modèles de pointe disponibles actuellement, comme Claude Mythos 5, Claude Fable 5, GPT-5.5, Gemini 3.5 Pro, GLM-5.2 et Fugu Ultra, exposent tous des points d'accès de chat compatibles OpenAI ou standard que vous pouvez connecter dès aujourd'hui.
C'est là qu'Apidog intervient. Vous pouvez envoyer des requêtes à n'importe laquelle de ces API de modèle, définir des paramètres comme l'effort de raisonnement là où le modèle le prend en charge, vérifier les réponses et enregistrer les appels comme scénarios de test réutilisables. Lorsque vous obtiendrez l'accès à la préversion de GPT-5.6, la même configuration sera prête : échangez le point d'accès et l'identifiant du modèle, et vous testerez Sol le jour même de votre accès. Vous ne testez pas Sol aujourd'hui, car personne en dehors des partenaires approuvés ne le peut. Vous préparez votre harnais de test pour que le premier jour ne soit pas une course folle.

Conclusion
Le mode Ultra est la partie la plus avant-gardiste du lancement de GPT-5.6 : l'orchestration qui résidait auparavant dans votre code, déplacée à l'intérieur d'un seul appel de modèle. C'est aussi une fonctionnalité que vous ne pouvez pas encore toucher, et quand vous le pourrez, elle ne sera pas bon marché, la discipline consiste donc à adapter le réglage au travail. Utilisez max quand un travailleur doit réfléchir plus intensément. N'optez pour l'ultra que lorsque la tâche se divise réellement en parties parallèles qui justifient le coût en tokens.
Vous voulez que votre environnement de test soit prêt pour le jour où Sol sera accessible ? Téléchargez Apidog et commencez à tester les API des modèles de pointe que vous pouvez appeler dès aujourd'hui.
bouton
