GPT-5.6 Sol benchmarks : Vaut-il vraiment la peine d'attendre ?

Les résultats des benchmarks GPT-5.6 Sol décryptés : les scores de Terminal-Bench, Agent's Last Exam et ExploitBench comparés à GPT-5.5, ainsi qu'un verdict honnête sur l'opportunité d'attendre ou de passer à autre chose.

Ashley Innocent

Ashley Innocent

26 June 2026

GPT-5.6 Sol benchmarks : Vaut-il vraiment la peine d'attendre ?

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

OpenAI a annoncé GPT-5.6 Sol le 26 juin 2026 avec un ensemble de chiffres de référence qui ressemblent à un record inégalé. État de l'art sur Terminal-Bench, le seul modèle dépassant 50 % sur l'Agent’s Last Exam en mode code, des évaluations cyber qui égalent un concurrent de premier plan sur un tiers des tokens. L'avertissement à lire en premier : vous ne pouvez rien exécuter de tout cela. Sol est livré sous forme d'aperçu limité, soumis à l'approbation gouvernementale, via l'API OpenAI et Codex uniquement, restreint à environ 20 partenaires dont les noms ont été individuellement approuvés par le gouvernement américain. Il n'est pas dans ChatGPT, et il n'y a rien à s'inscrire pour aujourd'hui.

Ainsi, les benchmarks ne sont pas des conseils d'achat. Ils répondent à une seule question, et une seule : GPT-5.6 Sol vaut-il la peine d'être attendu, ou devriez-vous passer à un modèle que vous pouvez déjà utiliser ? C'est ce que cet article examine. Nous décrivons ce que chaque benchmark principal mesure, plaçons chaque chiffre à côté des bases de référence GPT-5.5 et Claude Mythos 5 que vous avez déjà, et terminons par un verdict honnête « attendre ou passer à autre chose ». Chaque chiffre ici provient de la présentation d'OpenAI et des premières couvertures secondaires, et non d'un test que nous avons effectué.

bouton

En bref

Lisez ceci avant de lire les scores

Les benchmarks vous disent ce qu'un modèle peut faire. Ils ne vous disent pas si vous pouvez l'utiliser. Pour GPT-5.6 Sol, ce sont deux faits différents, et le second domine actuellement.

Le lancement est conditionné par l'administration américaine en vertu d'un décret exécutif du 2 juin 2026 qui a établi l'évaluation et la mesure des nouveaux modèles d'IA. OpenAI a accepté cette mesure temporaire. Selon leurs propres termes, cités par MacRumors, « Nous prenons cette mesure à court terme car nous pensons que c'est la meilleure voie vers une disponibilité plus large dans les semaines à venir. » OpenAI déclare que la disponibilité générale dans ChatGPT, Codex et l'API est prévue dans les semaines à venir. D'ici là, les scores sont un aperçu de quelque chose que vous ne pouvez pas acheter.

Ce cadrage est important pour la lecture du reste de cet article. Une avance de 4 points sur Terminal-Bench est significative si vous pouvez la déployer. C'est une raison de continuer à surveiller, et non d'arrêter votre feuille de route, si vous ne le pouvez pas. Si vous voulez une image complète de ce qu'est Sol et pourquoi il est verrouillé, notre explicatif de GPT-5.6 Sol couvre la famille et le verrouillage. Les identifiants exacts du modèle d'API n'ont pas encore été publiés, il n'y a donc rien à configurer même si vous le vouliez.

Terminal-Bench 2.1 : le chiffre clé

Terminal-Bench mesure la capacité d'un modèle à accomplir des tâches réelles dans un terminal : éditer des fichiers, exécuter des commandes, enchaîner des outils, récupérer des erreurs. C'est le proxy public le plus proche pour savoir « si cette chose peut faire du codage agentique de bout en bout » plutôt que de répondre à une seule invite. C'est pourquoi OpenAI l'a mis en avant.

Selon OpenAI et les premières couvertures, sur Terminal-Bench 2.1, la nouvelle configuration « ultra », Sol Ultra, obtient environ 91,91 %, avec Sol standard autour de 88,8 %. Les bases de référence que vous avez déjà pour le contexte : Claude Mythos 5 autour de 88 % et GPT-5.5 autour de 83,4 %. Si ces chiffres se maintiennent, le mode standard de Sol est à peu près au même niveau que Mythos 5, et Sol Ultra prend quelques points d'avance sur la concurrence.

La partie « ultra » fait un réel travail dans ce score élevé. Selon l'annonce d'OpenAI, le mode ultra « va au-delà d'un seul agent en exploitant des sous-agents pour accélérer le travail complexe. » Ainsi, les 91,91 % ne représentent pas un modèle qui réfléchit plus fort ; c'est un modèle qui génère des assistants. C'est un véritable changement de capacité, et cela signifie également que le chiffre clé ne se mappe pas clairement sur un seul appel GPT-5.5. Pour une comparaison directe des modèles que vous pouvez exécuter aujourd'hui, notre comparaison Claude Opus 4.8 vs GPT-5.5 vs Gemini 3.5 est la meilleure référence tant que Sol reste verrouillé.

Agent’s Last Exam : l'affirmation du « seul modèle au-delà de 50 % »

Agent’s Last Exam est un benchmark agentique difficile conçu pour résister à la saturation : des tâches multi-étapes où le modèle doit planifier, utiliser des outils et les suivre sans intervention humaine. Le mode code est la partie qui met spécifiquement l'accent sur le travail logiciel.

Selon les premières couvertures, GPT-5.6 Sol obtient environ 50,9 % en mode code et est décrit comme le seul modèle au-dessus de 50 %. Ce cadrage est le point essentiel. Sur un benchmark où la plupart des modèles de pointe se situent dans les 40 %, dépasser la moitié est le genre de bond sur lequel OpenAI veut ancrer son lancement.

Lisez-le avec la même prudence que le chiffre de Terminal-Bench. 50,9 % est une affirmation issue de rapports secondaires, pas un chiffre que nous avons mesuré, et « le seul modèle au-dessus de 50 % » est un instantané que d'autres laboratoires contesteront dans les semaines à venir. La lecture honnête : si votre travail est véritablement du codage agentique à long terme, où un modèle doit mener une tâche à son terme, c'est le benchmark qui justifie l'attente. Si votre travail est du codage requête-réponse plus court, l'écart par rapport à un modèle que vous utilisez déjà est plus petit que ce que le titre suggère.

ExploitBench : l'efficacité plutôt que le score brut

Le troisième benchmark est le plus intéressant pour la décision d'attendre ou de passer à autre chose, car il ne s'agit pas vraiment d'un score plus élevé. ExploitBench (et l'ExploitGym associé) mesurent la capacité de cybersécurité. Sol est réglé pour trouver des vulnérabilités logicielles et écrire des correctifs tout en résistant aux tentatives de création de chaînes d'exploitation complètes. C'est une posture défensive, pas un modèle de piratage offensif, et OpenAI le qualifie de sa « pile de sécurité la plus robuste à ce jour ».

Selon les premières couvertures, sur ExploitBench, Sol est compétitif avec Mythos Preview d'Anthropic tout en utilisant environ un tiers des tokens de sortie. Le même schéma apparaît du côté scientifique : sur GeneBench v1, OpenAI rapporte une amélioration par rapport à GPT-5.5 en utilisant moins de tokens.

L'histoire des tokens est celle qui a de réelles conséquences budgétaires. Si Sol atteint une barre de qualité similaire avec un tiers des tokens de sortie, le coût effectif par tâche résolue tombe bien en dessous de ce que le tarif de 5 $ en entrée / 30 $ en sortie par million de tokens suggère sur le papier. C'est l'argument d'efficacité pour attendre : non pas que Sol soit plus intelligent sur chaque invite, mais qu'il puisse obtenir la même réponse à moindre coût sur les charges de travail pour lesquelles il est réglé. La fiche du système de sécurité de déploiement d'OpenAI est l'endroit où le cadre de sécurité et de cyber est documenté, et il vaut la peine d'être lu avant de considérer tout chiffre cyber comme porteur de charge.

Comment lire ces scores par rapport à votre base de référence

Mettez les trois benchmarks ensemble et une forme apparaît. Le cas de Sol est le plus fort sur les travaux longs, agentiques et gourmands en outils : tâches de terminal, codage multi-étapes, balayages de sécurité défensifs. Sur ceux-ci, il revendique quelques points d'avance sur Mythos 5 et un écart plus large sur GPT-5.5, plus un avantage en efficacité de tokens.

Ce que les benchmarks ne montrent pas est tout aussi important. Il n'y a pas de limite maximale publiée de tokens de sortie, pas de date limite de connaissances déclarée, pas de liste de modalités confirmée. La fenêtre contextuelle est rapportée comme étant d'environ 1,5 million de tokens par une source et « non spécifiée » par une autre, il faut donc la considérer comme non confirmée.

Le verdict : attendre ou passer à autre chose

Voici la conclusion honnête.

Attendez si : votre charge de travail principale est le codage agentique, les longues sessions de terminal ou la sécurité défensive, et que vous pouvez tenir quelques semaines. L'avance sur Terminal-Bench, le résultat de l'Agent’s Last Exam et l'efficacité des tokens d'ExploitBench pointent tous vers ce profil exact. Si quelques points de pourcentage sur ces tâches changent votre économie, Sol mérite d'être surveillé attentivement. Surveillez la disponibilité générale et, plus important encore, les benchmarks indépendants qui confirment ou dégonflent les chiffres de lancement.

Ne vous embêtez pas à attendre si : vous avez besoin d'un modèle en production maintenant, ou si votre travail est du codage requête-réponse plus court, du chat, de la résumé ou de la classification. Vous ne pouvez pas obtenir Sol aujourd'hui de toute façon, les identifiants du modèle ne sont même pas publiés, et les alternatives que vous pouvez exécuter dès maintenant comblent la majeure partie de l'écart sur le travail quotidien. Attendre qu'un modèle verrouillé soit livré avant de résoudre un problème que vous avez aujourd'hui est une mauvaise stratégie. La meilleure approche est de choisir un modèle de pointe que vous pouvez réellement utiliser ; notre tour d'horizon des modèles de pointe que vous pouvez utiliser aujourd'hui correspond chacun au travail pour lequel Sol est vanté.

Une note plus honnête : même lorsque la disponibilité générale arrivera, la première vague sera GPT-5.6 sur toute la gamme de niveaux, Terra et Luna inclus, pas seulement Sol. Terra est positionné comme environ 2 fois moins cher que GPT-5.5 avec des performances similaires, ce qui est le niveau que la plupart des équipes finiront par utiliser. Donc « attendre Sol » pourrait en fait signifier attendre de choisir le bon niveau, et c'est une décision plus calme que ce que les titres des benchmarks impliquent.

Où Apidog s'intègre pendant que vous attendez

Vous ne pouvez pas encore tester Sol. En attendant, vous pouvez tester tout ce que vous utiliseriez autrement. Mythos 5, GPT-5.5, Gemini, et les autres exposent tous des API HTTP compatibles OpenAI ou standard, et vous pouvez les piloter, affirmer sur leurs réponses et comparer les comportements dans Apidog dès aujourd'hui. Configurez une requête, dirigez-la vers le point d'extrémité de chaque modèle, et vous disposez d'un banc d'essai reproductible pour la décision dont il est question dans cet article.

Ce banc d'essai est également votre préparation au premier jour pour Sol. Le jour où votre accès à l'aperçu sera accordé, ou que la disponibilité générale ouvrira, vous échangez le point d'extrémité et l'ID du modèle et exécutez les mêmes scénarios que vous avez déjà construits. Pas de nouveaux outils, pas de précipitation. Téléchargez Apidog pour construire ces tests contre les modèles que vous pouvez utiliser maintenant, afin d'être prêt au moment où le modèle verrouillé sera ouvert.

Conclusion

Les benchmarks de GPT-5.6 Sol sont solides, particulièrement sur le travail agentique et de sécurité pour lequel il a été réglé, et ce ne sont encore que des affirmations sous une restriction gouvernementale que vous ne pouvez pas franchir aujourd'hui. Attendez si ce profil de pointe est votre travail et que vous pouvez patienter quelques semaines. Sinon, passez à un modèle que vous pouvez livrer maintenant et réexaminez la question lorsque Sol obtiendra des chiffres indépendants et un point d'extrémité public.

Construisez votre banc d'évaluation contre les modèles que vous pouvez utiliser aujourd'hui dans Apidog, afin d'être prêt à tester Sol le jour où votre accès sera accordé.

bouton

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API