OpenAI kündigte GPT-5.6 Sol am 26. Juni 2026 mit einer Reihe von Benchmark-Zahlen an, die wie ein lupenreiner Rekord aussehen. Terminal-Bench auf dem neuesten Stand der Technik, das einzige Modell, das beim Agent’s Last Exam im Code-Modus über 50 % erreichte, Cyber-Evaluierungen, die einem Top-Konkurrenten bei einem Drittel der Tokens entsprechen. Der Haken, den Sie zuerst lesen müssen: Sie können nichts davon ausführen. Sol wird als von der Regierung beschränkte Vorschau über die OpenAI API und Codex ausgeliefert, beschränkt auf etwa 20 Partner, deren Namen einzeln von der US-Regierung genehmigt wurden. Es ist nicht in ChatGPT verfügbar, und es gibt heute nichts, wofür man sich anmelden könnte.
Die Benchmarks sind also keine Kaufempfehlung. Sie beantworten eine Frage, und nur eine: Lohnt es sich, auf GPT-5.6 Sol zu warten, oder sollten Sie mit einem Modell fortfahren, das Sie bereits nutzen können? Das ist es, was dieser Artikel klärt. Wir gehen durch, was jeder Schlagzeilen-Benchmark misst, stellen jede Zahl neben die bereits vorhandene GPT-5.5- und Claude Mythos 5-Baseline und schließen mit einem ehrlichen „warten oder weitermachen“-Urteil ab. Jede hier genannte Zahl stammt aus OpenAIs eigener Darstellung und früher Sekundärberichterstattung, nicht aus einem von uns durchgeführten Test.
TL;DR
- GPT-5.6 Sol ist in einer limitierten Vorschau verfügbar: nur über OpenAI API und Codex, nicht in ChatGPT, für etwa 20 von der Regierung genehmigte Partner. Die allgemeine Verfügbarkeit ist laut OpenAI für „die kommenden Wochen“ angekündigt.
- Die gemeldeten Ergebnisse sind stark, stammen aber aus Sekundärquellen. Betrachten Sie sie als OpenAIs Behauptungen, nicht als gemessene Ergebnisse, bis das Modell verfügbar wird.
- Schlagzeilenzahlen (laut OpenAI / früher Berichterstattung): Terminal-Bench 2.1 SOTA, Agent’s Last Exam Code-Modus über 50%, ExploitBench-Parität bei etwa einem Drittel der Ausgabe-Tokens.
- Warten Sie, wenn Ihre Arbeit agentische Codierung, lange Terminal-Aufgaben oder defensive Sicherheit umfasst und Sie ein paar Wochen warten können.
- Warten Sie nicht, wenn Sie jetzt ein Modell in Produktion benötigen. Die Alternativen, die Sie heute testen können, schließen die Lücke größtenteils.
Lesen Sie dies, bevor Sie die Ergebnisse lesen
Benchmarks zeigen Ihnen, was ein Modell leisten kann. Sie sagen Ihnen nicht, ob Sie es nutzen können. Für GPT-5.6 Sol sind das zwei verschiedene Fakten, und der zweite dominiert derzeit.
Die Einführung wird von der US-Regierung durch eine Executive Order vom 2. Juni 2026 eingeschränkt, die Benchmarking und Bewertung für neue KI-Modelle festlegt. OpenAI hat als vorübergehenden Schritt zugestimmt. In ihren Worten, zitiert von MacRumors: „Wir unternehmen diesen kurzfristigen Schritt, weil wir glauben, dass dies der beste Weg zu einer breiteren Verfügbarkeit in den kommenden Wochen ist.“ OpenAI gibt an, dass die allgemeine Verfügbarkeit in ChatGPT, Codex und der API in den kommenden Wochen erfolgen wird. Bis dahin sind die Ergebnisse eine Vorschau auf etwas, das Sie nicht kaufen können.
Diese Einordnung ist wichtig dafür, wie Sie den Rest dieses Artikels lesen. Ein 4-Punkte-Vorsprung bei Terminal-Bench ist bedeutsam, wenn Sie ihn einsetzen können. Es ist ein Grund, weiterhin aufmerksam zu sein, nicht Ihre Roadmap anzuhalten, falls Sie es nicht können. Wenn Sie ein vollständiges Bild davon haben möchten, was Sol ist und warum es gesperrt ist, behandelt unser GPT-5.6 Sol Erklärer die Familie und die Sperre. Die genauen API-Modell-Identifikatoren wurden noch nicht veröffentlicht, es gibt also nichts anzuschließen, selbst wenn Sie wollten.
Terminal-Bench 2.1: Die Schlagzeilenzahl
Terminal-Bench misst, wie gut ein Modell reale Aufgaben in einem Terminal erledigt: Dateien bearbeiten, Befehle ausführen, Tools verketten, sich von Fehlern erholen. Es ist der nächstgelegene öffentliche Proxy für die Frage, „kann dieses Ding agentische Codierungsarbeit Ende-zu-Ende erledigen“, anstatt nur eine einzelne Anfrage zu beantworten. Deshalb hat OpenAI damit begonnen.

Laut OpenAI und früher Berichterstattung erzielt die neue „Ultra“-Konfiguration, Sol Ultra, bei Terminal-Bench 2.1 etwa 91,91 %, während der Standard-Sol bei etwa 88,8 % liegt. Die Baselines, die Sie bereits als Kontext haben: Claude Mythos 5 bei etwa 88 % und GPT-5.5 bei etwa 83,4 %. Wenn diese Zahlen stimmen, liegt der Standardmodus von Sol ungefähr gleichauf mit Mythos 5, und Sol Ultra hebt sich um einige Punkte vom Feld ab.
Der „Ultra“-Teil leistet bei dieser Top-Punktzahl echte Arbeit. Laut OpenAIs Ankündigung „geht der Ultra-Modus über einen einzelnen Agenten hinaus, indem er Unteragenten nutzt, um komplexe Arbeiten zu beschleunigen.“ Die 91,91 % bedeuten also nicht, dass ein Modell härter nachdenkt; es ist ein Modell, das Helfer erzeugt. Das ist eine echte Kapazitätsverschiebung, und es bedeutet auch, dass die Schlagzeilenzahl nicht sauber auf einen einzelnen GPT-5.5-Aufruf abgebildet werden kann. Für einen direkten Vergleich der Modelle, die Sie heute ausführen können, ist unser Claude Opus 4.8 vs. GPT-5.5 vs. Gemini 3.5 Vergleich die bessere Referenz, solange Sol gesperrt bleibt.
Agent’s Last Exam: Die Behauptung „einziges Modell über 50 %“
Agent’s Last Exam ist ein anspruchsvoller agentischer Benchmark, der darauf ausgelegt ist, Sättigung zu widerstehen: Mehrschrittaufgaben, bei denen das Modell planen, Tools verwenden und ohne menschliches Eingreifen durchführen muss. Der Code-Modus ist der Bereich, der speziell Software-Arbeiten beansprucht.
Laut früher Berichterstattung erzielt GPT-5.6 Sol im Code-Modus etwa 50,9 % und wird als das einzige Modell über 50 % beschrieben. Diese Einordnung ist der Punkt. Bei einem Benchmark, bei dem die meisten Spitzenmodelle im 40er-Bereich liegen, ist das Überschreiten der Hälfte der Sprung, an den OpenAI die Einführung knüpfen möchte.
Lesen Sie dies mit derselben Vorsicht wie die Terminal-Bench-Zahl. 50,9 % ist eine Behauptung aus Sekundärberichten, keine von uns gemessene Zahl, und „das einzige Modell über 50 %“ ist eine Momentaufnahme, die andere Labs innerhalb weniger Wochen übertreffen werden. Die ehrliche Lesart: Wenn Ihre Arbeit wirklich agentische, langfristige Codierung ist, bei der ein Modell eine Aufgabe bis zur Fertigstellung vorantreiben muss, ist dies der Benchmark, der für das Warten spricht. Wenn Ihre Arbeit kürzere Anfrage-Antwort-Codierung ist, ist die Lücke zu einem Modell, das Sie bereits verwenden, kleiner, als die Schlagzeile vermuten lässt.
ExploitBench: Effizienz über Rohwert
Der dritte Benchmark ist der interessanteste für die 'warten oder weitermachen'-Entscheidung, da es nicht wirklich um eine höhere Punktzahl geht. ExploitBench (und das verwandte ExploitGym) messen die Cybersicherheitsfähigkeit. Sol ist darauf abgestimmt, Software-Schwachstellen zu finden und Fehler zu beheben, während es Versuchen widersteht, vollständige Exploit-Ketten zu erstellen. Dies ist eine defensive Haltung, kein offensives Hacking-Modell, und OpenAI nennt es seinen „robustesten Sicherheits-Stack bis heute“.
Laut früher Berichterstattung ist Sol auf ExploitBench mit Anthropics Mythos Preview konkurrenzfähig, verwendet dabei aber etwa ein Drittel der Ausgabe-Tokens. Dasselbe Muster zeigt sich auf der Wissenschaftsseite: Bei GeneBench v1 meldet OpenAI eine Verbesserung gegenüber GPT-5.5 bei Verwendung von weniger Tokens.

Die Token-Geschichte ist diejenige mit echten Budgetkonsequenzen. Wenn Sol eine ähnliche Qualitätsstufe mit einem Drittel der Ausgabe-Tokens erreicht, sinken die effektiven Kosten pro gelöster Aufgabe weit unter das, was die Preisliste von 5 $ Eingabe / 30 $ Ausgabe pro Million Tokens auf dem Papier vermuten lässt. Das ist das Effizienzargument für das Warten: nicht, dass Sol bei jeder Anfrage klüger ist, sondern dass es bei den Workloads, für die es optimiert ist, günstiger zur gleichen Antwort kommen kann. Die OpenAI Deployment Safety System Card dokumentiert den Sicherheits- und Cyber-Rahmen, und es lohnt sich, diese zu lesen, bevor Sie eine Cyber-Zahl als tragfähig betrachten.
Wie Sie diese Ergebnisse im Vergleich zu Ihrer Baseline interpretieren
Nimmt man die drei Benchmarks zusammen, ergibt sich ein Bild. Sols Stärken liegen bei langen, agentischen, toolintensiven Aufgaben: Terminal-Aufgaben, mehrstufige Codierung, defensive Sicherheitsscans. Dort beansprucht es einige Punkte Vorsprung vor Mythos 5 und einen größeren Abstand zu GPT-5.5, plus einen Vorteil bei der Token-Effizienz.
Was die Benchmarks nicht zeigen, ist genauso wichtig. Es gibt keine veröffentlichte maximale Ausgabe-Token-Grenze, keine angegebene Wissens-Cutoff, keine bestätigte Modalitätenliste. Das Kontextfenster wird von einer Quelle als etwa 1,5 Mio. Tokens angegeben und von einer anderen als „nicht spezifiziert“, behandeln Sie es also als unbestätigt.
Das Urteil: Warten oder weitermachen
Hier ist die ehrliche Einschätzung.
Warten Sie, wenn: Ihre Kernarbeitslast agentische Codierung, lange Terminalsitzungen oder defensive Sicherheit umfasst und Sie einige Wochen warten können. Der Vorsprung bei Terminal-Bench, das Ergebnis von Agent’s Last Exam und die Token-Effizienz von ExploitBench weisen alle auf genau dieses Profil hin. Wenn ein paar Prozentpunkte bei diesen Aufgaben Ihre Wirtschaftlichkeit verändern, lohnt es sich, Sol genau zu beobachten. Achten Sie auf die allgemeine Verfügbarkeit und, noch wichtiger, auf unabhängige Benchmarks, die die Einführungswerte bestätigen oder entkräften.
Warten Sie nicht, wenn: Sie jetzt ein Modell in Produktion benötigen oder Ihre Arbeit kürzere Anfrage-Antwort-Codierung, Chat, Zusammenfassung oder Klassifizierung ist. Sie können Sol heute ohnehin nicht bekommen, die Modell-IDs sind noch nicht einmal veröffentlicht, und die Alternativen, die Sie jetzt ausführen können, schließen den Großteil der Lücke bei der täglichen Arbeit. Auf die Auslieferung eines gesperrten Modells zu warten, bevor Sie ein Problem beheben, das Sie heute haben, ist die falsche Entscheidung. Der klügere Schritt ist, ein Spitzenmodell zu wählen, das Sie tatsächlich nutzen können; unsere Übersicht über die Spitzenmodelle, die Sie heute verwenden können, ordnet jedes Modell der Aufgabe zu, für die Sol beworben wird.
Noch ein ehrlicher Hinweis: Selbst wenn die allgemeine Verfügbarkeit eintritt, wird die erste Welle GPT-5.6 über die gesamte Stufenpalette hinweg umfassen, einschließlich Terra und Luna, nicht nur Sol. Terra ist als etwa zweimal günstiger als GPT-5.5 mit ähnlicher Leistung positioniert, was die Stufe ist, die die meisten Teams letztendlich nutzen werden. „Auf Sol warten“ könnte also wirklich bedeuten, auf die Auswahl der richtigen Stufe zu warten, und das ist eine ruhigere Entscheidung, als die Benchmark-Schlagzeilen andeuten.
Wo Apidog passt, während Sie warten
Sie können Sol noch nicht testen. Sie können in der Zwischenzeit alles testen, wonach Sie sonst greifen würden. Mythos 5, GPT-5.5, Gemini und der Rest stellen alle OpenAI-kompatible oder Standard-HTTP-APIs bereit, und Sie können diese steuern, deren Antworten überprüfen und das Verhalten heute in Apidog vergleichen. Richten Sie eine Anfrage ein, richten Sie sie an den Endpunkt jedes Modells, und Sie haben ein wiederholbares Gerüst für die Entscheidung, um die es in diesem Artikel geht.

Dieses Gerüst ist auch Ihre Startklarheit für Sol. Am Tag, an dem Sie Ihren Vorschaulink erhalten oder die allgemeine Verfügbarkeit beginnt, tauschen Sie den Endpunkt und die Modell-ID aus und führen dieselben Szenarien aus, die Sie bereits erstellt haben. Keine neuen Tools, kein Durcheinander. Laden Sie Apidog herunter, um diese Tests für die Modelle zu erstellen, die Sie jetzt verwenden können, damit Sie bereit sind, sobald das eingeschränkte Modell verfügbar wird.
Fazit
Die Benchmarks von GPT-5.6 Sol sind stark, insbesondere bei den agentischen und Sicherheitsaufgaben, für die es optimiert wurde, und sie sind immer noch nur Behauptungen unter einer staatlichen Sperre, die Sie heute nicht passieren können. Warten Sie, wenn dieses Spitzenprofil Ihre Aufgabe ist und Sie ein paar Wochen warten können. Andernfalls fahren Sie mit einem Modell fort, das Sie jetzt einsetzen können, und kehren Sie zu Sol zurück, wenn es unabhängige Zahlen und einen öffentlichen Endpunkt erhält.
Erstellen Sie Ihr Evaluierungsgerüst für die Modelle, die Sie heute in Apidog verwenden können, damit Sie bereit sind, Sol am Tag Ihres Zugangs zu testen.
