Wenn Sie am 22. September 2026 gpt-6-sol in einem Changelog sahen und annahmen, es handele sich um das GPT-5.6 Sol, das Sie bereits integriert hatten, dann halten Sie inne. Es ist nicht dasselbe Modell. OpenAI hat den Tiernamen wiederverwendet und ein neues Modell darunter veröffentlicht, das mit ähnlichen Methoden wie GPT-6 Astra trainiert wurde, zu einem anderen Preis, mit einem anderen Kontextfenster und einem anderen Benchmark-Profil.
Diese Namensentscheidung wird Teams Geld und Debugging-Stunden kosten. Dieser Artikel behandelt, was GPT-6 Sol tatsächlich ist: die Modell-ID, was es kostet, die von OpenAI veröffentlichten Zahlen, die eine Messung, die bereits veraltet ist, und wo Sie es heute aufrufen können.
GPT-6 Sol auf einen Blick
| Element | Wert |
|---|---|
| API-Modell-ID | gpt-6-sol |
| Eingabepreis | $2 pro Million Tokens |
| Ausgabepreis | $10 pro Million Tokens |
| Gecachte Eingabelesevorgänge | 90% Rabatt |
| Kontextfenster | 872.000 Tokens |
| Artificial Analysis Intelligenz-Index | 48 |
| Angekündigt | 22. September 2026, zusammen mit GPT-6 Luna |
| Verfügbar in | ChatGPT Work und Codex, plus der API |
| Nicht verfügbar in | Chat, zum Startzeitpunkt |
Zum Vergleich innerhalb derselben Familie: GPT-6 Astra kostet 10 $/50 $ und GPT-6 Luna 0,10 $/0,50 $ mit einem 1M Kontextfenster und einem Index von 37. OpenAIs eigene Aussage ist, dass Astra „weiterhin unser bestes Modell über alle Bereiche hinweg ist“, daher ist Sol nicht das Flaggschiff. Es ist die Stufe, bei der die Kosten pro Aufgabe verschoben wurden.
Es ist ein neues Modell, keine umbenannte Stufe
Die GPT-5.6 Familie bestand aus Sol, Terra und Luna. Die GPT-6 Familie besteht aus Astra, Sol und Luna. Zwei Namen wurden übernommen, einer nicht, und einer ist neu.

Es gibt kein GPT-6 Terra. Wenn Sie eine Stufenleiter um das GPT-5.6 Namensschema herum aufgebaut haben, ist die mittlere Sprosse verschwunden und die verbleibenden Sprossen sitzen auf unterschiedlichen Höhen. Unser älterer Vergleich von Sol gegen Terra und Luna beschreibt die vorherige Generation und sollte als Geschichte gelesen werden.
Die Preishistorie macht den Bruch offensichtlich:
| Stufe | GPT-5.6 Listenpreis | GPT-5.6 Aktionspreis | GPT-6 Preis |
|---|---|---|---|
| Sol | $5 / $30 | $4 / $20 | $2 / $10 |
| Terra | $2.50 / $15 | $2 / $12 | kein GPT-6 Terra |
| Luna | $1 / $6 | $0.20 / $1.20 | $0.10 / $0.50 |
Die Preise verstehen sich pro Million Eingabe-Tokens und pro Million Ausgabe-Tokens. Die GPT-5.6 Listen- und Aktionspreisreihen stammen aus unserer damaligen Berichterstattung: GPT-5.6 Preise und die GPT-5.6 Preissenkung.
Was „50% billiger“ tatsächlich bedeutet
OpenAI beschreibt Sol und Luna als 50 % billiger als die **Aktionspreise** von GPT-5.6. Das Wort „Aktionspreise“ stammt von OpenAI, und es ist wichtig. Der Vergleich erfolgt mit einem reduzierten Tarif, nicht mit dem Listenpreis, mit dem GPT-5.6 eingeführt wurde.
Gemessen am GPT-5.6 Sol Listenpreis von 5 $/30 $ stellt GPT-6 Sol mit 2 $/10 $ eine Reduzierung um 60 % bei der Eingabe und 67 % bei der Ausgabe dar. Die tatsächliche Reduzierung ist größer als die Schlagzeile, und die Schlagzeile basiert auf einem Rabatt. Beide Aussagen treffen gleichzeitig zu, und Sie möchten die zweite in Ihrem Budgetmodell haben, nicht die erste.
Eine Sache, die sich nicht geändert hat, ist, dass ein günstigerer Preis pro Token nicht automatisch zu einer günstigeren Rechnung führt. Schlussfolgernde Modelle verbrauchen Ausgabe-Tokens für Denkprozesse. Ein Modell, das pro Token nur halb so viel kostet und dreimal so lange denkt, ist keine Ersparnis. Deshalb führte OpenAI seine Startzahlen mit den Kosten pro Aufgabe statt mit den Kosten pro Token an.
Die veröffentlichten Benchmarks
Jede der untenstehenden Zahlen stammt aus dem Launch-Material von OpenAI. Die Einstellung für den Denkaufwand steht in Klammern, da diese Modelle bei unterschiedlichen Anstrengungsstufen sehr unterschiedlich abschneiden, und eine Benchmark-Zeile ohne ihre Anstrengungseinstellung ist keine brauchbare Zahl.
| Benchmark | GPT-6 Sol | Vergleichspunkt |
|---|---|---|
| AutomationBench 1.0.6 | 33.2% (xhigh) für $0.27 pro Aufgabe | GPT-6 Astra (low) 30.3% zu 3,9-fachen Kosten von Sol; Claude Opus 5 (max) 26.9% zu 11,1-fachen Kosten von Sol |
| Agents’ Last Exam V1 | 56.4% (max) | Über dem besten Ergebnis von Claude Opus 5, bei 60 % niedrigeren Kosten pro Aufgabe |
| DeepSWE 1.1 | 68.8% (max) | Innerhalb von 1,1 Punkten von Claude Fable 5 bei xhigh (69,9 %), etwa 80 % billiger pro Aufgabe |
| OSWorld 2.0 offline | 60.5% (xhigh) | Claude Opus 5 (medium) 60.3%, etwa 80 % billiger pro Aufgabe |
Das Muster ist über alle vier hinweg konsistent: Sol liegt bei oder leicht über den Vergleichsmodellen, zu einem Bruchteil der Kosten pro Aufgabe. Auf AutomationBench schlägt Sol bei xhigh Claude Opus 5 bei max für 9 % der Kosten pro Aufgabe von Opus 5. Ein Claude Fable 5.1 Setup mit einem Opus 5 Fallback erreicht 31,4 %, unter Sol, bei mehr als dem 8,9-fachen der Kosten.
OpenAI gibt außerdem an, dass Sol etwa halb so viele faktische Fehler macht wie sein Vorgänger.
Der Vergleich, der am Starttag abgelaufen ist
Lesen Sie diese Tabelle noch einmal und beachten Sie, mit welchem Claude-Modell sie verglichen wird. Claude Opus 5.
Anthropic veröffentlichte Claude Opus 5.5 am selben Tag, zu 4 $/20 $ gegenüber Opus 5’s 5 $/25 $, und es belegte den ersten Platz unter den 212 Modellen, die im Artificial Analysis Intelligence Index gelistet sind, mit einem Score von 58. OpenAIs Launch-Beitrag wurde geschrieben, bevor dieses Modell existierte, sodass jede Zeile „schlägt Opus 5 zu 9 % der Kosten“ gegen ein Modell gemessen wird, das innerhalb von Stunden überholt wurde.
Das macht OpenAIs Zahlen nicht falsch. Sie sind genau für den Vergleich, den sie durchgeführt haben. Es bedeutet jedoch, dass Sie sie nicht in ein Beschaffungsdeck für 2027 als aktuellen Stand der Dinge aufnehmen sollten. Wenn Sie eine Antwort zu Sol versus Opus 5.5 benötigen, hat noch niemand eine veröffentlicht, und die in sozialen Medien kursierenden direkten Vergleichszahlen stammen von einzelnen Testern und nicht von einem der Anbieter.
Unser Preis-Kriegs-Pfeiler verfolgt alle drei Starts in einer Tabelle.
Das günstige Modell ist nicht das schnelle Modell
Drittanbieter-Messungen von Artificial Analysis beziffern GPT-6 Sol auf 115,2 Ausgabe-Tokens pro Sekunde mit einer **Time to First Token von 102,15 Sekunden** in seiner maximalen Denk-Konfiguration. GPT-6 Luna, das günstigere Modell, misst langsamer bis zum ersten Token mit 124,23 Sekunden.
Zwei Vorbehalte, bevor Sie mit diesen Zahlen planen. Sie stammen von Drittanbietern, nicht vom Hersteller veröffentlicht. Und sie gelten speziell für die Varianten mit maximalem Denkaufwand, was die teuerste Einstellung im Betrieb und die langsamste in der Reaktion ist. Geringere Anstrengungsstufen verhalten sich anders, und OpenAI hat keine eigenen Latenzzahlen veröffentlicht.
Selbst mit beiden Vorbehalten ist die Form des Ergebnisses das, was man verstehen muss. Eine Wartezeit von 102 Sekunden, bevor der erste Token eintrifft, ist keine Lücke, die Ihre bestehende Timeout-Konfiguration wahrscheinlich überleben wird. Standard-HTTP-Client-Timeouts liegen bei 30 oder 60 Sekunden. Load Balancer laufen in den Leerlauf. Serverless-Funktionen erreichen ihre Ausführungsgrenze. Wenn Sie einen synchronen Endpunkt von GPT-5.6 Sol auf GPT-6 Sol bei hohem Aufwand umstellen, liegt die Integrationsarbeit in Ihrer Timeout- und Streaming-Schicht, nicht im Prompt.
Es lohnt sich, dies selbst zu messen, anstatt uns oder Artificial Analysis zu vertrauen. In Apidog können Sie eine Anfrage an den OpenAI-Endpunkt richten, die Modell-ID als Umgebungsvariable festlegen, sodass eine Sammlung jede Stufe abdeckt, und die Antwortzeit direkt aus jedem Lauf ablesen. Erstellen Sie dieselbe Anfrage dreimal auf drei verschiedenen Anstrengungsstufen, speichern Sie sie als Testszenario, und Sie haben in etwa zehn Minuten Ihre eigene Latenztabelle für Ihre eigenen Prompts. Diese Zahl ist diejenige, aus der Ihre Timeout-Konfiguration erstellt werden sollte.
Prompt-Caching erhielt eine echte Veröffentlichung
Zusammen mit den Modellen veröffentlichte OpenAI Änderungen am Caching, die für jeden, der Agenten betreibt, wichtiger sind als der Schlagzeilenpreis:
- 90% Rabatt auf gecachte Eingabelesevorgänge. Bei 2 $ Eingabe kostet ein gecachter Lesevorgang 0,20 $ pro Million Tokens.
- **Standardmäßig höhere Cache-Trefferraten**, ohne Codeänderung.
- **Änderungen des Denkaufwands oder der Werkzeugverfügbarkeit unterbrechen den Cache nicht mehr.** Zuvor führte das Erhöhen des Aufwands mitten im Gespräch zur Invalidierung des gecachten Präfixes.
- **Explizite Breakpoints**, sodass Sie wählen, wo ein gecachtes Präfix endet, anstatt zu raten.
- **Ein Prompt-Caching-Dashboard und ein Diagnose-Tool**, damit die Trefferquote nicht mehr unsichtbar ist.
GitHub meldet mehr als 50 % weniger Prompt-Tokens, die über Milliarden von Anfragen hinweg neu verarbeitet werden müssen. Bei einem Kontextfenster von 872.000 Tokens ist der Unterschied zwischen einer Trefferquote von 20 % und 80 % der Unterschied zwischen einem brauchbaren Agentenprodukt und einem, das Sie leise einstellen.
Die Änderung des Aufwands und der Werkzeugverfügbarkeit ist der stille Trumpf. Agenten-Schleifen erhöhen routinemäßig den Aufwand, wenn eine Aufgabe schwierig wird, und wechseln die Werkzeugsätze zwischen Planungs- und Ausführungsschritten. Unter dem alten Verhalten warfen beide Schritte den Cache genau dann weg, wenn der Kontext am längsten war.
Wo Sie es heute aufrufen können
| Oberfläche | GPT-6 Sol |
|---|---|
| API | Ja, Modell-ID gpt-6-sol |
| ChatGPT Work | Ja, für Plus, Pro, Business, Enterprise und Edu |
| Codex | Ja, für Plus, Pro, Business, Enterprise und Edu |
| Chat | Noch nicht |
| Kostenlose und Go-Stufen | GPT-6 Luna in der Desktop-App |
Die Lücke im Chat ist die, die Leute stolpern lässt. Wenn Sie normalerweise einen Prompt in der ChatGPT-Benutzeroberfläche für Endverbraucher überprüfen, bevor Sie ihn in Code integrieren, werden Sie GPT-6 Sol dort nicht finden. Verwenden Sie Codex oder gehen Sie direkt zur API.
Ein minimaler Aufruf sieht so aus:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-sol",
"input": "Summarize the breaking changes in this OpenAPI diff.",
"reasoning": { "effort": "high" }
}'
Bestätigen Sie die Anfragenstruktur mit der aktuellen Modellreferenz von OpenAI, bevor Sie sie verwenden. Die Modell-ID ist der Teil, den wir überprüft haben.
Was Ihnen das wert ist
Eine Zahl aus OpenAIs Einführung gibt einen Hinweis darauf, an wen sich diese Preisgestaltung richtet: Der durchschnittliche OpenAI-Forscher gibt über 600 $ pro Tag für Codierungsagenten aus, und das 90. Perzentil gibt 7.000 $ pro Tag aus. In diesem Umfang ist eine Reduzierung der Kosten pro Aufgabe um 80 % ein Budgetposten, kein Rundungsfehler.
Für die meisten Teams ist die Berechnung kleiner und spezifischer:
| Kommt von | Argumente für GPT-6 Sol |
|---|---|
| GPT-5.6 Sol | 60 % Rabatt auf Eingabe und 67 % auf Ausgabe gegenüber dem Listenpreis, und bessere Faktentreue. Zuerst testen, die Ausgaben werden sich unterscheiden. |
| GPT-6 Astra | 10 $/50 $ herunter auf 2 $/10 $, und Sol bei xhigh schlug Astra bei low auf AutomationBench. Aber OpenAI bezeichnet Astra immer noch als sein bestes Modell über alle Bereiche hinweg, also halten Sie Astra für die schwierigsten Aufgaben bereit. |
| Claude Opus 5 | OpenAIs Zahlen bevorzugen Sol stark. Diese Zahlen stammen vor Opus 5.5 zu 4 $/20 $, führen Sie den Vergleich also selbst erneut durch. |
| GPT-6 Luna | Luna ist 20-mal günstiger mit 0,10 $/0,50 $ und einem größeren 1M Fenster. Wenn Ihre Arbeitslast ein hohes Volumen hat und nicht anspruchsvoll ist, beginnen Sie dort. |
Egal welchen Weg Sie einschlagen, der Wechsel ist eine Verhaltensänderung, keine Konfigurationsänderung. Derselbe Prompt, neues Modell, unterschiedliche Ausgaben. Führen Sie Ihre bestehende API-Testsuite gegen die neue Modell-ID aus, bevor Sie den Produktionsverkehr darauf leiten, und prüfen Sie das Antwortschema und die Latenz, nicht nur einen 200-Statuscode. Das ist genau der Unterschied zwischen einem Modell, das gut in Benchmarks abschneidet, und einem Modell, das in Ihrem Stack funktioniert.
