OpenAI veröffentlichte GPT-6 Astra am 3. September 2026, zunächst für eine begrenzte Anzahl von Organisationen und dann, in den folgenden Tagen, für jeden ChatGPT Plus-, Pro-, Business- und Enterprise-Nutzer, die OpenAI API, Microsoft Azure und AWS Bedrock. Die Modell-ID ist gpt-6-astra, es verfügt über ein Kontextfenster von 1.050.000 Token, und OpenAI bezeichnet es als „das beste Modell für Software-Engineering bis heute“. Es ist auch das erste Modell, das OpenAI für seine Cybersicherheitsfähigkeit als kritisch eingestuft hat, was sein Verhalten in der API prägt.
Dies ist der praktische Leitfaden. Er behandelt die Modell-ID und Endpunkte, Ihre erste Anfrage, die fünf Stufen des Denkaufwands, die vollständige Preistabelle einschließlich der Raten für langen Kontext und den Fast-Modus, die Änderungen, die eine GPT-5.6 Sol-Integration aufbrechen, und ob der 2,5-fache Preis gegenüber dem Werbetarif von Sol genug Mehrwert bietet. Die OpenAI-Modellseite ist die maßgebliche Quelle für die unten stehenden Zahlen. Wie es sich anfühlt, damit zu arbeiten, lesen Sie in unserem zweitägigen Praxistest; dieser Beitrag konzentriert sich auf die API.
Kurz gesagt (TL;DR)
- Modell-ID
gpt-6-astra, ein Snapshot. Chat Completions, Responses und Batch. Kein Realtime, keine Assistants, kein Fine-Tuning. Tool-Calling erfordert die Responses API. - Kontext von 1.050.000 Token, maximale Ausgabe von 128.000, Wissensstichtag 30. April 2026. Text und Bild als Eingabe, Text als Ausgabe.
- Standardpreise: 10 $ Eingabe, 1 $ zwischengespeicherte Lesung, 12,50 $ Cache-Schreibvorgang, 50 $ Ausgabe pro Million Token. Prompts über 272.000 Eingabe-Token werden mit 20 $ / 2 $ / 75 $ abgerechnet. Batch und Flex sind halb so teuer. Fast-Modus ist doppelt so teuer.
- Denkaufwand (Reasoning effort):
low,medium,high,xhigh,max.noneundminimalsind entfallen. - Bruch mit Sol:
temperature,top_pund Logprobs wurden entfernt;prompt_cache_retentionwird zuprompt_cache_options.ttl. - GPT-5.6 Sol kostet im Aktionszeitraum bis mindestens 21. November 2026 4 $ / 20 $, daher kostet Astra 2,5-mal so viel auf beiden Seiten.
GPT-6 Astra auf einen Blick
| Punkt | Wert |
|---|---|
| Modell-ID | gpt-6-astra |
| Kontextfenster | 1.050.000 Token |
| Max. Ausgabe | 128.000 Token |
| Wissensstichtag | 30. April 2026 |
| Modalitäten | Eingabe: Text, Bild. Ausgabe: Text |
| Endpunkte | Chat Completions, Responses, Batch |
| Nicht unterstützt | Realtime, Assistants, Fine-Tuning |
| Funktionen | Streaming, strukturierte Ausgaben, Funktionsaufrufe, Dateisuche, Websuche, Prompt-Caching, Bildeingabe |
| Integrierte Tools | Computernutzung, Websuche, Dateisuche, Code-Interpreter, Bilderzeugung |
| Denkaufwand | low, medium, high, xhigh, max |
| Ratenbegrenzungen (Stufe 5) | 15.000 RPM, 40.000.000 TPM |
| Auch verfügbar auf | Microsoft Azure, AWS Bedrock; OpenRouter als openai/gpt-6-astra |
| Datenverarbeitung | Zero Data Retention für berechtigte API-Kunden |
In Enterprise-Workspaces ist Astra standardmäßig deaktiviert; ein Administrator muss es aktivieren. Auf ChatGPT wird die Astra-Nutzung vom bestehenden Abonnementguthaben abgezogen, und Pro-, Business- und Enterprise-Pläne erhalten ebenfalls GPT-6 Astra Pro.

Ihre erste Anfrage
Die Responses API ist die primäre Oberfläche und für Tools erforderlich. Ein minimaler Python-Aufruf:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
reasoning={"effort": "medium"},
input=[
{"role": "developer", "content": "You are a senior API engineer. Bias towards action. Ask only when the answer would change the result."},
{"role": "user", "content": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."},
],
)
print(response.output_text)
print(response.usage)
Die gleiche Anfrage in curl:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."
}'
Chat Completions funktioniert weiterhin für Klartext: Tauschen Sie den Endpunkt und die Nachrichtenform aus und entfernen Sie alle temperature- oder top_p-Felder, die laut OpenAI-Anleitung zu entfernen sind. Sobald Sie Funktionsaufrufe oder ein integriertes Tool benötigen, wechseln Sie zu Responses. Unser Leitfaden zur Responses API behandelt die Anforderungsform ausführlich.
Die Entwickler-Nachricht ist wichtiger als zuvor. Die Modell-Anleitung von OpenAI besagt, dass Astra „bereitwilliger um Klärung bittet“ als seine Vorgänger und empfiehlt, es anzuweisen, eine Tendenz zur Handlung zu zeigen. Es ist auch „empfindlicher gegenüber Anweisungen in Skills“ und anderen angehängten Dateien, daher geben Sie an, dass Benutzeranweisungen bei Konflikten Vorrang haben. Und es greift standardmäßig auf Listen und Tabellen zurück; wenn Sie Prosa wünschen, fragen Sie danach.
Denkaufwand: fünf Stufen, kein „none“
GPT-5.6 bot sechs Aufwandsstufen von none bis max. Astra bietet fünf: low, medium, high, xhigh und max. OpenAIs Migrationsratschlag ist direkt: Wenn Sie heute none oder minimal verwenden, wechseln Sie zu low und bewerten Sie. Alles andere behält seine aktuelle Einstellung bei.
Diese Entfernung ändert das günstigere Ende Ihrer Arbeitslast. Luna bei none war die schnelle Option für klassische Vervollständigungen in der GPT-5.6-Familie, und es gibt kein Astra-Äquivalent. Astra ist bei jeder Einstellung ein Denkmodell, weshalb die Weiterleitung mechanischer Arbeiten an GPT-5.6 Terra oder Luna und die Reservierung von Astra für die schwierigen Aufrufe weiterhin das vernünftige Muster ist.
Am anderen Ende ist max der Bereich, in dem die Start-Benchmarks durchgeführt wurden („Evaluierungsergebnisse sind das Maximum bei jedem Aufwand“) und wo Artificial Analysis eine Zeit bis zum ersten Token von über sieben Minuten bei seinem Max-Effort-Lauf gemessen hat. Planen Sie Latenzzeiten ein, bevor Sie Token budgetieren.
Was GPT-6 Astra kostet
Pro Million Token, von OpenAIs Preisseite:
| Stufe | Eingabe | Zwischengespeicherte Eingabe | Ausgabe |
|---|---|---|---|
| Standard | 10,00 $ | 1,00 $ | 50,00 $ |
| Standard, langer Kontext (über 272.000 Eingabe-Token) | 20,00 $ | 2,00 $ | 75,00 $ |
| Batch / Flex | 5,00 $ | 0,50 $ | 25,00 $ |
| Batch, langer Kontext | 10,00 $ | 1,00 $ | 37,50 $ |
| Schneller Modus | 20,00 $ | 2,00 $ | 100,00 $ |
| Schneller Modus, langer Kontext | 40,00 $ | 4,00 $ | 150,00 $ |
Cache-Schreibvorgänge werden mit 12,50 $ pro Million abgerechnet. Der Fast-Modus liefert „bis zu 2-fache Geschwindigkeit der Standardverarbeitung zum doppelten Standardpreis.“
Zum Vergleich, die aktuelle GPT-5.6-Familie:
| Modell | Eingabe | Zwischengespeicherte Eingabe | Ausgabe |
|---|---|---|---|
| GPT-5.6 Sol (Aktion bis mindestens 21. Nov. 2026) | 4,00 $ | 0,40 $ | 20,00 $ |
| GPT-5.6 Terra | 2,00 $ | 0,20 $ | 12,00 $ |
| GPT-5.6 Luna | 0,20 $ | 0,02 $ | 1,20 $ |
Sols Listenpreis beträgt 5 $ und 30 $; der Tarif von 4 $ und 20 $ gilt seit dem 21. August und OpenAI sagt, er gelte mindestens bis zum 21. November. Im Vergleich dazu ist Astra 2,5-mal so teuer bei der Eingabe und 2,5-mal so teuer bei der Ausgabe. Im Vergleich zu Sols Listenpreis ist es 2-mal und 1,67-mal so teuer.
Ein Rechenbeispiel. Ein Agentenlauf, der einen 200.000-Token-Codebase-Snapshot einmal liest, ihn als zwischengespeichertes Präfix über 30 Aufrufe wiederverwendet und insgesamt 60.000 Token ausgibt:
- Astra: 2,00 $ für die erste Lesung, dann 29 zwischengespeicherte Lesungen zu je 0,20 $ (5,80 $), plus 3,00 $ Ausgabe. Insgesamt etwa 10,80 $.
- Sol im Aktionszeitraum: 0,80 $ für die erste Lesung, 2,32 $ für die zwischengespeicherten Lesungen, 1,20 $ Ausgabe. Insgesamt etwa 4,32 $.
Das Verhältnis bleibt bei 2,5x. Was OpenAI argumentiert und was Sie messen sollten, ist, dass Astra in weniger Aufrufen und mit weniger Ausgabetoken fertig wird. Auf Terminal-Bench 4.0 beansprucht es etwa 9 % geringere Kosten pro Aufgabe als Sol, trotz des höheren Tarifs, und etwa 65 % weniger Ausgabetoken als Claude Opus 5 bei Agents’ Last Exam. Wenn das für Ihre Arbeitslast zutrifft, kann die Rechnung pro Aufgabe gleich bleiben. Wenn nicht, zahlen Sie 2,5x.
Zwei Hebel halten die Rechnung niedrig. Die 272K-Schwelle ist die zu beachtende: Ein Prompt, der diese überschreitet, verdoppelt die Eingabe- und Cache-Raten, also kürzen Sie Tool-Ausgaben und cachen Sie das statische Präfix. Und Batch halbiert alles für Arbeiten, die warten können.
Migration von GPT-5.6 Sol: Was bricht
OpenAI veröffentlichte eine kurze Liste, die man wörtlich nehmen sollte.
- Sampling-Parameter sind entfallen. Entfernen Sie
temperature,top_pundtop_logprobs. Bei Chat Completions entfernen Sie auchlogprobs; bei Responses entfernen Siemessage.output_text.logprobsausinclude. OpenAIs Empfehlung ist, sie zu entfernen, anstatt sich darauf zu verlassen, dass die API sie ignoriert, also durchsuchen Sie Ihren Client-Code. - Der Aufwands-Mindestwert ist
low. Jede Einstellung vonnoneoderminimalwird auflowumgestellt. - Die Cache-Beibehaltung hat sich geändert. Ersetzen Sie
prompt_cache_retentiondurchprompt_cache_options.ttl, eingestellt auf"30m". Der explizite Caching-Modus, den Sie für GPT-5.6 eingerichtet haben, wird ansonsten übernommen. - Tools benötigen Responses. Chat Completions wird für Text unterstützt, aber Funktionsaufrufe und die integrierten Tools befinden sich in der Responses API.
- Prompts wünschen weniger Absicherung von Ihnen und mehr von sich selbst. Fügen Sie die Zeile „bias towards action“ hinzu, erklären Sie, dass Benutzeranweisungen Vorrang vor Skill-Dateien haben, und fordern Sie Prosa an, wo Ihre Benutzeroberfläche Prosa erwartet.
Nichts in der Liste betrifft strukturierte Ausgaben oder Funktionsdefinitionen, sodass ein Schema, das auf Sol funktionierte, auch auf Astra funktioniert. Die Verhaltensänderung, die die meisten Teams zuerst bemerken, ist das Nachfragen: Ein Sol-Prompt, der bis zur Fertigstellung lief, kann jetzt mit einer klärenden Frage stoppen. Beantworten Sie diese von vornherein in der Entwicklernachricht, und es hört auf zu fragen.
Ist es 2,5x Sol wert?
Für agentische und Langkontext-Arbeiten sagen die Startzahlen ja. Alle untenstehenden Zahlen stammen von OpenAI, beim besten Aufwand für jedes Modell:
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57,9 % | 37,3 % | 55,8 % |
| DeepSWE v1.1 | 74,1 % | 72,7 % | 67,4 % |
| FrontierCode 1.1 Extended | 64,5 % | 60,6 % | 63,6 % |
| Interne Datenbankmigrationsaufgaben | 63,9 % | 42,7 % | 57,8 % |
| OSWorld 2.0 | 72,6 % | 65,7 % | - |
| MRCR v2 8-Nadel, 512K bis 1M | 96,3 % | 73,8 % | - |
| GPQA Diamond | 96,0 % | 94,6 % | 93,7 % |
| Humanity’s Last Exam (mit Tools) | 57,2 % | - | 65,0 % |
Die Lücken bei Terminal-Bench und Datenbankmigration sind die, die für Entwickler wichtig sind: 20 Punkte Vorsprung vor Sol bei agentischen Terminalaufgaben und ein Langkontext-Retrieval-Score, der das 1M-Fenster nutzbar statt nominell macht. Der DeepSWE-Abstand ist gering, und Claude Fable 5.1 führt immer noch bei Humanity’s Last Exam mit fast acht Punkten, es ist also kein klarer Sieg. Auf dem unabhängigen Index von Artificial Analysis liegt Astra an zweiter Stelle unter 202 Modellen. Unsere Fable 5.1 Benchmark-Aufschlüsselung enthält die andere Seite dieses Vergleichs.
Wo Sol seinen Job behält: kurze, volumenstarke Aufrufe, bei denen der Aufwandsmindestwert und die 2,5-fache Rate dominieren, und alles, was eine Latenz im none-Stil erfordert. Wo Astra es verdient: lange Agentenläufe, ganzes Repository als Kontext, Computernutzung und jede Aufgabe, bei der Sols Fehlermodus ein Abschweifen oder Aufgeben war.
Testen Sie den Wechsel, bevor Sie ihn bereitstellen
Die Migration ist klein genug, um sie an einem Nachmittag durchzuführen, und bedeutend genug, um sie zu messen. In Apidog behalten Sie die Modell-ID als Umgebungsvariable bei, sodass dieselbe gespeicherte Anfrage mit einem Schalter gegen gpt-5.6-sol und gpt-6-astra ausgeführt wird. Fügen Sie Behauptungen zu usage.input_tokens, usage.output_tokens und der Anzahl der gecachten Token hinzu, senden Sie dann einen repräsentativen Aufgabensatz durch beide und vergleichen Sie die Gesamtergebnisse; das ist die 2,5-fache Frage, beantwortet mit Ihrem eigenen Traffic anstelle einer Startgrafik.
Zwei weitere Prüfungen gehören in dasselbe Projekt. Senden Sie eine Anfrage, die noch temperature enthält, und notieren Sie, was zurückkommt, damit Sie das Verhalten in einem Test und nicht in der Produktion lernen. Und stellen Sie sicher, dass ein langer Prompt unter 272K Eingabetoken bleibt, denn das Überschreiten dieser Grenze verdoppelt stillschweigend die Rate. Planen Sie den Satz als Regression ein und laden Sie Apidog herunter, falls Sie es noch nicht haben; der GPT-5.6 API-Leitfaden zeigt dasselbe Setup der vorherigen Generation.
FAQ
Wie lautet die GPT-6 Astra Modell-ID? gpt-6-astra, mit einem einzigen Snapshot. Es wird auch über Azure und AWS Bedrock sowie auf OpenRouter als openai/gpt-6-astra bereitgestellt.
Unterstützt GPT-6 Astra Fine-Tuning oder die Realtime API? Nein. Die Modellseite listet Chat Completions, Responses und Batch als unterstützt auf, während Realtime, Assistants und Fine-Tuning nicht unterstützt werden.
Wie groß ist das Kontextfenster und die maximale Ausgabe? 1.050.000 Eingabe-Token und 128.000 Ausgabe-Token. Prompts über 272.000 Eingabe-Token werden zum Langkontext-Tarif abgerechnet.
Warum ist meine Anfrage nach dem Wechsel von Sol fehlgeschlagen? Höchstwahrscheinlich ein übersehenes temperature oder top_p, ein none-Aufwandslevel oder prompt_cache_retention. Astra hat alle drei entfernt; siehe die Migrationsliste oben.
Kann eine Anfrage von selbst stoppen? Ja. OpenAI führt eine Fehlausrichtungsüberwachung bei Tool-Nutzungsanfragen durch, und in der API stoppt eine markierte Aufgabe, anstatt zur Überprüfung anzuhalten. Lange Agentenläufe sind am stärksten betroffen, machen Sie sie daher wiederaufnehmbar. Der Beitrag zur kritischen Cyber-Schwelle von GPT-6 Astra erläutert die Schutzmaßnahmen hinter diesem Verhalten.
Was diese Woche zu tun ist
Verschieben Sie eine Agenten-Arbeitslast auf gpt-6-astra über die Responses API, entfernen Sie die Sampling-Parameter, stellen Sie den Aufwand auf medium ein und messen Sie Token und Wall-Time im Vergleich zu Sol bei denselben Eingaben. Wenn die Kosten pro Aufgabe gleich oder besser ausfallen, migrieren Sie den Rest. Wenn nicht, haben Sie eine Zahl, was mehr ist, als die meisten Teams bis Freitag haben werden.
