GPT-6 Astra für Entwickler: API, Preise, 1M Kontext und Umstellung von GPT-5.6 Sol

GPT-6 Astra API-Leitfaden: Modell-ID gpt-6-astra, $10/$50 Preisgestaltung mit Langzeitkontext, Tarife für Batch- und Fast-Modus, 1,05 Millionen Kontext, fünf Aufwandsstufen und die grundlegenden Änderungen von GPT-5.6 Sol.

Medy Evrard

5 September 2026

GPT-6 Astra für Entwickler: API, Preise, 1M Kontext und Umstellung von GPT-5.6 Sol

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

OpenAI veröffentlichte GPT-6 Astra am 3. September 2026, zunächst für eine begrenzte Anzahl von Organisationen und dann, in den folgenden Tagen, für jeden ChatGPT Plus-, Pro-, Business- und Enterprise-Nutzer, die OpenAI API, Microsoft Azure und AWS Bedrock. Die Modell-ID ist gpt-6-astra, es verfügt über ein Kontextfenster von 1.050.000 Token, und OpenAI bezeichnet es als „das beste Modell für Software-Engineering bis heute“. Es ist auch das erste Modell, das OpenAI für seine Cybersicherheitsfähigkeit als kritisch eingestuft hat, was sein Verhalten in der API prägt.

Dies ist der praktische Leitfaden. Er behandelt die Modell-ID und Endpunkte, Ihre erste Anfrage, die fünf Stufen des Denkaufwands, die vollständige Preistabelle einschließlich der Raten für langen Kontext und den Fast-Modus, die Änderungen, die eine GPT-5.6 Sol-Integration aufbrechen, und ob der 2,5-fache Preis gegenüber dem Werbetarif von Sol genug Mehrwert bietet. Die OpenAI-Modellseite ist die maßgebliche Quelle für die unten stehenden Zahlen. Wie es sich anfühlt, damit zu arbeiten, lesen Sie in unserem zweitägigen Praxistest; dieser Beitrag konzentriert sich auf die API.

Kurz gesagt (TL;DR)

GPT-6 Astra auf einen Blick

Punkt Wert
Modell-ID gpt-6-astra
Kontextfenster 1.050.000 Token
Max. Ausgabe 128.000 Token
Wissensstichtag 30. April 2026
Modalitäten Eingabe: Text, Bild. Ausgabe: Text
Endpunkte Chat Completions, Responses, Batch
Nicht unterstützt Realtime, Assistants, Fine-Tuning
Funktionen Streaming, strukturierte Ausgaben, Funktionsaufrufe, Dateisuche, Websuche, Prompt-Caching, Bildeingabe
Integrierte Tools Computernutzung, Websuche, Dateisuche, Code-Interpreter, Bilderzeugung
Denkaufwand low, medium, high, xhigh, max
Ratenbegrenzungen (Stufe 5) 15.000 RPM, 40.000.000 TPM
Auch verfügbar auf Microsoft Azure, AWS Bedrock; OpenRouter als openai/gpt-6-astra
Datenverarbeitung Zero Data Retention für berechtigte API-Kunden

In Enterprise-Workspaces ist Astra standardmäßig deaktiviert; ein Administrator muss es aktivieren. Auf ChatGPT wird die Astra-Nutzung vom bestehenden Abonnementguthaben abgezogen, und Pro-, Business- und Enterprise-Pläne erhalten ebenfalls GPT-6 Astra Pro.

Ein Bild des OpenAI GPT-6 Astra Modells, das eine blaue, schimmernde Kugel mit komplexen, leuchtenden Linien darstellt, die ein neuronales Netzwerk symbolisieren.

Ihre erste Anfrage

Die Responses API ist die primäre Oberfläche und für Tools erforderlich. Ein minimaler Python-Aufruf:

from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "medium"},
    input=[
        {"role": "developer", "content": "You are a senior API engineer. Bias towards action. Ask only when the answer would change the result."},
        {"role": "user", "content": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."},
    ],
)

print(response.output_text)
print(response.usage)

Die gleiche Anfrage in curl:

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "reasoning": {"effort": "medium"},
    "input": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."
  }'

Chat Completions funktioniert weiterhin für Klartext: Tauschen Sie den Endpunkt und die Nachrichtenform aus und entfernen Sie alle temperature- oder top_p-Felder, die laut OpenAI-Anleitung zu entfernen sind. Sobald Sie Funktionsaufrufe oder ein integriertes Tool benötigen, wechseln Sie zu Responses. Unser Leitfaden zur Responses API behandelt die Anforderungsform ausführlich.

Die Entwickler-Nachricht ist wichtiger als zuvor. Die Modell-Anleitung von OpenAI besagt, dass Astra „bereitwilliger um Klärung bittet“ als seine Vorgänger und empfiehlt, es anzuweisen, eine Tendenz zur Handlung zu zeigen. Es ist auch „empfindlicher gegenüber Anweisungen in Skills“ und anderen angehängten Dateien, daher geben Sie an, dass Benutzeranweisungen bei Konflikten Vorrang haben. Und es greift standardmäßig auf Listen und Tabellen zurück; wenn Sie Prosa wünschen, fragen Sie danach.

Denkaufwand: fünf Stufen, kein „none“

GPT-5.6 bot sechs Aufwandsstufen von none bis max. Astra bietet fünf: low, medium, high, xhigh und max. OpenAIs Migrationsratschlag ist direkt: Wenn Sie heute none oder minimal verwenden, wechseln Sie zu low und bewerten Sie. Alles andere behält seine aktuelle Einstellung bei.

Diese Entfernung ändert das günstigere Ende Ihrer Arbeitslast. Luna bei none war die schnelle Option für klassische Vervollständigungen in der GPT-5.6-Familie, und es gibt kein Astra-Äquivalent. Astra ist bei jeder Einstellung ein Denkmodell, weshalb die Weiterleitung mechanischer Arbeiten an GPT-5.6 Terra oder Luna und die Reservierung von Astra für die schwierigen Aufrufe weiterhin das vernünftige Muster ist.

Am anderen Ende ist max der Bereich, in dem die Start-Benchmarks durchgeführt wurden („Evaluierungsergebnisse sind das Maximum bei jedem Aufwand“) und wo Artificial Analysis eine Zeit bis zum ersten Token von über sieben Minuten bei seinem Max-Effort-Lauf gemessen hat. Planen Sie Latenzzeiten ein, bevor Sie Token budgetieren.

Was GPT-6 Astra kostet

Pro Million Token, von OpenAIs Preisseite:

Stufe Eingabe Zwischengespeicherte Eingabe Ausgabe
Standard 10,00 $ 1,00 $ 50,00 $
Standard, langer Kontext (über 272.000 Eingabe-Token) 20,00 $ 2,00 $ 75,00 $
Batch / Flex 5,00 $ 0,50 $ 25,00 $
Batch, langer Kontext 10,00 $ 1,00 $ 37,50 $
Schneller Modus 20,00 $ 2,00 $ 100,00 $
Schneller Modus, langer Kontext 40,00 $ 4,00 $ 150,00 $

Cache-Schreibvorgänge werden mit 12,50 $ pro Million abgerechnet. Der Fast-Modus liefert „bis zu 2-fache Geschwindigkeit der Standardverarbeitung zum doppelten Standardpreis.“

Zum Vergleich, die aktuelle GPT-5.6-Familie:

Modell Eingabe Zwischengespeicherte Eingabe Ausgabe
GPT-5.6 Sol (Aktion bis mindestens 21. Nov. 2026) 4,00 $ 0,40 $ 20,00 $
GPT-5.6 Terra 2,00 $ 0,20 $ 12,00 $
GPT-5.6 Luna 0,20 $ 0,02 $ 1,20 $

Sols Listenpreis beträgt 5 $ und 30 $; der Tarif von 4 $ und 20 $ gilt seit dem 21. August und OpenAI sagt, er gelte mindestens bis zum 21. November. Im Vergleich dazu ist Astra 2,5-mal so teuer bei der Eingabe und 2,5-mal so teuer bei der Ausgabe. Im Vergleich zu Sols Listenpreis ist es 2-mal und 1,67-mal so teuer.

Ein Rechenbeispiel. Ein Agentenlauf, der einen 200.000-Token-Codebase-Snapshot einmal liest, ihn als zwischengespeichertes Präfix über 30 Aufrufe wiederverwendet und insgesamt 60.000 Token ausgibt:

Das Verhältnis bleibt bei 2,5x. Was OpenAI argumentiert und was Sie messen sollten, ist, dass Astra in weniger Aufrufen und mit weniger Ausgabetoken fertig wird. Auf Terminal-Bench 4.0 beansprucht es etwa 9 % geringere Kosten pro Aufgabe als Sol, trotz des höheren Tarifs, und etwa 65 % weniger Ausgabetoken als Claude Opus 5 bei Agents’ Last Exam. Wenn das für Ihre Arbeitslast zutrifft, kann die Rechnung pro Aufgabe gleich bleiben. Wenn nicht, zahlen Sie 2,5x.

Zwei Hebel halten die Rechnung niedrig. Die 272K-Schwelle ist die zu beachtende: Ein Prompt, der diese überschreitet, verdoppelt die Eingabe- und Cache-Raten, also kürzen Sie Tool-Ausgaben und cachen Sie das statische Präfix. Und Batch halbiert alles für Arbeiten, die warten können.

Migration von GPT-5.6 Sol: Was bricht

OpenAI veröffentlichte eine kurze Liste, die man wörtlich nehmen sollte.

  1. Sampling-Parameter sind entfallen. Entfernen Sie temperature, top_p und top_logprobs. Bei Chat Completions entfernen Sie auch logprobs; bei Responses entfernen Sie message.output_text.logprobs aus include. OpenAIs Empfehlung ist, sie zu entfernen, anstatt sich darauf zu verlassen, dass die API sie ignoriert, also durchsuchen Sie Ihren Client-Code.
  2. Der Aufwands-Mindestwert ist low. Jede Einstellung von none oder minimal wird auf low umgestellt.
  3. Die Cache-Beibehaltung hat sich geändert. Ersetzen Sie prompt_cache_retention durch prompt_cache_options.ttl, eingestellt auf "30m". Der explizite Caching-Modus, den Sie für GPT-5.6 eingerichtet haben, wird ansonsten übernommen.
  4. Tools benötigen Responses. Chat Completions wird für Text unterstützt, aber Funktionsaufrufe und die integrierten Tools befinden sich in der Responses API.
  5. Prompts wünschen weniger Absicherung von Ihnen und mehr von sich selbst. Fügen Sie die Zeile „bias towards action“ hinzu, erklären Sie, dass Benutzeranweisungen Vorrang vor Skill-Dateien haben, und fordern Sie Prosa an, wo Ihre Benutzeroberfläche Prosa erwartet.

Nichts in der Liste betrifft strukturierte Ausgaben oder Funktionsdefinitionen, sodass ein Schema, das auf Sol funktionierte, auch auf Astra funktioniert. Die Verhaltensänderung, die die meisten Teams zuerst bemerken, ist das Nachfragen: Ein Sol-Prompt, der bis zur Fertigstellung lief, kann jetzt mit einer klärenden Frage stoppen. Beantworten Sie diese von vornherein in der Entwicklernachricht, und es hört auf zu fragen.

Ist es 2,5x Sol wert?

Für agentische und Langkontext-Arbeiten sagen die Startzahlen ja. Alle untenstehenden Zahlen stammen von OpenAI, beim besten Aufwand für jedes Modell:

Benchmark GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1
Terminal-Bench 4.0 57,9 % 37,3 % 55,8 %
DeepSWE v1.1 74,1 % 72,7 % 67,4 %
FrontierCode 1.1 Extended 64,5 % 60,6 % 63,6 %
Interne Datenbankmigrationsaufgaben 63,9 % 42,7 % 57,8 %
OSWorld 2.0 72,6 % 65,7 % -
MRCR v2 8-Nadel, 512K bis 1M 96,3 % 73,8 % -
GPQA Diamond 96,0 % 94,6 % 93,7 %
Humanity’s Last Exam (mit Tools) 57,2 % - 65,0 %

Die Lücken bei Terminal-Bench und Datenbankmigration sind die, die für Entwickler wichtig sind: 20 Punkte Vorsprung vor Sol bei agentischen Terminalaufgaben und ein Langkontext-Retrieval-Score, der das 1M-Fenster nutzbar statt nominell macht. Der DeepSWE-Abstand ist gering, und Claude Fable 5.1 führt immer noch bei Humanity’s Last Exam mit fast acht Punkten, es ist also kein klarer Sieg. Auf dem unabhängigen Index von Artificial Analysis liegt Astra an zweiter Stelle unter 202 Modellen. Unsere Fable 5.1 Benchmark-Aufschlüsselung enthält die andere Seite dieses Vergleichs.

Wo Sol seinen Job behält: kurze, volumenstarke Aufrufe, bei denen der Aufwandsmindestwert und die 2,5-fache Rate dominieren, und alles, was eine Latenz im none-Stil erfordert. Wo Astra es verdient: lange Agentenläufe, ganzes Repository als Kontext, Computernutzung und jede Aufgabe, bei der Sols Fehlermodus ein Abschweifen oder Aufgeben war.

Testen Sie den Wechsel, bevor Sie ihn bereitstellen

Die Migration ist klein genug, um sie an einem Nachmittag durchzuführen, und bedeutend genug, um sie zu messen. In Apidog behalten Sie die Modell-ID als Umgebungsvariable bei, sodass dieselbe gespeicherte Anfrage mit einem Schalter gegen gpt-5.6-sol und gpt-6-astra ausgeführt wird. Fügen Sie Behauptungen zu usage.input_tokens, usage.output_tokens und der Anzahl der gecachten Token hinzu, senden Sie dann einen repräsentativen Aufgabensatz durch beide und vergleichen Sie die Gesamtergebnisse; das ist die 2,5-fache Frage, beantwortet mit Ihrem eigenen Traffic anstelle einer Startgrafik.

Zwei weitere Prüfungen gehören in dasselbe Projekt. Senden Sie eine Anfrage, die noch temperature enthält, und notieren Sie, was zurückkommt, damit Sie das Verhalten in einem Test und nicht in der Produktion lernen. Und stellen Sie sicher, dass ein langer Prompt unter 272K Eingabetoken bleibt, denn das Überschreiten dieser Grenze verdoppelt stillschweigend die Rate. Planen Sie den Satz als Regression ein und laden Sie Apidog herunter, falls Sie es noch nicht haben; der GPT-5.6 API-Leitfaden zeigt dasselbe Setup der vorherigen Generation.

FAQ

Wie lautet die GPT-6 Astra Modell-ID? gpt-6-astra, mit einem einzigen Snapshot. Es wird auch über Azure und AWS Bedrock sowie auf OpenRouter als openai/gpt-6-astra bereitgestellt.

Unterstützt GPT-6 Astra Fine-Tuning oder die Realtime API? Nein. Die Modellseite listet Chat Completions, Responses und Batch als unterstützt auf, während Realtime, Assistants und Fine-Tuning nicht unterstützt werden.

Wie groß ist das Kontextfenster und die maximale Ausgabe? 1.050.000 Eingabe-Token und 128.000 Ausgabe-Token. Prompts über 272.000 Eingabe-Token werden zum Langkontext-Tarif abgerechnet.

Warum ist meine Anfrage nach dem Wechsel von Sol fehlgeschlagen? Höchstwahrscheinlich ein übersehenes temperature oder top_p, ein none-Aufwandslevel oder prompt_cache_retention. Astra hat alle drei entfernt; siehe die Migrationsliste oben.

Kann eine Anfrage von selbst stoppen? Ja. OpenAI führt eine Fehlausrichtungsüberwachung bei Tool-Nutzungsanfragen durch, und in der API stoppt eine markierte Aufgabe, anstatt zur Überprüfung anzuhalten. Lange Agentenläufe sind am stärksten betroffen, machen Sie sie daher wiederaufnehmbar. Der Beitrag zur kritischen Cyber-Schwelle von GPT-6 Astra erläutert die Schutzmaßnahmen hinter diesem Verhalten.

Was diese Woche zu tun ist

Verschieben Sie eine Agenten-Arbeitslast auf gpt-6-astra über die Responses API, entfernen Sie die Sampling-Parameter, stellen Sie den Aufwand auf medium ein und messen Sie Token und Wall-Time im Vergleich zu Sol bei denselben Eingaben. Wenn die Kosten pro Aufgabe gleich oder besser ausfallen, migrieren Sie den Rest. Wenn nicht, haben Sie eine Zahl, was mehr ist, als die meisten Teams bis Freitag haben werden.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen