Um die GPT-6.1 Sol API aufzurufen, senden Sie eine POST-Anfrage an https://api.openai.com/v1/responses mit "model": "gpt-6.1-sol" und Ihrem Schlüssel als Bearer-Token. Die Kosten liegen bei denselben 2 $ für Eingaben und 10 $ für Ausgaben pro Million Token wie bei GPT-6 Sol, und die gecachte Eingabe sinkt von 0,20 $ auf 0,10 $. Die Migration von gpt-6-sol ist größtenteils ein String-Austausch. Die bahnbrechende Änderung betrifft den Aufwand: GPT-6.1 Sol akzeptiert weder none noch minimal, daher werden diese Anfragen auf low verschoben, zusammen mit jedem Code, der sich auf none verlassen hat.
OpenAI hat GPT-6.1 Sol am DevDay am 29. September 2026 veröffentlicht. Der DevDay 2026 Rückblick behandelt die anderen Veröffentlichungen, und Was ist GPT-6.1 Sol behandelt die Benchmarks detailliert. Dieser Leitfaden behandelt Ihre erste Anfrage, welches Aufwandsniveau Sie wählen sollten, jede Migrationsänderung, die Batch-, Flex- und Fast-Tiers sowie einen Side-by-Side-Regressionstest beider Modell-IDs in Apidog, bevor Sie den Produktionsverkehr umstellen.
GPT-6 Sol vs. GPT-6.1 Sol: Was sich in der API ändert
Die meisten Spezifikationen sind identisch. Hier ist der vollständige Unterschied von der GPT-6.1 Sol Modellseite, der GPT-6 Sol Modellseite und OpenAIs Anleitung zur GPT-6 Migration:
gpt-6-sol |
gpt-6.1-sol |
Was zu tun ist | |
|---|---|---|---|
| Eingabe / Ausgabe pro 1 Mio. (Standard) | 2 $ / 10 $ | 2 $ / 10 $ | Nichts |
| Gecachte Eingabe pro 1 Mio. | 0,20 $ | 0,10 $ | Ihre Cache-Berechnung erneut ausführen |
| Cache-Schreibvorgänge pro 1 Mio. | 2,50 $ | 2,50 $ | Nichts |
| Kontextfenster / max. Eingabe / max. Ausgabe | 1.050.000 / 922.000 / 128.000 | 1.050.000 / 922.000 / 128.000 | Nichts |
| Wissensstand | 20. April 2026 | 30. April 2026 | Datumsempfindliche Auswertungen erneut prüfen |
reasoning.effort |
none, low, medium (Standard), high, xhigh, max |
low, medium (Standard), high, xhigh, max |
none auf low umstellen und neu bewerten |
| Funktionsaufrufe in Chat Completions | Nur mit reasoning_effort: "none" |
Nicht unterstützt | Tool-Aufrufe nach Responses verschieben |
| Endpunkte | Chat Completions, Responses, Batch | Gleich | Nichts |
| Ratenbegrenzungen | Stufe 1: 500 RPM / 500K TPM; Stufe 5: 15.000 RPM / 40M TPM | Gleich | Nichts |
Die GPT-6 Sol-Seite verweist Leser nun auf GPT-6.1 Sol als „das neuere Sol-Modell“.
Senden Sie Ihre erste GPT-6.1 Sol-Anfrage
Exportieren Sie Ihren Schlüssel als OPENAI_API_KEY und rufen Sie dann die Responses API auf:
curl https://api.openai.com/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-d '{
"model": "gpt-6.1-sol",
"reasoning": {"effort": "medium"},
"input": "List three ways a webhook retry policy can create duplicate orders. One line each."
}'
Das Python SDK liest dieselbe Umgebungsvariable:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "medium"},
input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)
print(response.output_text)
print(response.usage)
Vier Teile der Antwort sind wichtig:
statusistcompletedbei Erfolg. Wenn das Modell das Ausgabebudget überschreitet, erhalten Sieincompletemitincomplete_details.reasonaufmax_output_tokensgesetzt, manchmal bevor sichtbarer Text erscheint. Der Reasoning-Leitfaden schlägt vor, beim Experimentieren mindestens 25.000 Token für Reasoning und Ausgabe zu reservieren.outputist ein Array. Die Antwort ist das Element mittype: "message", dessen Inhaltoutput_textenthält. Lesen Sie es nach Typ, nicht nach Index.usage.output_tokensenthält Reasoning-Token, die zum Ausgabepreis abgerechnet werden.usage.output_tokens_details.reasoning_tokenszeigt an, wie viele.usage.input_tokens_detailsmeldetcached_tokensundcache_write_tokens. Dort zeigt sich der günstigere Cache.
Verwenden Sie die Responses API für alles mit Tools; GPT-6.1 Sol unterstützt Chat Completions nur für Anfragen ohne Tools. Der Leitfaden zur Responses API behandelt die Anfrageform detaillierter.
Wählen Sie ein Reasoning-Aufwandsniveau
Der Aufwand ist Ihr wichtigster Regler für Kosten und Qualität, und medium ist der Standardwert, wenn Sie ihn weglassen. OpenAIs Modellauswahlleitfaden kombiniert medium mit „komplexer technischer Arbeit und koordinierten Ergebnissen, die Sie voraussichtlich überarbeiten werden“, und xhigh mit ausgefeilten Ergebnissen und Entscheidungen, die auf widersprüchlichen Beweisen basieren. OpenAIs Veröffentlichungsbeitrag ergänzt die Ergebnisse nach Einstellung. Diese Benchmarks sind von OpenAI berichtet, und die Tabelle zitiert die Abweichungen, die OpenAI in seinem Text angibt:
| Aufwand | Hier beginnen für | Was OpenAI für GPT-6.1 Sol berichtet |
|---|---|---|
low |
Chat, Extraktion, Klassifizierung, alles, was Sie mit none ausgeführt haben |
Bei von Benutzern markierten Gesprächen sinken Antworten mit einem sachlichen Fehler von 11,4 % (GPT-6 Sol) auf 7,7 % |
medium (Standard) |
Agentenbasierte Automatisierungen und Tool-Aufruf-Workflows | AutomationBench 1.0.6: +2,2 Prozentpunkte gegenüber Claude Opus 5.5 bei etwa einem Drittel der Kosten; +4,8 Prozentpunkte gegenüber GPT-6 Sol bei gleicher Einstellung |
high |
Komplexes Debugging und detaillierte Planung | Keine einstellungsspezifische Angabe |
xhigh |
Ausgereifte Ergebnisse und lange asynchrone Läufe | Keine einstellungsspezifische Angabe |
max |
Computernutzung und anspruchsvolle wissenschaftliche Aufgaben | OSWorld 2.0: +7 Prozentpunkte gegenüber GPT-6 Sol bei Max für weniger als die Hälfte der Kosten. Terminal-Bench Science 0.1: 5,47 $ pro Aufgabe, im Vergleich zu 23,21 $ für Opus 5.5 und 23,80 $ für GPT-6 Astra |
Zwei Anmerkungen. Der Faktengehalt bezieht sich auf Gespräche, die zuvor als fehlerhaft markiert wurden, nicht auf typischen Verkehr. Und bei Terminal-Bench Science erzielt GPT-6 Astra immer noch die höchste Punktzahl (68,1 %), daher empfiehlt OpenAI Astra für die anspruchsvollsten wissenschaftlichen Arbeiten.
Für latenzempfindliche Aufrufe, die none verwendet haben, beginnen Sie mit low und messen Sie. Der Reasoning-Leitfaden beschreibt low als effizientes Reasoning „mit einem moderaten Latenzanstieg“. Um den Aufwand mitten im Gespräch zu ändern, ohne den Prompt-Cache zu unterbrechen, hängen Sie ein configuration_update-Eingabeelement an, anstatt den Anforderungs-level reasoning.effort zu ändern.
Migration von gpt-6-sol: Vier Codeänderungen
- Modell-ID austauschen. Ersetzen Sie
gpt-6-soldurchgpt-6.1-solund bewahren Sie es in der Konfiguration oder einer Umgebungsvariable auf, damit ein Rollback nur eine Bearbeitung erfordert. noneundminimalneu zuordnen. OpenAIs Empfehlung: Verwenden Sielowanstelle vonnone, und beginnen Sieminimalbeilowund vergleichen Sie dies bei repräsentativen Aufgaben. Bei GPT-6 Astra, das ebenfalls keinnonehat, führt das Senden zu HTTP 400, beheben Sie dies also, bevor Sie den Traffic umleiten.- Sampling-Parameter entfernen. Wenn der Aufwand nicht
noneist, entfernen Sietemperature,top_pundtop_logprobs(undlogprobsin Chat Completions). Code, dertemperaturemitnonebei GPT-6 Sol kombiniert hat, benötigt dies. - Chat Completions Tool-Aufrufe nach Responses verschieben. GPT-6 Sol erlaubte Funktionsaufrufe in Chat Completions nur mit
reasoning_effort: "none". Diese Kombination hat kein Äquivalent bei 6.1 Sol.
Führen Sie dann alles erneut aus, was von der Aktualität abhängt: Der Stichtag verschiebt sich vom 20. April auf den 30. April 2026. Wenn Sie von Astra zu Sol gekommen sind, behandelt der Astra-zu-Sol Migrationsleitfaden diesen früheren Schritt.
Batch-, Flex-, Fast- und Cached-Input-Preise
Jede Stufe behält die Form von GPT-6 Sol bei, wobei die Spalte für gecachte Eingaben halbiert wird. Die Preise pro 1 Million Token stammen von der API-Preisgestaltungsseite. Die Modellseite fügt hinzu, dass ein Prompt mit über 272.000 Eingabe-Tokens mit dem 2-fachen der Eingabe- und Cache-Raten und dem 1,5-fachen der Ausgabe für die gesamte Anfrage abgerechnet wird, dieselbe Regel, die GPT-6 Sol verwendet:
| Stufe | Eingabe | Gecachte Eingabe | Cache-Schreibvorgänge | Ausgabe |
|---|---|---|---|---|
| Standard | 2,00 $ | 0,10 $ | 2,50 $ | 10,00 $ |
| Batch | 1,00 $ | 0,05 $ | 1,25 $ | 5,00 $ |
| Flex | 1,00 $ | 0,05 $ | 1,25 $ | 5,00 $ |
| Fast | 4,00 $ | 0,20 $ | 5,00 $ | 20,00 $ |
| Standard, Prompt über 272K Eingabe-Tokens | 4,00 $ | 0,20 $ | 5,00 $ | 15,00 $ |
Flex ist ein pro-Anfrage service_tier: "flex". Fast ist service_tier: "fast", wobei "priority" als Alias akzeptiert wird. Der Fast-Modus ist nicht mit EU-Datenresidenz verfügbar. Ultrafast für GPT-6.1 Sol ist „bald verfügbar“ und ist heute nur für GPT-6 Astra weit verbreitet; siehe OpenAI Ultrafast-Modus. Für Nachtjobs führt der OpenAI Batch API Leitfaden durch einen Batch-Lauf.
Der Cache ist der Bereich, in dem das Upgrade Geld spart. Lesevorgänge kosten 0,05x der Eingaberate bei 6.1 Sol gegenüber 0,1x bei GPT-6 Sol, und Schreibvorgänge kosten 1,25x bei beiden, gemäß dem Prompt-Caching-Leitfaden. Nehmen Sie einen System-Prompt mit 50.000 Token, der über 1.000 Anfragen hinweg wiederverwendet wird. Ein Schreibvorgang kostet 0,125 $ bei beiden Modellen; die 999 Lesevorgänge kosten 9,99 $ bei GPT-6 Sol und 5,00 $ bei GPT-6.1 Sol. Das minimale cachebare Präfix beträgt 1.024 sichtbare Token, und ein gecachtes Präfix bleibt mindestens 30 Minuten nach dem letzten Schreib- oder Wiederverwendungsvorgang gültig. Für die Breakpoint-Strategie siehe GPT-6 Prompt Caching.
Testen Sie den Wechsel in Apidog
Stellen Sie die Produktion nicht nur anhand der Listenpreise um. Senden Sie dieselbe gespeicherte Anfrage an beide IDs und vergleichen Sie die Ergebnisse. In Apidog:
- Erstellen Sie eine Umgebung mit
OPENAI_API_KEY(als Geheimnis gespeichert),MODEL_IDaufgpt-6-solundEFFORTaufmedium. - Erstellen Sie
POST https://api.openai.com/v1/responsesmit dem HeaderAuthorization: Bearer {{OPENAI_API_KEY}}und diesem Body, dann speichern Sie es:
{
"model": "{{MODEL_ID}}",
"reasoning": {"effort": "{{EFFORT}}"},
"max_output_tokens": 25000,
"input": "Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key."
}
- Fügen Sie Zusicherungen hinzu: HTTP 200,
$.statusist gleichcompleted,$.output[*].typeenthältmessage,$.usage.output_tokensist größer als 0, und$.usage.output_tokens_details.reasoning_tokensexistiert. Überprüfen Sie dann die Ausgabeform, von der Ihr Code abhängt, z. B. gültiges JSON mit den von Ihnen geparsten Schlüsseln. - Fügen Sie ein Post-Processor-Skript hinzu, das
usagein Dollar umwandelt, unter Verwendung der Eingabeaufteilung aus OpenAIs Prompt-Caching-Leitfaden:
const u = pm.response.json().usage;
const d = u.input_tokens_details || {};
const cached = d.cached_tokens || 0;
const writes = d.cache_write_tokens || 0;
const model = pm.environment.get("MODEL_ID");
const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20;
const cost = ((u.input_tokens - cached - writes) * 2 + cached * cachedRate
+ writes * 2.5 + u.output_tokens * 10) / 1e6;
console.log(model, "cost per call $", cost.toFixed(5));
- Senden Sie es, setzen Sie
MODEL_IDaufgpt-6.1-solund senden Sie es erneut. Vergleichen Siereasoning_tokens,output_tokens, die Antwort und die protokollierten Kosten. Wenn Sie vonnoneumstellen, führen Sie die Baseline mitnoneund den Kandidaten mitlowaus.
Verschieben Sie dann die Anfrage und eine Handvoll realer Prompts in ein Testszenario und führen Sie das Paar über die Apidog CLI in CI aus. --env-var überschreibt eine Variable für einen Lauf, sodass ein einziges Szenario beide Modelle abdeckt:
npm install -g apidog-cli
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6-sol" -r cli,junit
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6.1-sol" -r cli,junit
Eine fehlgeschlagene Zusicherung führt zum Fehlschlagen des Jobs, und die JUnit-Berichte zeigen Ihnen beide Läufe nebeneinander an. Für Zusicherungen bei Ausgaben, die von Lauf zu Lauf variieren, siehe Testen nicht-deterministischer KI-Agenten.
FAQ
Ist GPT-6.1 Sol teurer als GPT-6 Sol? Nein. Beide sind mit 2 $ Eingabe und 10 $ Ausgabe pro 1 Million Token gelistet. Die gecachte Eingabe von GPT-6.1 Sol beträgt 0,10 $ gegenüber 0,20 $, sodass cache-intensive Workloads günstiger werden.
Was soll ich mit reasoning.effort: "none" tun? GPT-6.1 Sol unterstützt weder none noch minimal. Ordnen Sie beide low zu, entfernen Sie temperature und top_p, und führen Sie Ihre Auswertungen erneut aus, bevor Sie wechseln.
Kann ich GPT-6.1 Sol mit Chat Completions verwenden? Ja, für Anfragen ohne Tools. Für Tool-Aufrufe ist die Responses API erforderlich.
Gibt es einen kostenlosen GPT-6.1 Sol API-Tier? Nein. API-Aufrufe werden ab der ersten Anfrage pro Token abgerechnet. Ist GPT-6.1 Sol kostenlos? behandelt die günstigsten Routen.
Nächster Schritt
Speichern Sie die erste Anfrage, führen Sie sie mit gpt-6-sol bei Ihrem aktuellen Aufwand und dann mit gpt-6.1-sol aus, und vergleichen Sie usage und Ausgabe anhand eines Prompts aus Ihrem eigenen Traffic. Laden Sie Apidog herunter, um beide Läufe als Zusicherungen zu speichern, die Sie in CI erneut ausführen können. Ziehen Sie stattdessen Anthropic in Betracht? Siehe GPT-6.1 Sol vs. Claude Sonnet 5.5.
