Drei wegweisende APIs wurden innerhalb einer Woche auf den Markt gebracht oder neu bepreist, und sie befinden sich in drei verschiedenen Preisstufen. Google veröffentlichte Gemini 3.8 Flash am 2. September 2026 zu 0,75 $ pro Million Eingabe-Tokens und 3,75 $ pro Million Ausgabe-Tokens. Anthropic veröffentlichte Claude Fable 5.1 am Vortag zu 10 $ und 50 $. OpenAIs GPT-5.6 Sol liegt dazwischen bei 5 $ und 30 $. Auf dem unabhängigen Intelligence Index von Artificial Analysis erzielen die drei Modelle 59, 57 und 59 Punkte. Das ist der gesamte Vergleich in einem Satz: Ein Modell, das zu etwa einem Dreizehntel des Preises der Spitzenklasse angeboten wird, erzielt auf dem einzigen Index, der alle drei auf die gleiche Weise testet, die gleiche Punktzahl.
Der Haken liegt im Wort „Index“. Benchmarks zählen Antworten pro Aufgabe. Ihre Rechnung zählt Tokens pro Aufgabe, und Gemini 3.8 Flash ist darauf ausgelegt, mehr davon zu verbrauchen. Dieser Leitfaden vergleicht die drei Modelle anhand ihrer Spezifikationen, der eigenen Benchmark-Tabellen von Google (wo Fable 5.1 fehlt und wir erklären, warum), der unabhängigen Zahlen von Artificial Analysis und der Preisarithmetik. Anschließend wird eine einfache Regel für die Auswahl der passenden API für die jeweilige Arbeitslast vorgestellt. Der Gemini 3.8 Flash Artikel behandelt das Modell unter seinen eigenen Bedingungen, und Googles Launch-Beitrag ist die primäre Quelle für alle unten aufgeführten Google-Angaben.
Ein Hinweis zum Timing. Unser Vergleich von Gemini 3.7 Flash vs Claude vs GPT vom August verglich mit Claude Fable 5, nicht 5.1. Anthropic hat dieses Modell am 1. September ersetzt, daher handelt es sich um eine neue Gegenüberstellung, nicht um eine Aktualisierung.
Spezifikationen auf einen Blick
| Gemini 3.8 Flash | Claude Fable 5.1 | GPT-5.6 Sol | |
|---|---|---|---|
| Anbieter | Anthropic | OpenAI | |
| Kontextfenster | 1.048.576 Tokens | 1M Tokens | 1M Tokens |
| Max. Ausgabe | 65.536 Tokens | 128K Tokens | 128K Tokens |
| Eingabepreis (pro 1M) | 0,75 $ Einführungspreis, 1,50 $ ab 1. Jan. 2027 | 10 $ | 5 $ |
| Ausgabepreis (pro 1M) | 3,75 $ Einführungspreis, 7,50 $ ab 1. Jan. 2027 | 50 $ | 30 $ |
| Cache-Lesen (pro 1M) | 0,075 $ Einführungspreis, 0,15 $ ab 1. Jan. | 0,25 $ | 0,50 $ |
| Wissensstand (Stichtag) | März 2026 | Juni 2026 | Hier nicht aufgeführt |
| Schlussfolgerungskontrolle | thinking_level low / medium / high (medium ist der Standard) |
Erweitertes Denken, immer aktiv | Anstrengungsstufen bis xhigh |
| Artificial Analysis Index | 59 (hoch) | 57 (mittel) | 59 (xhoch) |
Zwei Dinge fallen vor jedem Benchmark auf. Gemini 3.8 Flash hat die Hälfte der maximalen Ausgabe der beiden anderen, 65.536 Tokens gegenüber 128K, was bei einzelnen langen Dokumenten mehr ins Gewicht fällt als bei Agenten-Loops, die kurze Schritte ausgeben. Und sein Einführungspreis läuft am 31. Dezember 2026 aus: Ab dem 1. Januar verdoppeln sich beide Gemini-Preise, was jedes Verhältnis in diesem Artikel ändert. Der Gemini 3.8 Flash Preisleitfaden erklärt die Verdopplungs-, Caching-, Batch- und Grounding-Raten vollständig.
Die unabhängige Zahl: 59, 57, 59
Artificial Analysis führt dieselben neun Evaluationen für jedes Modell durch und veröffentlicht eine Intelligence Index-Punktzahl. Gemini 3.8 Flash erreicht auf dem hohen Denklevel 59 Punkte, gegenüber 56 für 3.7 Flash und 52 für 3.6 Flash. GPT-5.6 Sol erzielt bei xhigh-Anstrengung ebenfalls 59 Punkte. Claude Fable 5.1 erreicht bei mittlerer Anstrengung 57 Punkte, gleichauf mit GPT-5.6 Terra bei max und Muse Spark 1.2 bei xhigh. Grok 4.6 bei medium ist das andere Modell mit 59 Punkten.
Lesen Sie die Bezeichnungen der Denklevel, bevor Sie die Zahlen interpretieren. Fable 5.1 wurde bei mittlerer Einstellung getestet, nicht bei seiner höchsten, und Sol bei xhigh, seiner höchsten Einstellung. Ein Unterschied von zwei Punkten bei verschiedenen Anstrengungsleveln ist keine Rangliste, und Artificial Analysis listet es aus gutem Grund so auf. Die vertretbare Aussage ist enger: Bei den getesteten Einstellungen erreicht Gemini 3.8 Flash die beiden Premium-Modelle in diesem Index, und es ist das günstigste Modell mit 59 Punkten, mit großem Abstand.
Dieselbe Analyse maß, was diese Punktzahl kostet. Gemini 3.8 Flash verwendete bei hoher Einstellung durchschnittlich 48.000 Ausgabe-Tokens pro Aufgabe, 30 Prozent mehr als 3.7 Flash, und 0,58 $ API-Ausgaben pro Aufgabe. Die Zeit pro Aufgabe betrug 2,5 Minuten, die Ausgabegeschwindigkeit etwa 300 Tokens pro Sekunde und die Zeit bis zum ersten Token 13,3 Sekunden beim High-Reasoning-Lauf, weil das Modell denkt, bevor es schreibt. Bei τ³-Banking, der Tool-Nutzungsbewertung, erzielte es 45 Prozent, 12 Punkte über 3.7 Flash. Behalten Sie diese Zahlen im Hinterkopf, wenn der Preis pro Token zu gut aussieht.
Googles Benchmark-Tabellen und wer fehlt
Googles Flash-Seite veröffentlicht drei Hersteller-übergreifende Zeilen in Textform. Claude Fable 5.1 ist darin nicht enthalten. Googles Tabellen führen stattdessen Anthropics Opus 5 und Sonnet 5 auf, und Fable 5.1 war einen Tag öffentlich, als die Tabellen erstellt wurden. Die Anthropic-Spalte unten bezieht sich also auf Opus 5 (5 $ / 25 $) und Sonnet 5 (2 $ / 10 $), nicht auf das 10 $ / 50 $-Modell, um das es in diesem Artikel geht. Betrachten Sie es als den bestmöglichen Ersatz, nicht als eine direkte Übereinstimmung.
| Benchmark (von Google durchgeführt) | Gemini 3.8 Flash | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|
| HLE-Verified | 54,9% | 54,4% | 31,0% | 54,5% | 51,1% |
| Vals Finance Agent v2 | 61,4% | 58,6% | 53,9% | 53,8% | 54,4% |
| Harvey Legal Agent Benchmark | 10,0% | 6,7% | 5,0% | 2,5% | 0,8% |
HLE-Verified ist ein dreifacher Gleichstand: 54,9, 54,4 und 54,5 liegen innerhalb eines halben Punktes voneinander entfernt, wobei Sonnet 5 weit zurückliegt. Vals Finance Agent v2 ist der Bereich, in dem 3.8 Flash sich absetzt, 2,8 Punkte über Opus 5 und 7,6 Punkte über Sol bei einer mehrstufigen Agenten-Finanzaufgabe. Harvey Legal ist der Sonderling: Jedes Modell erzielt unter 11 Prozent, so dass die Reihenfolge mehr aussagt als die Unterschiede.
Was Google nicht in Textform veröffentlicht hat, ist ebenso wichtig. Es gibt keine SWE-Bench Pro-, Terminal-bench- oder OSWorld-Zahlen für 3.8 Flash, und das DeepSWE v1.1-Ergebnis erscheint nur als Behauptung, dass das Modell „die meisten größeren Frontier-Modelle übertrifft“ zu „einem Bruchteil der Kosten“, wobei die Zahl in einer Bildtabelle und nicht im Text steht. Für Codierungs- und Computernutzungsvergleiche müssen Sie zu den eigenen Läufen der jeweiligen Anbieter gehen, die sich nicht überschneiden. Die von Anthropic finden Sie in der Claude Fable 5.1 Benchmarks-Aufschlüsselung; die von OpenAI in den GPT-5.6 Sol Benchmarks. Keiner der Anbieter hat das Modell des anderen ausgeführt, daher bleibt Artificial Analysis die einzige vergleichbare Quelle.
Die Preisspanne, Zeile für Zeile
Zu Einführungspreisen ist die Arithmetik eindeutig. Fable 5.1s 10 $ Eingabe sind das 13,3-fache von Gemini 3.8 Flashs 0,75 $, und seine 50 $ Ausgabe ist das 13,3-fache der 3,75 $. GPT-5.6 Sols 5 $ Eingabe sind das 6,7-fache, und seine 30 $ Ausgabe ist das 8-fache. Cache-Lesevorgänge verringern den Abstand: 0,075 $ bei 3.8 Flash, 0,25 $ bei Fable 5.1 (3,3x) und 0,50 $ bei Sol (6,7x). Fable 5.1s Cache-Lesevorgang ist die Hälfte von Sols, was die einzige Zeile ist, in der das teuerste Modell nicht das teuerste ist.
Ein durchgerechnetes Beispiel macht es konkret. Nehmen wir einen Lauf an, der 1 Million Eingabe-Tokens und 200.000 Ausgabe-Tokens verbraucht, alles ungecached.
- Gemini 3.8 Flash: 0,75 $ + 0,75 $ = 1,50 $
- GPT-5.6 Sol: 5,00 $ + 6,00 $ = 11,00 $
- Claude Fable 5.1: 10,00 $ + 10,00 $ = 20,00 $
Ab dem 1. Januar 2027 kostet derselbe Gemini-Lauf 3,00 $, und die Abstände schrumpfen auf das 3,7-fache für Sol und das 6,7-fache für Fable 5.1. Die Verdoppelung gilt auch für 3.6 Flash und 3.7 Flash, sodass es keine günstigere Gemini Flash-Version gibt, auf die man ausweichen könnte. Anthropics Preisseite listet die Fable 5.1-Preise auf, und unsere Claude Fable 5.1 Preisleitfaden und GPT-5.6 Preisleitfaden decken die Batch- und Cache-Stufen für jedes ab.
Kosten pro Aufgabe, nicht pro Token
Hier ist der Vorbehalt, der die einfache Version dieser Rechnung zunichtemacht. Google sagt, Gemini 3.8 Flash „kann bei länger dauernden und komplexen Aufgaben von Natur aus mehr Tokens verbrauchen“. Bei schwierigen Problemen macht es kleinere Denkschritte, überprüft seine Arbeit und ruft Tools iterativ auf. Artificial Analysis maß den Effekt: 48.000 Ausgabe-Tokens pro Aufgabe bei hoher Einstellung, 30 Prozent mehr als 3.7 Flash, sodass die Kosten für die Ausführung seines Index von 0,40 $ pro Aufgabe bei 3.7 Flash auf 0,58 $ bei 3.8 Flash bei unveränderten Pro-Token-Preisen stiegen. Bei mittlerer Einstellung sind es 0,41 $ pro Aufgabe und bei niedriger 0,24 $.
Daraus ergeben sich zwei Konsequenzen. Erstens ist eine 13,3-fache Pro-Token-Lücke keine 13,3-fache Rechnungslücke, wenn das Premium-Modell mit weniger Tokens oder weniger Tool-Durchläufen fertig wird. Artificial Analysis hat in dem uns vorliegenden Text keine vergleichbare Pro-Aufgabe-Zahl für Fable 5.1 oder Sol veröffentlicht, also messen Sie es an Ihren eigenen Prompts, bevor Sie einer der Multiplikator-Richtungen vertrauen. Zweitens ist bei Gemini das Denklevel der Kostenhebel. Das Herabsetzen einer Route von hoch auf niedrig senkte die Pro-Aufgabe-Kosten auf dem Set von Artificial Analysis um mehr als die Hälfte, und der Leitfaden zu den Denkleveln zeigt, wie man es pro Endpunkt einstellt. Der 3.8 Flash vs 3.7 Flash Vergleich behandelt den Fall, in dem das ältere Modell mit 31 Prozent weniger pro Aufgabe immer noch der bessere Kauf ist.
Wann welches Modell wählen
Gemini 3.8 Flash für Volumen und kostengünstige Agenten wählen
Wenn Sie Tausende von Agenten-Aufgaben pro Tag ausführen, ist 3.8 Flash die Standardwahl. Es erreicht auf dem unabhängigen Index die Premium-Modelle, führt Googles Finanz- und Rechtsagenten-Rankings an und kostet selbst nach der Verdopplung im Januar einen Bruchteil pro Token. Es akzeptiert auch nativ Video-, Audio- und PDF-Eingaben, bietet Batch mit 50 % Rabatt an, beinhaltet 5.000 kostenlose Google Search Grounding-Anfragen pro Monat und hat einen kostenlosen Tarif für Prototyping. Die Kompromisse: Nur Textausgabe, keine Live-API, eine Ausgabebeschränkung von 65.536 Tokens und ein Token-Verbrauch, den Sie bei mittlerer oder hoher Einstellung budgetieren sollten.
Claude Fable 5.1 für komplexeste langfristige Schlussfolgerungen wählen
Fable 5.1 ist das Modell, zu dem man eskalieren sollte, nicht mit dem man beginnen sollte. Sein Anwendungsfall sind Arbeiten, bei denen eine falsche Antwort mehr kostet als die Tokens: mehrstündige Recherche-Agenten, lange Terminalsitzungen, Schlussfolgerungsketten, bei denen die Evaluationen eines günstigeren Modells nicht ausreichen. Seine 128K Ausgabe und 0,25 $ Cache-Lesevorgänge eignen sich für präfixlastige Agenten-Loops, die bei jeder Runde denselben großen Kontext wiederverwenden; bei diesen macht die Cache-Linie den effektiven Multiplikator viel kleiner als 13,3x. Siehe was Claude Fable 5.1 ist für das eigene Datenblatt des Modells.
GPT-5.6 Sol für Agentenläufe im OpenAI-Ökosystem wählen
Sol erreicht 59 Punkte bei xhigh, liegt bei HLE-Verified gleichauf mit 3.8 Flash und liefert 128K Ausgabe bei 5 $ / 30 $. Wenn Ihre Agenten, Evaluationen und Tools bereits im OpenAI-Stack angesiedelt sind, ist Sol die Premium-Stufe, die keinen zweiten Anbieter erfordert. Es hat die teuersten Cache-Lesevorgänge der drei, passt also besser zu frischen Kontextläufen als zu langen gecachten Sitzungen. Der Vergleich von Grok 4.6 vs GPT-5.6 vs Claude Fable 5 zeigt, wie Sol im Vergleich zum vorherigen Anthropic-Flaggschiff abschnitt.
Alle drei in einem Apidog-Workspace testen
Jedes der obigen Argumente endet auf dieselbe Weise: Messen Sie es an Ihren eigenen Prompts. Apidog ist ein API-Client und eine Testplattform, daher führt es keines dieser Modelle aus, aber es ist eine schnelle Möglichkeit, dieselbe Anfrage an alle drei Anbieter zu senden und die Ergebnisse zu vergleichen.
Die Einrichtung besteht aus einem Projekt mit drei Umgebungen. Jede Umgebung enthält eine Basis-URL und eine Schlüsselvariable: https://generativelanguage.googleapis.com mit GEMINI_API_KEY, Anthropics Basis mit Ihrem Claude-Schlüssel und OpenAIs Basis mit Ihrem OpenAI-Schlüssel. Schlüssel bleiben in Umgebungsvariablen, niemals im Anfragetext oder in der geteilten Sammlung.
Erstellen Sie dann ein Testszenario mit drei Anfrageschritten, die denselben Prompt verwenden. Der Gemini-Schritt sendet an /v1beta/interactions mit "model": "gemini-3.8-flash" und "thinking_level": "medium"; die anderen beiden senden an den Chat- oder Nachrichten-Endpunkt ihres Anbieters. Fügen Sie bei jedem Schritt Assertionen hinzu, die für einen Vergleich wichtig sind: HTTP 200, einen JSON-Pfad, der bestätigt, dass die Antwort vorhanden ist, und eine Obergrenze für das Token-Nutzungsfeld, damit ein Lauf, der plötzlich doppelt so viele Denk-Tokens verbraucht, lautstark fehlschlägt. Bei Gemini ist dieses Feld usageMetadata.thoughtsTokenCount für den Legacy-Endpunkt; überprüfen Sie den äquivalenten Nutzungsblock für die anderen beiden.
Führen Sie das Szenario gegen eine Reihe von Golden Prompts aus und planen Sie es so, dass es täglich läuft. Wenn ein Anbieter Standardeinstellungen ändert oder ein Modell mehr Tokens verbraucht, informiert Sie die fehlgeschlagene Assertion, bevor die Rechnung kommt. Der Anleitung zum Testen von KI-Agenten-APIs behandelt die mehrstufige Version dieses Musters, und API-Tests in Apidog planen behandelt den wiederkehrenden Lauf. Laden Sie Apidog herunter, um die drei Umgebungen einzurichten.
Häufig gestellte Fragen (FAQ)
Ist Gemini 3.8 Flash besser als Claude Fable 5.1?
Auf dem Index von Artificial Analysis erreicht 3.8 Flash bei hoher Einstellung 59 Punkte und Fable 5.1 bei mittlerer Einstellung 57 Punkte, sie liegen also bei den getesteten Einstellungen nahe beieinander. Googles Tabellen enthalten Fable 5.1 nicht, und Anthropics Benchmarks enthalten 3.8 Flash nicht, sodass es keinen breiteren direkten Vergleich gibt. Pro Token ist Flash zu Einführungspreisen 13,3-mal günstiger.
Welches der drei ist am günstigsten für Agenten-Workloads?
Gemini 3.8 Flash mit großem Abstand pro Token, zu 0,75 $ / 3,75 $ bis zum 31. Dezember 2026. Pro Aufgabe maß Artificial Analysis 0,58 $ bei hoher Einstellung, 0,41 $ bei mittlerer und 0,24 $ bei niedriger, da das Modell etwa 30 Prozent mehr Ausgabe-Tokens verbraucht als 3.7 Flash. Messen Sie die Kosten pro abgeschlossener Aufgabe, nicht pro Token, bevor Sie sich festlegen.
Haben alle drei ein 1M Kontextfenster?
Ja. Gemini 3.8 Flash akzeptiert 1.048.576 Eingabe-Tokens, und Fable 5.1 sowie GPT-5.6 Sol listen beide 1M auf. Die maximale Ausgabe unterscheidet sich: 65.536 Tokens bei 3.8 Flash gegenüber 128K bei den beiden anderen.
Warum ist Claude Fable 5.1 nicht in Googles Benchmark-Tabellen?
Googles veröffentlichte Zeilen listen Claude Opus 5 und Claude Sonnet 5 als Anthropic-Einträge auf. Fable 5.1 wurde am 1. September, einen Tag vor 3.8 Flash, veröffentlicht und war daher nicht enthalten. Für Fable 5.1s eigene von Anthropic durchgeführte Zahlen siehe den Claude Fable 5.1 vs Opus 5 Vergleich.
Bleibt der Gemini-Preisvorteil nach 2027 erhalten?
Teilweise. Ab dem 1. Januar 2027 steigt Gemini 3.8 Flash auf 1,50 $ / 7,50 $, was Fable 5.1 auf beiden Linien das 6,7-fache und Sol das 3,3-fache bei der Eingabe und das 4-fache bei der Ausgabe macht. Immer noch günstiger, aber die Lücke ist nur noch halb so groß.
Welches zuerst aufrufen
Beginnen Sie mit Gemini 3.8 Flash für alles, was Sie in großem Umfang ausführen, stellen Sie thinking_level pro Route ein und achten Sie auf Tokens pro Aufgabe, nicht auf den Listenpreis. Eskalieren Sie zu Claude Fable 5.1, wenn Ihre Evaluationen mit günstigeren Modellen unzureichend sind und der Kontext über mehrere Runden hinweg zwischengespeichert wird. Verwenden Sie GPT-5.6 Sol, wenn der Rest Ihres Stacks OpenAI ist und Sie eine Premium-Stufe ohne zweiten Anbieter wünschen. Welches Sie auch wählen, führen Sie denselben Prompt zuerst in einem Testszenario durch alle drei aus; das Preisverhältnis ist öffentlich, aber das Kosten-pro-Aufgabe-Verhältnis für Ihre Prompts müssen Sie selbst messen.
