Gemini 3.8 Flash ist heute verfügbar: ein stabiles Modell mit einem kostenlosen Tarif, das bis zum 31.12.2026 0,75 $ Eingabe und 3,75 $ Ausgabe pro 1 Mio. Tokens kostet, danach 1,50 $ und 7,50 $, mit einer Ausgabebeschränkung von 64.000. Gemini 4 Argon ist es nicht. Googles Veröffentlichung preist es während einer Einführungsphase unbekannter Länge mit 2 $ und 10 $ an, danach mit 4 $ und 20 $. Google gibt an, dass die Ausgabebeschränkung 1 Mio. Tokens beträgt und es heute nur Fairwind-Programm-Verteidigern zur Verfügung steht. Wenn Sie in diesem Quartal liefern müssen, verwenden Sie Flash und halten Sie Argon nur eine Konfigurationsänderung entfernt.
Dieser Beitrag vergleicht die beiden hinsichtlich Spezifikationen, den Benchmark-Zeilen, die beide Veröffentlichungen teilen, Cyber-Werten und den Kosten eines identischen Aufrufs, und gibt Ihnen dann eine Entscheidungsregel. Für weitere Informationen siehe was Gemini 4 Argon ist und was Gemini 3.8 Flash ist. Der letzte Abschnitt zeigt die Apidog-Einrichtung, die den Wechsel zu einer einzigen Variablen macht.
Seite an Seite: Was Sie heute aufrufen können
| Gemini 3.8 Flash | Gemini 4 Argon | |
|---|---|---|
| VerfĂĽgbarkeit | Stabil auf der Gemini API, AI Studio, Antigravity und Gemini Enterprise | Eine Untergruppe von Fairwind-Programmpartnern, als verwaltetes Modell auf Gemini Enterprise |
| Modell-ID | gemini-3.8-flash |
Nicht veröffentlicht |
| Preis pro 1 Mio. Tokens (Eingabe / Ausgabe) | 0,75 $ / 3,75 $ bis 31.12.2026, danach 1,50 $ / 7,50 $ | 2 $ / 10 $ EinfĂĽhrung (Enddatum nicht angegeben), danach 4 $ / 20 $ |
| Gecachter Input pro 1 Mio. | 0,075 $, dann 0,15 $ | 0,10 $ EinfĂĽhrung, dann 0,20 $ (95% Rabatt auf den Input) |
| Ausgabebeschränkung | 65.536 Tokens | 1 Mio. Tokens (Googles angegebene Grenze) |
| Eingabefenster | 1.048.576 Tokens | Nicht veröffentlicht |
| Denk-Level | low, medium (Standard), high; minimal gibt HTTP 400 zurĂĽck |
Nicht dokumentiert |
| Kostenlose API-Stufe | Ja, ratenbegrenzt | Keine angekĂĽndigt |
| Verbraucherzugang | Gemini-App auf AI Pro und Ultra, AI-Modus in der Suche | Noch nicht; AI Ultra-Abonnenten sind in der ersten Welle, kein Datum |
Einige Zellen benötigen Kontext. Google hat Argons Eingabefenster nicht veröffentlicht, obwohl die eigene Langkontext-Evaluierung Prompts von bis zu 1 Mio. Tokens verwendete. Google gibt an, dass Argons Ausgabebeschränkung 1 Mio. Tokens beträgt; mindestens ein Drittanbieter-Evaluator, Vals AI, listet eine maximale Ausgabe von 262.000 für die von ihm getestete Konfiguration auf. Argons Evaluierungen liefen mit „den höchsten Denkeinstellungen“, daher existiert wahrscheinlich ein hohes Level, aber Google hat die Level oder den Standard nicht benannt. Flashs Level sind in Googles Denk-Dokumentation und in unserem 3.8 Flash Denk-Level-Leitfaden beschrieben.
Flashs kostenlose Stufe ist ratenbegrenzt, und Google sagt, dass Daten der kostenlosen Stufe „zur Verbesserung unserer Produkte verwendet werden“. Google hat keine kostenlose Möglichkeit zur Nutzung von Argon angekündigt; unser Argon-Erklärer für den kostenlosen Zugang behandelt, was Sie stattdessen nutzen können.
Die Benchmark-Zeilen, die beide Veröffentlichungen im Text teilen
Googles Veröffentlichungstabellen für die beiden Modelle teilen zwei Zeilen im Text. Dies sind von Google gemeldete Zahlen, und Argons Methodik schreibt beide Zeilen Vals AI zu.
| Benchmark | Gemini 3.8 Flash (Tabelle vom 2. Sep.) | Gemini 4 Argon (Tabelle vom 30. Sep.) |
|---|---|---|
| Vals Finanzagent v2 | 61.4% | 65.4% |
| Harvey Rechtsagent-Benchmark | 10.0% | 19.6% |
Google veröffentlichte diese Tabellen im Abstand eines Monats, mit unterschiedlichen Konkurrenz-Sets, daher sollte der Unterschied eher als richtungsweisend denn als kontrollierter Test verstanden werden. Dennoch sticht die Rechtszeile hervor: Argons 19,6 % sind fast doppelt so hoch wie Flashs 10,0 %. Die Finanzlücke beträgt 4 Punkte.
Alles andere in Argons Tabelle hat kein 3.8 Flash-Pendant im Text. Googles 3.8 Flash-Tabelle berichtete über HLE-Verified, was bei Argon nicht der Fall ist, und Flashs DeepSWE-Score erschien nur in Modellkartenbildern. Auf der Text-Bestenliste von Arena, einem Ranking von Drittanbietern, liegt Argon (High) bei den vorläufigen Stimmen auf Platz 1, während Gemini 3.8 Flash (High) auf Platz 11 liegt. Die vollständige 19-zeilige Argon-Tabelle, mit Angabe der Messenden für jede Zeile, finden Sie in unserer Argon-Benchmarks-Aufschlüsselung.
Cyber: Argon vs. 3.8 Flash Cyber
Die DeepMind Cyber-Seite vergleicht Argon mit Gemini 3.8 Flash Cyber, dem Fairwind-zugangsbeschränkten Cyber-Geschwistermodell von Flash:
| Cyber-Evaluierung | Gemini 4 Argon | Gemini 3.8 Flash Cyber |
|---|---|---|
| Entdeckung von Schwachstellen in der realen Welt | 85.8% | 71.0% |
| Wiz Penetrationstest-Benchmark | 70.9% | 58.2% |
Beide Modelle sind zugangsbeschränkt. Gemini 3.8 Flash Cyber ist GA hinter einer Zulassungsliste auf der Gemini Enterprise Agent Platform, und Argon ist nur für Fairwind-Partner verfügbar. Wenn Sie kein Fairwind-Partner sind, ändert keine der Zahlen, was Sie heute aufrufen können. Das allgemeine 3.8 Flash-Modell ist das, auf dem Sie aufbauen können.
Kosten des gleichen Aufrufs bei beiden
Nehmen Sie einen Aufruf mit 100.000 Eingabe-Tokens und 8.000 Ausgabe-Tokens. Aktuelle Gemini-Modelle, einschlieĂźlich 3.8 Flash, berechnen Denk-Tokens als Ausgabe, sodass die 8.000 diese einschlieĂźen. Google hat nicht gesagt, wie Argon diese berechnet; die Argon-Zeilen gehen davon aus, dass es den aktuellen Gemini-Modellen folgt.
| Modell und Zeitraum | Eingabekosten | Ausgabekosten | Gesamt pro Aufruf |
|---|---|---|---|
| 3.8 Flash, EinfĂĽhrung | 0,1 Mio. x 0,75 $ = 0,075 $ | 0,008 Mio. x 3,75 $ = 0,030 $ | 0,105 $ |
| 3.8 Flash, ab 01.01.2027 | 0,1 Mio. x 1,50 $ = 0,150 $ | 0,008 Mio. x 7,50 $ = 0,060 $ | 0,210 $ |
| Argon, EinfĂĽhrung | 0,1 Mio. x 2 $ = 0,200 $ | 0,008 Mio. x 10 $ = 0,080 $ | 0,280 $ |
| Argon, Standard | 0,1 Mio. x 4 $ = 0,400 $ | 0,008 Mio. x 20 $ = 0,160 $ | 0,560 $ |
Argons Pro-Token-Preise sind 8/3 (etwa 2,67-mal) so hoch wie die von Flash, sowohl bei den EinfĂĽhrungspreisen als auch bei den Standardpreisen. Bei 1.000 dieser Aufrufe pro Tag sind das 105 $ pro Tag mit Flash gegenĂĽber 280 $ mit Argon zu EinfĂĽhrungspreisen.
Drei Dinge stören das saubere Verhältnis:
- Token-Anzahlen stimmen nicht überein. Derselbe Prompt erzeugt auf verschiedenen Modellen unterschiedliche Ausgabe- und Denk-Token-Anzahlen. Argons veröffentlichte Evaluierungen liefen mit den höchsten Denkeinstellungen, und bei 3.8 Flash warnt Google, dass höhere Anstrengungsstufen mehr Tokens verbrauchen können.
- Lange Ausgaben ändern die Berechnung. Eine 200.000-Token-Antwort passt nicht in Flashs 65.536-Token-Limit, daher müssten Sie sie auf mehrere Aufrufe aufteilen. Unter Argons angegebenem Limit ist es eine Antwort: 0,2 Mio. x 10 $ = 2,00 $ zu Einführungspreisen oder 4,00 $ zu Standardpreisen. Eine vollständige 1-Mio.-Token-Antwort kostet 10 $ (Einführungspreis) oder 20 $ (Standardpreis).
- Nur ein Enddatum fĂĽr die EinfĂĽhrung ist bekannt. Flashs EinfĂĽhrungspreise enden am 31.12.2026. Google hat nicht gesagt, wann die von Argon enden.
Flash bietet auch Batch mit 50 % Rabatt (0,375 $ und 1,875 $ bis 31. Dezember), gemäß der Gemini API-Preisseite. Google hat keine Batch-Preise für Argon veröffentlicht. Unser Argon-Preis-Leitfaden und der 3.8 Flash-Preis-Leitfaden gehen tiefer ins Detail.
Sollten Sie auf Argon warten oder Flash verwenden?
Verwenden Sie jetzt 3.8 Flash, wenn
- Sie budgetgebunden sind. Flash kostet 3/8 von Argon pro Token, und Batch halbiert das.
- Sie hohes Volumen haben. Klassifizierung, Extraktion, Routing und Chat in groĂźem MaĂźstab summieren sich schnell bei 10 $ pro 1 Mio. Ausgabe-Tokens.
- Sie es heute brauchen. Flash hat eine stabile Modell-ID, eine kostenlose Stufe für Prototyping und einen veröffentlichten Preisplan.
- Ihre Antworten passen in 65.536 Tokens. Die meisten API-Workloads tun dies.
Planen Sie fĂĽr Argon, wenn
- Die Arbeit langfristig ist. Google sagt, Argon sei „gebaut, um tiefgreifende Schlussfolgerungen über komplexe, langfristige Workflows hinweg aufrechtzuerhalten.“
- Sie Ausgaben jenseits von 64.000 benötigen. Vollständige Modul-Umschreibungen, lange Berichte und große Migrationen sind Anwendungsfälle für ein 1-Mio.-Ausgabelimit.
- Sie Rechts- oder Finanzagenten betreiben. Das sind die beiden Zeilen, in denen Google beide Modelle veröffentlicht hat, und Argon führt bei beiden.
- Sie ein Fairwind-berechtigter Verteidiger sind. Argon ist das Modell, mit dem das Programm jetzt federfĂĽhrend ist.
Sie mĂĽssen sich nicht einmal entscheiden. Leiten Sie den GroĂźteil des Verkehrs an Flash weiter und schicken Sie den anspruchsvollen Rest an Argon, sobald es verfĂĽgbar ist, wobei beide die gleiche Konfiguration verwenden.
Eine gespeicherte Anfrage, zwei Modelle
Hier ist das Muster. Speichern Sie den Modellnamen in einer Umgebungsvariablen, führen Sie Ihre tatsächlichen Anfragen jetzt gegen 3.8 Flash aus und tauschen Sie die Variable an dem Tag aus, an dem Argons Modell-ID veröffentlicht wird. Google hat diese ID nicht veröffentlicht, also raten Sie nicht.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
curl -s -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize this contract clause in 3 bullets."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"medium"},"maxOutputTokens":8192}}'
Jede generateContent-Antwort endet mit usageMetadata. In Apidog speichern Sie GEMINI_API_KEY und GEMINI_MODEL in einer Umgebung, speichern diese Anfrage und fĂĽgen Zusicherungen hinzu: Status 200, die Felder, die Ihre App liest, und eine Obergrenze fĂĽr usageMetadata.thoughtsTokenCount, die an Ihr Kostenlimit angepasst ist. Halten Sie maxOutputTokens eingestellt, damit eine lange Antwort Ihr Budget nicht sprengt. FĂĽgen Sie es einem Testszenario hinzu, fĂĽhren Sie es auf Flash aus und bewahren Sie den Bericht als Referenz auf.
Zwei Vorbehalte für den Starttag. Google sagt, „alle neuen Modelle“ werden auf der Interactions API starten und hat nicht gesagt, ob Argon generateContent unterstützt, speichern Sie also eine Interactions-Version (POST https://generativelanguage.googleapis.com/v1beta/interactions mit generation_config.thinking_level) neben dieser. Und Argons Namen für die Denk-Level sind nicht dokumentiert, daher wird medium möglicherweise nicht übernommen. Wenn Argon verfügbar ist, ändern Sie eine Variable, führen Sie es erneut aus und vergleichen Sie Ausgaben und usageMetadata nebeneinander.
FAQ
Ist Gemini 4 Argon besser als Gemini 3.8 Flash? Ja, in den beiden Zeilen, die beide Starttabellen gemeinsam haben: 65,4 % vs. 61,4 % beim Vals Finance Agent v2 und 19,6 % vs. 10,0 % beim Harvey’s Legal Agent Benchmark. Es kostet auch etwa 2,67-mal so viel pro Token, und Sie können es noch nicht aufrufen.
Soll ich auf Gemini 4 Argon warten? Nicht, wenn Sie liefern müssen. Google hat kein Veröffentlichungsdatum genannt, nur „so bald wie möglich“, beginnend mit zahlenden API-Kunden und AI Ultra-Abonnenten.
Gemini 3.8 Flash oder Argon fĂĽr ein neues Projekt? Beginnen Sie mit 3.8 Flash, wobei das Modell in einer Variablen gespeichert ist. Verschieben Sie die Anfragen, die lange Ausgaben oder rechtliche und finanzielle Tiefe erfordern, auf Argon, sobald Sie es mit Ihren eigenen Prompts getestet haben.
Gibt es eine kostenlose Möglichkeit, Argon zu nutzen? Nein. Google hat keine kostenlose Stufe angekündigt; siehe unseren Argon-Erklärer für den kostenlosen Zugang für die kostenlosen Gemini-Modelle, die Sie heute nutzen können.
Ersetzt Argon Gemini 3.8 Flash? Google hat sich dazu nicht geäußert. Google nennt Argon sein neues „Frontier“-Modell, und Reuters berichtet, es sei größer als die vorherige Pro-Linie, daher gehört es zu einer anderen Kategorie als Flash.
Nächster Schritt
Richten Sie die Anfrage heute ein, fĂĽhren Sie sie auf 3.8 Flash aus und speichern Sie den Bericht. Wenn Argon verfĂĽgbar ist, wissen Sie innerhalb von Minuten, ob es seinen Preis fĂĽr Ihren Traffic wert ist. Laden Sie Apidog herunter, um den Vergleich zu erstellen.
