Gemini 3.8 Flash est disponible aujourd'hui : un modèle stable avec un niveau gratuit, tarifé à 0,75 $ en entrée et 3,75 $ en sortie par million de jetons jusqu'au 31/12/2026, puis 1,50 $ et 7,50 $, avec une limite de 64K jetons en sortie. Gemini 4 Argon ne l'est pas. Le billet de lancement de Google le tarife à 2 $ et 10 $ pendant une période d'introduction de durée indéterminée, puis 4 $ et 20 $. Google indique que sa limite de sortie est d'un million de jetons, et il n'est disponible aujourd'hui qu'aux défenseurs du programme Fairwind. Si vous devez livrer ce trimestre, livrez sur Flash et gardez Argon à portée d'une modification de configuration.
Cet article compare les deux modèles sur leurs spécifications, les lignes de référence partagées par les deux annonces de lancement, les scores cyber et le coût d'un appel identique, puis vous donne une règle de décision. Pour en savoir plus, consultez ce qu'est Gemini 4 Argon et ce qu'est Gemini 3.8 Flash. La dernière section présente la configuration Apidog qui permet de changer de modèle avec une seule variable.
Comparaison : ce que vous pouvez appeler aujourd'hui
| Gemini 3.8 Flash | Gemini 4 Argon | |
|---|---|---|
| Disponibilité | Stable sur l'API Gemini, AI Studio, Antigravity et Gemini Enterprise | Un sous-ensemble de partenaires du programme Fairwind, en tant que modèle géré sur Gemini Enterprise |
| ID du modèle | gemini-3.8-flash |
Non publié |
| Prix par million de jetons (entrée / sortie) | 0,75 $ / 3,75 $ jusqu'au 31/12/2026, puis 1,50 $ / 7,50 $ | 2 $ / 10 $ en intro (date de fin non spécifiée), puis 4 $ / 20 $ |
| Entrée mise en cache par million | 0,075 $, puis 0,15 $ | 0,10 $ en intro, puis 0,20 $ (95 % de réduction sur l'entrée) |
| Limite de sortie | 65 536 jetons | 1 million de jetons (limite déclarée par Google) |
| Fenêtre d'entrée | 1 048 576 jetons | Non publié |
| Niveaux de réflexion | low, medium (par défaut), high ; minimal renvoie HTTP 400 |
Non documenté |
| Niveau API gratuit | Oui, avec limite de débit | Aucun annoncé |
| Accès consommateur | Application Gemini sur AI Pro et Ultra, mode AI dans la recherche | Pas encore ; les abonnés AI Ultra font partie de la première vague, pas de date |
Quelques cellules nécessitent un contexte. Google n'a pas publié la fenêtre d'entrée d'Argon, bien que sa propre évaluation de contexte long ait utilisé des invites allant jusqu'à 1 million de jetons. Google indique que la limite de sortie d'Argon est de 1 million de jetons ; au moins un évaluateur tiers, Vals AI, répertorie une sortie maximale de 262K pour la configuration qu'il a testée. Les évaluations d'Argon ont été exécutées avec « les paramètres de réflexion les plus élevés », il est donc probable qu'un niveau élevé existe, mais Google n'a pas nommé les niveaux ni le défaut. Les niveaux de Flash se trouvent dans la documentation sur la réflexion de Google et dans notre guide des niveaux de réflexion de Flash 3.8.
Le niveau gratuit de Flash est soumis à des limites de débit, et Google indique que les données du niveau gratuit sont « utilisées pour améliorer nos produits ». Google n'a annoncé aucun moyen gratuit d'utiliser Argon ; notre explication sur l'accès gratuit à Argon couvre ce que vous pouvez utiliser à la place.
Les lignes de référence partagées par les deux annonces de lancement
Les tableaux de lancement de Google pour les deux modèles partagent deux lignes en texte. Ce sont des chiffres rapportés par Google, et la méthodologie d'Argon attribue les deux lignes à Vals AI.
| Référence | Gemini 3.8 Flash (tableau du 2 sept.) | Gemini 4 Argon (tableau du 30 sept.) |
|---|---|---|
| Agent financier Vals v2 | 61,4 % | 65,4 % |
| Référence agent juridique Harvey | 10,0 % | 19,6 % |
Google a publié ces tableaux à un mois d'intervalle, contre des ensembles de rivaux différents, il faut donc interpréter l'écart comme une indication plutôt que comme un test contrôlé. Malgré cela, la ligne juridique se distingue : les 19,6 % d'Argon sont presque le double des 10,0 % de Flash. L'écart financier est de 4 points.
Tout le reste du tableau d'Argon n'a pas d'équivalent textuel dans Flash 3.8. Le tableau de Google pour Flash 3.8 rapportait HLE-Verified, ce que celui d'Argon ne fait pas, et le score DeepSWE de Flash n'apparaissait que dans les images des cartes de modèle. Sur le classement Text d'Arena, un classement tiers, Argon (High) se classe n°1 sur les votes préliminaires, tandis que Gemini 3.8 Flash (High) est n°11. Le tableau complet d'Argon de 19 lignes, avec les entités ayant mesuré chaque ligne, se trouve dans notre analyse des benchmarks d'Argon.
Cyber : Argon vs Flash Cyber 3.8
La page cyber de DeepMind compare Argon à Gemini 3.8 Flash Cyber, le cousin cyber de Flash réservé à Fairwind :
| Évaluation cyber | Gemini 4 Argon | Gemini 3.8 Flash Cyber |
|---|---|---|
| Découverte de vulnérabilités réelles | 85,8 % | 71,0 % |
| Référence de test d'intrusion Wiz | 70,9 % | 58,2 % |
Les deux modèles sont restreints. Gemini 3.8 Flash Cyber est disponible en GA via une liste d'autorisation sur la plateforme d'agent Gemini Enterprise, et Argon est réservé à Fairwind. Si vous n'êtes pas un partenaire Fairwind, aucun de ces chiffres ne change ce que vous pouvez appeler aujourd'hui. Le modèle général Flash 3.8 est celui sur lequel vous pouvez bâtir.
Coût du même appel sur les deux
Prenons un appel avec 100 000 jetons en entrée et 8 000 jetons en sortie. Les modèles Gemini actuels, y compris Flash 3.8, facturent les jetons de réflexion comme de la sortie, de sorte que les 8 000 jetons les incluent. Google n'a pas précisé comment Argon les facture ; les lignes d'Argon supposent qu'il suit les modèles Gemini actuels.
| Modèle et période | Coût d'entrée | Coût de sortie | Total par appel |
|---|---|---|---|
| 3.8 Flash, intro | 0,1M x 0,75 $ = 0,075 $ | 0,008M x 3,75 $ = 0,030 $ | 0,105 $ |
| 3.8 Flash, à partir du 01/01/2027 | 0,1M x 1,50 $ = 0,150 $ | 0,008M x 7,50 $ = 0,060 $ | 0,210 $ |
| Argon, intro | 0,1M x 2 $ = 0,200 $ | 0,008M x 10 $ = 0,080 $ | 0,280 $ |
| Argon, standard | 0,1M x 4 $ = 0,400 $ | 0,008M x 20 $ = 0,160 $ | 0,560 $ |
Les tarifs par jeton d'Argon sont de 8/3 (environ 2,67 fois) ceux de Flash, tant pour les prix d'introduction que pour les prix standard. À 1 000 de ces appels par jour, cela représente 105 $ par jour sur Flash contre 280 $ sur Argon aux tarifs d'introduction.
Trois éléments brisent ce ratio simple :
- Les nombres de jetons ne correspondront pas. La même invite produit des nombres de jetons de sortie et de réflexion différents sur des modèles différents. Les évaluations publiées d'Argon ont été exécutées avec les paramètres de réflexion les plus élevés, et sur Flash 3.8, Google avertit que des niveaux d'effort plus élevés peuvent utiliser plus de jetons.
- Les sorties longues changent le calcul. Une réponse de 200 000 jetons ne rentre pas dans la limite de 65 536 jetons de Flash, vous devrez donc la diviser en plusieurs appels. Sous la limite déclarée d'Argon, c'est une seule réponse : 0,2M x 10 $ = 2,00 $ aux tarifs d'introduction, ou 4,00 $ en standard. Une réponse complète d'un million de jetons coûte 10 $ en intro ou 20 $ en standard.
- Seule une date de fin d'introduction est connue. Le prix d'introduction de Flash se termine le 31/12/2026. Google n'a pas indiqué quand celui d'Argon se termine.
Flash propose également le traitement par lots (Batch) avec 50 % de réduction (0,375 $ et 1,875 $ jusqu'au 31 décembre), selon la page de tarification de l'API Gemini. Google n'a pas publié de tarifs Batch pour Argon. Nos guide de tarification Argon et guide de tarification Flash 3.8 approfondissent le sujet.
Faut-il attendre Argon ou lancer sur Flash ?
Lancer sur Flash 3.8 maintenant quand
- Vous êtes limité par les coûts. Flash coûte 3/8 d'Argon par jeton, et le traitement par lots (Batch) réduit cela de moitié.
- Vous gérez un volume élevé. La classification, l'extraction, le routage et le chat à grande échelle s'accumulent rapidement à 10 $ par million de jetons de sortie.
- Vous en avez besoin aujourd'hui. Flash a un ID de modèle stable, un niveau gratuit pour le prototypage et un calendrier de prix publié.
- Vos réponses tiennent en 65 536 jetons. C'est le cas de la plupart des charges de travail d'API.
Planifier pour Argon quand
- Le travail est à long terme. Google affirme qu'Argon est « conçu pour soutenir un raisonnement approfondi sur des flux de travail complexes et à long terme ».
- Vous avez besoin de sorties au-delà de 64K. Les réécritures de modules complets, les rapports longs et les migrations importantes sont des cas justifiant une limite de sortie de 1 million.
- Vous utilisez des agents juridiques ou financiers. Ce sont les deux lignes où Google a publié les deux modèles, et Argon devance les deux.
- Vous êtes un défenseur éligible à Fairwind. Argon est le modèle avec lequel le programme travaille désormais.
Vous n'avez pas à choisir une fois pour toutes. Acheminez la majeure partie du trafic vers Flash et envoyez la partie difficile vers Argon lorsqu'il sera disponible, les deux derrière la même configuration.
Une requête enregistrée, deux modèles
Voici le modèle. Conservez le nom du modèle dans une variable d'environnement, exécutez vos requêtes réelles sur Flash 3.8 maintenant, et échangez la variable le jour où l'ID du modèle d'Argon sera livré. Google n'a pas publié cet ID, alors ne le devinez pas.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
curl -s -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize this contract clause in 3 bullets."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"medium"},"maxOutputTokens":8192}}'
Chaque réponse generateContent se termine par usageMetadata. Dans Apidog, stockez GEMINI_API_KEY et GEMINI_MODEL dans un environnement, enregistrez cette requête et ajoutez des assertions : statut 200, les champs lus par votre application, et un plafond sur usageMetadata.thoughtsTokenCount ajusté à votre limite de coût. Maintenez maxOutputTokens défini afin qu'une longue réponse ne dépasse pas votre budget. Ajoutez-le à un scénario de test, exécutez-le sur Flash et conservez le rapport comme référence.
Deux mises en garde pour le jour du lancement. Google déclare que « tous les nouveaux modèles » seront lancés sur l'API Interactions et n'a pas précisé si Argon prend en charge generateContent, alors enregistrez une version Interactions (POST https://generativelanguage.googleapis.com/v1beta/interactions avec generation_config.thinking_level) à côté de celle-ci. Et les noms des niveaux de réflexion d'Argon ne sont pas documentés, donc medium pourrait ne pas être repris. Lorsque Argon sera disponible, changez une variable, réexécutez et comparez les sorties et usageMetadata côte à côte.
FAQ
Gemini 4 Argon est-il meilleur que Gemini 3.8 Flash ? Sur les deux lignes que les deux tableaux de lancement partagent en texte, oui : 65,4 % contre 61,4 % sur Vals Finance Agent v2 et 19,6 % contre 10,0 % sur Harvey’s Legal Agent Benchmark. Il coûte également environ 2,67 fois plus cher par jeton, et vous ne pouvez pas encore l'appeler.
Faut-il attendre Gemini 4 Argon ? Non, si vous devez livrer. Google n'a donné aucune date de sortie, seulement « dès que possible », en commençant par les clients payants de l'API et les abonnés AI Ultra.
Gemini 3.8 Flash ou Argon pour un nouveau projet ? Commencez sur Flash 3.8 en utilisant le modèle dans une variable. Déplacez les requêtes qui nécessitent des sorties longues ou une profondeur juridique et financière vers Argon une fois que vous l'aurez testé avec vos propres invites.
Existe-t-il un moyen gratuit d'utiliser Argon ? Non. Google n'a pas annoncé de niveau gratuit ; consultez notre explication sur l'accès gratuit à Argon pour les modèles Gemini gratuits que vous pouvez utiliser aujourd'hui.
Argon remplace-t-il Gemini 3.8 Flash ? Google ne l'a pas dit. Google qualifie Argon de son nouveau modèle de pointe, et Reuters rapporte qu'il est plus grand que la ligne Pro précédente, il s'agit donc d'un niveau différent de Flash.
Étape suivante
Configurez la requête dès aujourd'hui, exécutez-la sur Flash 3.8 et enregistrez le rapport. Lorsque Argon sera disponible, vous saurez en quelques minutes s'il justifie son prix sur votre trafic. Téléchargez Apidog pour construire la comparaison.
