Gemini 4 Argon contre Gemini 3.8 Flash : Faut-il attendre Argon ou déployer Flash maintenant ?

Gemini 4 Argon contre Gemini 3.8 Flash : prix, limites de sortie, références partagées et coût d'un appel. Déployer sur Flash maintenant ou attendre Argon ?

Medy Evrard

2 October 2026

Gemini 4 Argon contre Gemini 3.8 Flash : Faut-il attendre Argon ou déployer Flash maintenant ?

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Gemini 3.8 Flash est disponible aujourd'hui : un modèle stable avec un niveau gratuit, tarifé à 0,75 $ en entrée et 3,75 $ en sortie par million de jetons jusqu'au 31/12/2026, puis 1,50 $ et 7,50 $, avec une limite de 64K jetons en sortie. Gemini 4 Argon ne l'est pas. Le billet de lancement de Google le tarife à 2 $ et 10 $ pendant une période d'introduction de durée indéterminée, puis 4 $ et 20 $. Google indique que sa limite de sortie est d'un million de jetons, et il n'est disponible aujourd'hui qu'aux défenseurs du programme Fairwind. Si vous devez livrer ce trimestre, livrez sur Flash et gardez Argon à portée d'une modification de configuration.

Cet article compare les deux modèles sur leurs spécifications, les lignes de référence partagées par les deux annonces de lancement, les scores cyber et le coût d'un appel identique, puis vous donne une règle de décision. Pour en savoir plus, consultez ce qu'est Gemini 4 Argon et ce qu'est Gemini 3.8 Flash. La dernière section présente la configuration Apidog qui permet de changer de modèle avec une seule variable.

bouton

Comparaison : ce que vous pouvez appeler aujourd'hui

Gemini 3.8 Flash Gemini 4 Argon
Disponibilité Stable sur l'API Gemini, AI Studio, Antigravity et Gemini Enterprise Un sous-ensemble de partenaires du programme Fairwind, en tant que modèle géré sur Gemini Enterprise
ID du modèle gemini-3.8-flash Non publié
Prix par million de jetons (entrée / sortie) 0,75 $ / 3,75 $ jusqu'au 31/12/2026, puis 1,50 $ / 7,50 $ 2 $ / 10 $ en intro (date de fin non spécifiée), puis 4 $ / 20 $
Entrée mise en cache par million 0,075 $, puis 0,15 $ 0,10 $ en intro, puis 0,20 $ (95 % de réduction sur l'entrée)
Limite de sortie 65 536 jetons 1 million de jetons (limite déclarée par Google)
Fenêtre d'entrée 1 048 576 jetons Non publié
Niveaux de réflexion low, medium (par défaut), high ; minimal renvoie HTTP 400 Non documenté
Niveau API gratuit Oui, avec limite de débit Aucun annoncé
Accès consommateur Application Gemini sur AI Pro et Ultra, mode AI dans la recherche Pas encore ; les abonnés AI Ultra font partie de la première vague, pas de date

Quelques cellules nécessitent un contexte. Google n'a pas publié la fenêtre d'entrée d'Argon, bien que sa propre évaluation de contexte long ait utilisé des invites allant jusqu'à 1 million de jetons. Google indique que la limite de sortie d'Argon est de 1 million de jetons ; au moins un évaluateur tiers, Vals AI, répertorie une sortie maximale de 262K pour la configuration qu'il a testée. Les évaluations d'Argon ont été exécutées avec « les paramètres de réflexion les plus élevés », il est donc probable qu'un niveau élevé existe, mais Google n'a pas nommé les niveaux ni le défaut. Les niveaux de Flash se trouvent dans la documentation sur la réflexion de Google et dans notre guide des niveaux de réflexion de Flash 3.8.

Le niveau gratuit de Flash est soumis à des limites de débit, et Google indique que les données du niveau gratuit sont « utilisées pour améliorer nos produits ». Google n'a annoncé aucun moyen gratuit d'utiliser Argon ; notre explication sur l'accès gratuit à Argon couvre ce que vous pouvez utiliser à la place.

Les lignes de référence partagées par les deux annonces de lancement

Les tableaux de lancement de Google pour les deux modèles partagent deux lignes en texte. Ce sont des chiffres rapportés par Google, et la méthodologie d'Argon attribue les deux lignes à Vals AI.

Référence Gemini 3.8 Flash (tableau du 2 sept.) Gemini 4 Argon (tableau du 30 sept.)
Agent financier Vals v2 61,4 % 65,4 %
Référence agent juridique Harvey 10,0 % 19,6 %

Google a publié ces tableaux à un mois d'intervalle, contre des ensembles de rivaux différents, il faut donc interpréter l'écart comme une indication plutôt que comme un test contrôlé. Malgré cela, la ligne juridique se distingue : les 19,6 % d'Argon sont presque le double des 10,0 % de Flash. L'écart financier est de 4 points.

Tout le reste du tableau d'Argon n'a pas d'équivalent textuel dans Flash 3.8. Le tableau de Google pour Flash 3.8 rapportait HLE-Verified, ce que celui d'Argon ne fait pas, et le score DeepSWE de Flash n'apparaissait que dans les images des cartes de modèle. Sur le classement Text d'Arena, un classement tiers, Argon (High) se classe n°1 sur les votes préliminaires, tandis que Gemini 3.8 Flash (High) est n°11. Le tableau complet d'Argon de 19 lignes, avec les entités ayant mesuré chaque ligne, se trouve dans notre analyse des benchmarks d'Argon.

Cyber : Argon vs Flash Cyber 3.8

La page cyber de DeepMind compare Argon à Gemini 3.8 Flash Cyber, le cousin cyber de Flash réservé à Fairwind :

Évaluation cyber Gemini 4 Argon Gemini 3.8 Flash Cyber
Découverte de vulnérabilités réelles 85,8 % 71,0 %
Référence de test d'intrusion Wiz 70,9 % 58,2 %

Les deux modèles sont restreints. Gemini 3.8 Flash Cyber est disponible en GA via une liste d'autorisation sur la plateforme d'agent Gemini Enterprise, et Argon est réservé à Fairwind. Si vous n'êtes pas un partenaire Fairwind, aucun de ces chiffres ne change ce que vous pouvez appeler aujourd'hui. Le modèle général Flash 3.8 est celui sur lequel vous pouvez bâtir.

Coût du même appel sur les deux

Prenons un appel avec 100 000 jetons en entrée et 8 000 jetons en sortie. Les modèles Gemini actuels, y compris Flash 3.8, facturent les jetons de réflexion comme de la sortie, de sorte que les 8 000 jetons les incluent. Google n'a pas précisé comment Argon les facture ; les lignes d'Argon supposent qu'il suit les modèles Gemini actuels.

Modèle et période Coût d'entrée Coût de sortie Total par appel
3.8 Flash, intro 0,1M x 0,75 $ = 0,075 $ 0,008M x 3,75 $ = 0,030 $ 0,105 $
3.8 Flash, à partir du 01/01/2027 0,1M x 1,50 $ = 0,150 $ 0,008M x 7,50 $ = 0,060 $ 0,210 $
Argon, intro 0,1M x 2 $ = 0,200 $ 0,008M x 10 $ = 0,080 $ 0,280 $
Argon, standard 0,1M x 4 $ = 0,400 $ 0,008M x 20 $ = 0,160 $ 0,560 $

Les tarifs par jeton d'Argon sont de 8/3 (environ 2,67 fois) ceux de Flash, tant pour les prix d'introduction que pour les prix standard. À 1 000 de ces appels par jour, cela représente 105 $ par jour sur Flash contre 280 $ sur Argon aux tarifs d'introduction.

Trois éléments brisent ce ratio simple :

Flash propose également le traitement par lots (Batch) avec 50 % de réduction (0,375 $ et 1,875 $ jusqu'au 31 décembre), selon la page de tarification de l'API Gemini. Google n'a pas publié de tarifs Batch pour Argon. Nos guide de tarification Argon et guide de tarification Flash 3.8 approfondissent le sujet.

Faut-il attendre Argon ou lancer sur Flash ?

Lancer sur Flash 3.8 maintenant quand

Planifier pour Argon quand

Vous n'avez pas à choisir une fois pour toutes. Acheminez la majeure partie du trafic vers Flash et envoyez la partie difficile vers Argon lorsqu'il sera disponible, les deux derrière la même configuration.

Une requête enregistrée, deux modèles

Voici le modèle. Conservez le nom du modèle dans une variable d'environnement, exécutez vos requêtes réelles sur Flash 3.8 maintenant, et échangez la variable le jour où l'ID du modèle d'Argon sera livré. Google n'a pas publié cet ID, alors ne le devinez pas.

MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"

curl -s -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"parts":[{"text":"Summarize this contract clause in 3 bullets."}]}],
       "generationConfig":{"thinkingConfig":{"thinkingLevel":"medium"},"maxOutputTokens":8192}}'

Chaque réponse generateContent se termine par usageMetadata. Dans Apidog, stockez GEMINI_API_KEY et GEMINI_MODEL dans un environnement, enregistrez cette requête et ajoutez des assertions : statut 200, les champs lus par votre application, et un plafond sur usageMetadata.thoughtsTokenCount ajusté à votre limite de coût. Maintenez maxOutputTokens défini afin qu'une longue réponse ne dépasse pas votre budget. Ajoutez-le à un scénario de test, exécutez-le sur Flash et conservez le rapport comme référence.

Deux mises en garde pour le jour du lancement. Google déclare que « tous les nouveaux modèles » seront lancés sur l'API Interactions et n'a pas précisé si Argon prend en charge generateContent, alors enregistrez une version Interactions (POST https://generativelanguage.googleapis.com/v1beta/interactions avec generation_config.thinking_level) à côté de celle-ci. Et les noms des niveaux de réflexion d'Argon ne sont pas documentés, donc medium pourrait ne pas être repris. Lorsque Argon sera disponible, changez une variable, réexécutez et comparez les sorties et usageMetadata côte à côte.

FAQ

Gemini 4 Argon est-il meilleur que Gemini 3.8 Flash ? Sur les deux lignes que les deux tableaux de lancement partagent en texte, oui : 65,4 % contre 61,4 % sur Vals Finance Agent v2 et 19,6 % contre 10,0 % sur Harvey’s Legal Agent Benchmark. Il coûte également environ 2,67 fois plus cher par jeton, et vous ne pouvez pas encore l'appeler.

Faut-il attendre Gemini 4 Argon ? Non, si vous devez livrer. Google n'a donné aucune date de sortie, seulement « dès que possible », en commençant par les clients payants de l'API et les abonnés AI Ultra.

Gemini 3.8 Flash ou Argon pour un nouveau projet ? Commencez sur Flash 3.8 en utilisant le modèle dans une variable. Déplacez les requêtes qui nécessitent des sorties longues ou une profondeur juridique et financière vers Argon une fois que vous l'aurez testé avec vos propres invites.

Existe-t-il un moyen gratuit d'utiliser Argon ? Non. Google n'a pas annoncé de niveau gratuit ; consultez notre explication sur l'accès gratuit à Argon pour les modèles Gemini gratuits que vous pouvez utiliser aujourd'hui.

Argon remplace-t-il Gemini 3.8 Flash ? Google ne l'a pas dit. Google qualifie Argon de son nouveau modèle de pointe, et Reuters rapporte qu'il est plus grand que la ligne Pro précédente, il s'agit donc d'un niveau différent de Flash.

Étape suivante

Configurez la requête dès aujourd'hui, exécutez-la sur Flash 3.8 et enregistrez le rapport. Lorsque Argon sera disponible, vous saurez en quelques minutes s'il justifie son prix sur votre trafic. Téléchargez Apidog pour construire la comparaison.

bouton

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API