Gemini Omni 1.1 Flash prix : ce que coûte réellement une seconde de vidéo

La production vidéo est facturée à 17,50 $ par million de jetons et 5 792 jetons par seconde en 720p, ainsi une seconde coûte environ 0,10 $. La grille tarifaire complète, le levier de brouillon en 360p, et une estimation mensuelle.

Ashley Innocent

Ashley Innocent

28 August 2026

Gemini Omni 1.1 Flash prix : ce que coûte réellement une seconde de vidéo

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Une seconde de vidéo 720p de Gemini Omni 1.1 Flash coûte environ 0,10 $. C'est le chiffre à prendre en compte pour la planification, et c'est le chiffre cité sur la page de tarification de Google. Il n'y a pas de niveau gratuit, donc le premier clip que vous générez en lisant la documentation sera facturé sur votre compte.

Ce qui est intéressant, c'est la façon dont Google arrive à ce chiffre, car le modèle de facturation est basé sur les jetons plutôt que sur le temps. Une fois que vous comprenez le mécanisme, les leviers de coût deviennent évidents, et l'un d'eux (le brouillon en 360p) réduit vos dépenses d'itération des deux tiers.

La grille tarifaire

Élément Prix
Entrée (texte, image, vidéo, audio) 1,50 $ par million de jetons
Sortie texte 9,00 $ par million de jetons
Sortie vidéo 17,50 $ par million de jetons
Niveau gratuit Aucun

Ces tarifs s'appliquent à gemini-omni-1.1-flash, le modèle GA (Disponibilité Générale) publié le 27 août 2026, et au point d'accès `gemini-omni-flash-preview` qui sera retiré. Consultez ce qui a été livré dans la version GA pour les fonctionnalités.

Comment la sortie vidéo est convertie en jetons

Google facture la vidéo de la même manière que le texte : par jetons de sortie. Une seconde de vidéo 720p est facturée à 5 792 jetons de sortie. Faites le calcul :

5,792 tokens x ($17.50 / 1,000,000) = $0.1014 per second

Ainsi, un clip 720p de 10 secondes coûte environ 1,01 $. Une scène de 40 secondes construite via quatre appels d'extension coûte environ 4,06 $, plus les jetons d'entrée pour le contexte précédent lu à chaque tour.

L'entrée est bon marché en comparaison. À 1,50 $ par million, les images de référence et les vidéos que vous joignez comptent à peine par rapport à la sortie. N'optimisez pas la longueur de votre prompt. Optimisez le nombre de secondes de vidéo que vous générez et à quelle résolution.

Le levier 360p

Google génère des aperçus 360p à un tiers du coût du 720p et jusqu'à 60 % plus rapidement. Cela ramène un brouillon de 10 secondes à environ 0,34 $ au lieu de 1,01 $.

Voici ce que cela signifie en pratique. L'itération de prompts sur les modèles vidéo est brutale : vous réussissez rarement la prise du premier coup, et chaque tentative ratée est facturée intégralement. Une session réaliste ressemble à douze tentatives avant d'en garder une.

Flux de travail 12 brouillons 1 rendu final Total
Tout en 720p 12,17 $ 1,01 $ 13,18 $
Brouillon en 360p, final en 720p 4,06 $ 1,01 $ 5,07 $

Même résultat, 62 % de dépenses en moins, et les brouillons reviennent plus vite, vous permettant de passer les douze tentatives plus rapidement. Définissez `resolution` sur `360p` dans `response_format` pendant que vous itérez et n'augmentez cette valeur que lorsque le prompt est correct. Le guide de l'API contient la structure de la requête.

Les niveaux 1080p et 4K sont des suréchantillonnages des images générées plutôt que des rendus natifs, et ils sont facturés à un tarif supérieur au 720p. Vérifiez les chiffres actuels par seconde sur la page de tarification de Google avant de budgétiser un pipeline 4K, car ces deux niveaux sont apparus avec la version GA et les tarifs publiés font autorité.

Ce que coûte le flux de travail d'extension

L'extension de scène est l'endroit où les budgets dérapent, car une vidéo de 40 secondes n'est pas une seule requête. C'est une génération plus trois appels d'extension, chacun facturant ses propres 10 secondes de sortie plus le contexte précédent qu'il lit en entrée.

En 720p, une scène complète de 40 secondes coûte environ 4,06 $ en sortie, et toute tentative qui s'écarte de l'histoire signifie une régénération à partir du segment qui a échoué. Ébauchez d'abord l'intégralité de l'arc en 360p pour environ 1,35 $, confirmez que l'histoire tient sur les quatre segments, puis refaites le rendu. Le guide d'extension de scène couvre les cas où les extensions ont tendance à échouer.

Comparaison avec Veo 3.1

Les deux modèles se trouvent derrière la même clé API Gemini, ce qui rend l'écart de prix facile à manquer.

Modèle 720p par seconde 4K par seconde Niveau gratuit
Gemini Omni 1.1 Flash ~0,10 $ Niveau d'upscale, voir page de tarification Non
Veo 3.1 0,40 $ 0,60 $ Non
Veo 3.1 Fast 0,10 $ 0,30 $ Non
Veo 3.1 Lite 0,05 $ Non disponible Non

Le Veo 3.1 standard coûte environ quatre fois le prix d'une seconde Omni en 720p. Veo 3.1 Lite est moins cher qu'Omni. Mais le prix par seconde n'est pas la seule comparaison. Veo génère un audio natif et s'étend beaucoup plus loin (7 secondes à la fois, jusqu'à 148 secondes), tandis qu'Omni vous offre la boucle d'édition conversationnelle pour laquelle Veo n'a pas d'équivalent. La comparaison complète explique lequel utiliser pour quel travail. Si vous utilisez déjà Veo, ce guide d'intégration est toujours valable.

Trois façons dont les équipes dépensent trop avec cette API

Refaire le rendu en pleine résolution pour vérifier un petit changement. Si vous ajustez une clause dans le prompt, le passage en 360p vous indique si le changement a fonctionné. Le passage en 720p est pour la version que vous livrez.

Générer en production ce qui pourrait être mis en cache. La sortie vidéo est suffisamment déterministe pour être réutilisée, et à 0,10 $ par seconde, le cache se rentabilise immédiatement. Stockez le fichier généré et indexez-le sur le prompt et les paramètres. Régénérer le même clip deux fois est une perte pure et simple.

Réessayer en cas de timeout sans vérifier. La génération vidéo est lente, et un timeout côté client ne signifie pas que la génération a échoué. Si votre logique de réessai se déclenche en cas de timeout, vous pouvez payer deux fois pour un seul clip. Augmentez le timeout, et vérifiez l'achèvement de l'interaction avant de réessayer.

Ce dernier point mérite d'être identifié avant d'atteindre la production. Enregistrez la requête dans Apidog avec un timeout réaliste, validez la forme de la réponse, et exécutez-la délibérément plutôt que de laisser une boucle de réessai découvrir le coût pour vous. La mise en place d'une alerte de dépenses dans la facturation Google Cloud est l'autre moitié de ce filet de sécurité.

Estimation d'une facture mensuelle

Partez des secondes de vidéo finalisée, puis multipliez par votre ratio de brouillon.

monthly cost = finished_seconds x $0.10
             + draft_seconds x $0.034

Une équipe livrant 5 minutes de vidéo 720p finalisée par mois, avec un ratio brouillon/final de 10:1 en 360p :

300 finished seconds x $0.10       = $30.00
3,000 draft seconds x $0.034       = $102.00
                                     -------
                                     $132.00

Notez où va l'argent. Le brouillon domine même à un tiers du prix, car vous produisez dix fois plus de brouillons que de livrables. Si ce chiffre doit baisser, le levier est un nombre réduit de tentatives par élément conservé (meilleurs prompts, contrôle des keyframes pour contraindre la sortie), et non un rendu final moins cher.

FAQ

Gemini Omni 1.1 Flash est-il gratuit ? Pas via l'API. Il n'y a pas de niveau gratuit pour Omni, bien que le modèle soit gratuit sur YouTube Shorts et YouTube Create ; le résumé des accès gratuits couvre ces options. Les modèles de texte de Google comme Gemini 3.6 Flash offrent toujours un accès gratuit limité en débit via AI Studio.

Combien coûte une vidéo de 10 secondes ? Environ 1,01 $ en 720p, ou environ 0,34 $ en 360p.

Pourquoi la vidéo est-elle facturée en jetons ? Google facture toutes les sorties de modèles en jetons pour une question de cohérence. La sortie vidéo est convertie à 5 792 jetons par seconde en 720p, facturée au tarif de 17,50 $ par million de jetons de sortie vidéo.

Les images d'entrée et les clips de référence coûtent-ils plus cher ? Oui, à 1,50 $ par million de jetons d'entrée, ce qui est minime par rapport à la sortie vidéo. Les médias de référence ne sont pas l'élément à optimiser.

Le 4K en vaut-il la peine ? Uniquement pour les livrables finaux. Le 1080p et le 4K sont des suréchantillonnages, ils n'ajoutent donc pas de détails que le modèle n'a pas générés. Ils augmentent la taille des fichiers et le coût.

Une génération échouée est-elle toujours facturée ? Une génération qui renvoie de la vidéo est facturée. Les rejets du filtre de contenu et les erreurs qui ne produisent aucune sortie ne devraient pas l'être, mais surveillez votre tableau de bord de facturation pendant la première semaine de tout nouveau pipeline plutôt que de supposer.

L'économie ici récompense la discipline plus que l'ingéniosité. Faites des brouillons à moindre coût, mettez en cache de manière agressive, limitez vos timeouts et conservez une requête enregistrée par type de tâche afin de remarquer le jour où une mise à jour du modèle modifie ce que vous obtenez pour vos 0,10 $. Téléchargez Apidog si vous voulez que cette vérification soit effectuée avant que la facture ne vous l'apprenne.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API