Google a rendu son modèle vidéo conversationnel généralement disponible le 27 août 2026. L'identifiant du modèle est gemini-omni-1.1-flash, et il remplace le point de terminaison gemini-omni-flash-preview qui a été lancé en préversion publique le 30 juin. Si vous avez développé quoi que ce soit en utilisant la préversion, vous avez une date limite : Google désactivera le point de terminaison de préversion le 30 septembre 2026.
La version GA (disponibilité générale) n'est pas une simple mise à jour de version sans nouveautés. Quatre fonctionnalités l'accompagnent, et chacune comble une lacune qui rendait la préversion difficile à utiliser en production : l'extension de scène jusqu'à 40 secondes, le contrôle de la première et de la dernière image, un mode brouillon 360p économique et la mise à l'échelle 4K. Cet article traite des changements, de son coût, de l'endroit où le modèle s'exécute et de ce qu'il refuse toujours de faire.
Si vous souhaitez connaître l'historique de la famille Omni et les raisons pour lesquelles Google a initialement construit un modèle vidéo axé sur le raisonnement, commencez par qu'est-ce que Gemini Omni. Cet article suppose que vous connaissez déjà cette partie et que vous souhaitez les détails de la version 1.1.
Ce que fait Gemini Omni 1.1 Flash
Omni 1.1 Flash prend du texte, des images et de la vidéo en entrée, et renvoie de la vidéo. Il s'exécute sur l'API Interactions plutôt que sur generateContent, qui est la même interface que Google utilise pour la génération conversationnelle et multi-tour. Cela a plus d'importance qu'il n'y paraît : vous pouvez générer un clip, puis envoyer une requête de suivi qui modifie le clip que vous venez de créer, sans avoir à tout re-télécharger.
Les cinq types de tâches pris en charge par le modèle :
- Texte vers vidéo : une invite est donnée, un clip est généré.
- Image vers vidéo : une image devient l'image d'ouverture, ou un guide de style pour le mouvement.
- Référence vers vidéo : jusqu'à trois clips de référence de trois secondes chacun mappent le mouvement, l'apparence et la cohérence des personnages sur une nouvelle scène.
- Modifier : changer quelque chose dans une vidéo que vous avez déjà générée, dans une conversation.
- Étendre : ajouter 10 secondes supplémentaires à la fin d'un clip.
L'audio sur les clips de référence est ignoré. Le modèle les lit uniquement pour le mouvement et l'apparence.
L'extension de scène lit désormais 10 secondes de contexte
C'est le changement majeur. Le modèle de préversion examinait la dernière seconde d'un clip avant de le poursuivre, ce qui est à peu près suffisant pour maintenir la palette de couleurs stable et pas grand-chose d'autre. Les personnages dérivaient. Les mouvements de caméra se réinitialisaient. Vous pouviez étendre une vidéo, mais vous ne pouviez pas étendre une séquence.
Omni 1.1 analyse jusqu'à 10 secondes de contexte antérieur, et Google décrit le résultat comme une « cohérence visuelle et une adhérence narrative améliorées ». Vous pouvez étendre par tranches de 10 secondes jusqu'à un total cumulatif de 40 secondes.
Deux limites à prendre en compte. L'extension n'ajoute qu'à la fin d'un clip : vous ne pouvez pas ajouter de séquences au début ni les insérer au milieu. Et les vidéos téléchargées sont limitées à 10 secondes d'entrée, sauf si vous restez dans une interaction multi-tour, où le modèle conserve déjà l'état précédent.
Le guide détaillé d'extension de scène de 40 secondes couvre la forme de la requête et les endroits où les raccordements apparaissent.
Contrôle des images clés entre deux images
Vous pouvez désormais fournir au modèle une première et une dernière image, ainsi qu'une invite décrivant le mouvement entre elles, et il génère les séquences qui relient les deux. Google cite les orbites de caméra, les transitions de zoom et les clips en boucle comme des utilisations évidentes.
Pour quiconque crée un outil vidéo plutôt qu'un gadget, c'est la fonctionnalité qui rend la sortie prévisible. Le texte-vers-vidéo est une machine à sous. L'interpolation d'images vous donne deux points fixes et permet au modèle de résoudre ce qui se trouve au milieu, ce qui est un espace beaucoup plus petit pour se tromper.
Le mode brouillon 360p et pourquoi il change le calcul des coûts
Omni 1.1 génère des prévisualisations 360p jusqu'à 60 % plus rapidement que le 720p, pour un tiers du coût. Google est explicite quant au flux de travail envisagé : brouillonnez en 360p jusqu'à ce que l'invite soit correcte, puis re-rendez la version finale en 720p, 1080p ou 4K.
Ce seul changement a plus de valeur pour un budget de production que tout autre élément de cette version. La génération de vidéo est coûteuse par seconde, et la majeure partie de ce que vous générez pendant l'itération de l'invite est jetée. Payer un tiers moins cher pour les essais jetables fait la différence entre explorer librement et rationner vos tentatives. La répartition complète des prix inclut le calcul par seconde.
La résolution est définie dans le format de réponse, et 1080p et 4k sont des mises à l'échelle des images générées plutôt que des rendus natifs.
Où il s'exécute
Omni 1.1 Flash est disponible via :
- L'API Gemini dans Google AI Studio, pour les développeurs
- L'API Gemini Enterprise Agent Platform, pour les déploiements en entreprise
- Google Flow, pour les abonnés AI Plus, Pro et Ultra
- L'application Gemini, où les abonnés bénéficient de l'extension de scène
Google a également nommé des partenaires de lancement qui utilisent le modèle dans leurs propres produits : Adobe Firefly, Figma Weave, Runway et GMI Cloud. Si vous utilisez l'un de ces outils, vous envoyez déjà du trafic à ce modèle.
Il n'y a pas de niveau gratuit sur l'API. Contrairement aux modèles Flash de texte, où AI Studio vous offre une voie gratuite à débit limité, chaque seconde de sortie Omni est facturée dès la première requête. Le modèle lui-même est gratuit sur YouTube Shorts et YouTube Create, qui est un produit différent avec des limites différentes ; le récapitulatif des accès gratuits explique ce que chaque voie vous apporte.
Ce qu'il ne peut toujours pas faire
Lisez cette liste avant d'intégrer une fonctionnalité autour du modèle.
- Aucun contrôle d'invite attendu. Les instructions système,
temperature,top_p, les séquences d'arrêt et les invites négatives ne sont pas pris en charge. Si vous souhaitez exclure quelque chose, vous devez l'écrire dans l'invite régulière. - Restrictions régionales. Le téléchargement et l'édition de vidéos ne sont pas disponibles dans l'Espace économique européen, en Suisse et au Royaume-Uni, tout comme l'édition d'images contenant des mineurs. Les vidéos générées par le modèle restent modifiables dans ces régions.
- Personnes reconnaissables. La modification de certains individus identifiables est bloquée.
- Dialogue sur une vidéo téléchargée. Vous pouvez étendre un clip téléchargé silencieusement, ou travailler dans une interaction multi-tour, mais vous ne pouvez pas ajouter de dialogue lorsque vous étendez le téléchargement de quelqu'un d'autre.
- Une seule vidéo à la fois pour le raisonnement. Le modèle ne raisonnera pas sur plusieurs vidéos d'entrée.
- Anglais uniquement, en pratique. Google affirme que l'anglais est entièrement pris en charge et que les autres langues ne sont pas testées.
Chaque sortie porte un filigrane SynthID, invisible pour les spectateurs et détectable par programmation. Prévoyez cela si votre produit émet des allégations de provenance.
Omni 1.1 Flash ou Veo 3.1 ?
Google propose désormais deux familles de génération vidéo avec la même clé API, ce qui est une situation vraiment confuse. En bref : Veo 3.1 est le moteur de rendu cinématographique avec audio natif, et Omni 1.1 Flash est le modèle conversationnel avec lequel vous interagissez par tours. La seconde 720p d'Omni coûte environ un quart d'une seconde standard de Veo 3.1, et Veo n'a pas d'équivalent à la boucle d'édition multi-tour.
La comparaison côte à côte passe en revue les cas où chacun l'emporte. Si vous avez déjà une intégration Veo, le guide de l'API Veo 3.1 est toujours précis ; rien dans cette version ne le déprécie.
Migration hors du point de terminaison de prévisualisation
Tout ce qui pointe vers gemini-omni-flash-preview cessera de fonctionner après le 30 septembre 2026. La migration elle-même est généralement un changement d'une seule ligne de la chaîne du modèle, mais deux choses méritent d'être vérifiées avant de supposer que c'est tout :
- Paramètres de résolution par défaut. Le 720p est maintenant la valeur par défaut, et les options 360p et 4K sont nouvelles. Si votre code supposait une taille de sortie fixe, confirmez ce que vous obtenez réellement.
- Taille de la réponse. Les vidéos de plus de 4 Mo sont renvoyées sous forme d'URI au lieu d'un base64 intégré. Si votre gestionnaire ne lit que
output_video.data, une résolution plus élevée ne vous renverra silencieusement rien.
La manière la plus propre de détecter les deux est d'enregistrer la requête dans un client API et de comparer les réponses entre les deux identifiants de modèle avant de basculer. Apidog gère cela très bien : placez l'identifiant du modèle dans une variable d'environnement, conservez une requête enregistrée, changez l'environnement et comparez. Le guide détaillé de l'API explique cela étape par étape.
FAQ
- Quel est l'identifiant du modèle pour Gemini Omni 1.1 Flash ?
gemini-omni-1.1-flash. L'identifiant de préversion qui sera retiré estgemini-omni-flash-preview. - Quand Gemini Omni 1.1 Flash est-il sorti ? Le 27 août 2026, en tant que version GA (disponibilité générale). La préversion a été lancée le 30 juin 2026.
- Gemini Omni 1.1 Flash est-il gratuit ? Non. Il n'y a pas de niveau gratuit pour Omni, donc chaque génération est facturée. Les modèles de texte comme Gemini 3.6 Flash ont toujours une voie gratuite AI Studio ; celui-ci n'en a pas.
- Quelle peut être la durée d'une vidéo Gemini Omni ? Les clips sont générés en 10 secondes, et l'extension de scène les porte à un cumul de 40 secondes par étapes de 10 secondes.
- Gemini Omni génère-t-il de l'audio ? La documentation couvre la sortie vidéo et ignore l'audio sur les clips de référence. Veo 3.1 est le modèle avec génération audio native. Si le son est important, commencez par là.
- Puis-je éditer une vidéo que j'ai filmée moi-même ? Oui, jusqu'à 10 secondes d'entrée, en dehors de l'EEE, de la Suisse et du Royaume-Uni. Téléchargez-la avec l'API Files et passez l'URI en entrée.
Omni 1.1 Flash est la première version de ce modèle qui ressemble à quelque chose que vous mettriez en production. L'extension de scène qui maintient la cohérence d'une prise de vue, les images clés qui rendent la sortie prévisible, et un mode brouillon qui rend l'itération abordable. Configurez une requête enregistrée avec l'identifiant du modèle GA, vérifiez la forme de la réponse à chaque résolution que vous comptez utiliser, et abandonnez le point de terminaison de prévisualisation avant la fin septembre. Téléchargez Apidog si vous souhaitez que cette vérification soit sauvegardée avant la date limite plutôt qu'après.
