Gemini Omni 1.1 Flash : les nouveautés du modèle vidéo GA de Google

Gemini Omni 1.1 Flash a été lancé en disponibilité générale le 27 août 2026 avec une extension de scène de 40 secondes, le contrôle des images clés, l'ébauche 360p et la mise à l'échelle 4K. Ce qui a changé, son coût et la date limite de dépréciation de la prévisualisation.

Ashley Innocent

Ashley Innocent

28 August 2026

Gemini Omni 1.1 Flash : les nouveautés du modèle vidéo GA de Google

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Google a rendu son modèle vidéo conversationnel généralement disponible le 27 août 2026. L'identifiant du modèle est gemini-omni-1.1-flash, et il remplace le point de terminaison gemini-omni-flash-preview qui a été lancé en préversion publique le 30 juin. Si vous avez développé quoi que ce soit en utilisant la préversion, vous avez une date limite : Google désactivera le point de terminaison de préversion le 30 septembre 2026.

La version GA (disponibilité générale) n'est pas une simple mise à jour de version sans nouveautés. Quatre fonctionnalités l'accompagnent, et chacune comble une lacune qui rendait la préversion difficile à utiliser en production : l'extension de scène jusqu'à 40 secondes, le contrôle de la première et de la dernière image, un mode brouillon 360p économique et la mise à l'échelle 4K. Cet article traite des changements, de son coût, de l'endroit où le modèle s'exécute et de ce qu'il refuse toujours de faire.

Si vous souhaitez connaître l'historique de la famille Omni et les raisons pour lesquelles Google a initialement construit un modèle vidéo axé sur le raisonnement, commencez par qu'est-ce que Gemini Omni. Cet article suppose que vous connaissez déjà cette partie et que vous souhaitez les détails de la version 1.1.

Ce que fait Gemini Omni 1.1 Flash

Omni 1.1 Flash prend du texte, des images et de la vidéo en entrée, et renvoie de la vidéo. Il s'exécute sur l'API Interactions plutôt que sur generateContent, qui est la même interface que Google utilise pour la génération conversationnelle et multi-tour. Cela a plus d'importance qu'il n'y paraît : vous pouvez générer un clip, puis envoyer une requête de suivi qui modifie le clip que vous venez de créer, sans avoir à tout re-télécharger.

Les cinq types de tâches pris en charge par le modèle :

L'audio sur les clips de référence est ignoré. Le modèle les lit uniquement pour le mouvement et l'apparence.

L'extension de scène lit désormais 10 secondes de contexte

C'est le changement majeur. Le modèle de préversion examinait la dernière seconde d'un clip avant de le poursuivre, ce qui est à peu près suffisant pour maintenir la palette de couleurs stable et pas grand-chose d'autre. Les personnages dérivaient. Les mouvements de caméra se réinitialisaient. Vous pouviez étendre une vidéo, mais vous ne pouviez pas étendre une séquence.

Omni 1.1 analyse jusqu'à 10 secondes de contexte antérieur, et Google décrit le résultat comme une « cohérence visuelle et une adhérence narrative améliorées ». Vous pouvez étendre par tranches de 10 secondes jusqu'à un total cumulatif de 40 secondes.

Deux limites à prendre en compte. L'extension n'ajoute qu'à la fin d'un clip : vous ne pouvez pas ajouter de séquences au début ni les insérer au milieu. Et les vidéos téléchargées sont limitées à 10 secondes d'entrée, sauf si vous restez dans une interaction multi-tour, où le modèle conserve déjà l'état précédent.

Le guide détaillé d'extension de scène de 40 secondes couvre la forme de la requête et les endroits où les raccordements apparaissent.

Contrôle des images clés entre deux images

Vous pouvez désormais fournir au modèle une première et une dernière image, ainsi qu'une invite décrivant le mouvement entre elles, et il génère les séquences qui relient les deux. Google cite les orbites de caméra, les transitions de zoom et les clips en boucle comme des utilisations évidentes.

Pour quiconque crée un outil vidéo plutôt qu'un gadget, c'est la fonctionnalité qui rend la sortie prévisible. Le texte-vers-vidéo est une machine à sous. L'interpolation d'images vous donne deux points fixes et permet au modèle de résoudre ce qui se trouve au milieu, ce qui est un espace beaucoup plus petit pour se tromper.

Le mode brouillon 360p et pourquoi il change le calcul des coûts

Omni 1.1 génère des prévisualisations 360p jusqu'à 60 % plus rapidement que le 720p, pour un tiers du coût. Google est explicite quant au flux de travail envisagé : brouillonnez en 360p jusqu'à ce que l'invite soit correcte, puis re-rendez la version finale en 720p, 1080p ou 4K.

Ce seul changement a plus de valeur pour un budget de production que tout autre élément de cette version. La génération de vidéo est coûteuse par seconde, et la majeure partie de ce que vous générez pendant l'itération de l'invite est jetée. Payer un tiers moins cher pour les essais jetables fait la différence entre explorer librement et rationner vos tentatives. La répartition complète des prix inclut le calcul par seconde.

La résolution est définie dans le format de réponse, et 1080p et 4k sont des mises à l'échelle des images générées plutôt que des rendus natifs.

Où il s'exécute

Omni 1.1 Flash est disponible via :

Google a également nommé des partenaires de lancement qui utilisent le modèle dans leurs propres produits : Adobe Firefly, Figma Weave, Runway et GMI Cloud. Si vous utilisez l'un de ces outils, vous envoyez déjà du trafic à ce modèle.

Il n'y a pas de niveau gratuit sur l'API. Contrairement aux modèles Flash de texte, où AI Studio vous offre une voie gratuite à débit limité, chaque seconde de sortie Omni est facturée dès la première requête. Le modèle lui-même est gratuit sur YouTube Shorts et YouTube Create, qui est un produit différent avec des limites différentes ; le récapitulatif des accès gratuits explique ce que chaque voie vous apporte.

Ce qu'il ne peut toujours pas faire

Lisez cette liste avant d'intégrer une fonctionnalité autour du modèle.

Chaque sortie porte un filigrane SynthID, invisible pour les spectateurs et détectable par programmation. Prévoyez cela si votre produit émet des allégations de provenance.

Omni 1.1 Flash ou Veo 3.1 ?

Google propose désormais deux familles de génération vidéo avec la même clé API, ce qui est une situation vraiment confuse. En bref : Veo 3.1 est le moteur de rendu cinématographique avec audio natif, et Omni 1.1 Flash est le modèle conversationnel avec lequel vous interagissez par tours. La seconde 720p d'Omni coûte environ un quart d'une seconde standard de Veo 3.1, et Veo n'a pas d'équivalent à la boucle d'édition multi-tour.

La comparaison côte à côte passe en revue les cas où chacun l'emporte. Si vous avez déjà une intégration Veo, le guide de l'API Veo 3.1 est toujours précis ; rien dans cette version ne le déprécie.

Migration hors du point de terminaison de prévisualisation

Tout ce qui pointe vers gemini-omni-flash-preview cessera de fonctionner après le 30 septembre 2026. La migration elle-même est généralement un changement d'une seule ligne de la chaîne du modèle, mais deux choses méritent d'être vérifiées avant de supposer que c'est tout :

  1. Paramètres de résolution par défaut. Le 720p est maintenant la valeur par défaut, et les options 360p et 4K sont nouvelles. Si votre code supposait une taille de sortie fixe, confirmez ce que vous obtenez réellement.
  2. Taille de la réponse. Les vidéos de plus de 4 Mo sont renvoyées sous forme d'URI au lieu d'un base64 intégré. Si votre gestionnaire ne lit que output_video.data, une résolution plus élevée ne vous renverra silencieusement rien.

La manière la plus propre de détecter les deux est d'enregistrer la requête dans un client API et de comparer les réponses entre les deux identifiants de modèle avant de basculer. Apidog gère cela très bien : placez l'identifiant du modèle dans une variable d'environnement, conservez une requête enregistrée, changez l'environnement et comparez. Le guide détaillé de l'API explique cela étape par étape.

FAQ

Omni 1.1 Flash est la première version de ce modèle qui ressemble à quelque chose que vous mettriez en production. L'extension de scène qui maintient la cohérence d'une prise de vue, les images clés qui rendent la sortie prévisible, et un mode brouillon qui rend l'itération abordable. Configurez une requête enregistrée avec l'identifiant du modèle GA, vérifiez la forme de la réponse à chaque résolution que vous comptez utiliser, et abandonnez le point de terminaison de prévisualisation avant la fin septembre. Téléchargez Apidog si vous souhaitez que cette vérification soit sauvegardée avant la date limite plutôt qu'après.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API