Google propose désormais deux modèles de vidéo générative sous la même clé API, et ce ne sont pas des versions l'un de l'autre. Veo 3.1 est le moteur de rendu cinématographique avec audio natif. Gemini Omni 1.1 Flash, généralement disponible depuis le 27 août 2026, est le modèle conversationnel que vous modifiez à travers des échanges.
Le choix entre les deux se résume à trois questions : avez-vous besoin de son, avez-vous besoin d'itérer sur un clip après l'avoir vu, et quelle doit être la durée de la vidéo finale. Voici comment chaque modèle répond.
Le tableau comparatif
| Gemini Omni 1.1 Flash | Veo 3.1 | |
|---|---|---|
| ID du modèle | gemini-omni-1.1-flash |
veo-3.1-generate-preview (plus les variantes fast et lite) |
| Surface d'API | API Interactions (/v1beta/interactions) |
generateContent, opération longue durée |
| Audio natif | Non | Oui, toujours activé |
| Durée de clip de base | 10 secondes | 4, 6 ou 8 secondes |
| Durée max. via extension | 40 secondes, par paliers de 10 secondes | 148 secondes, 7 secondes à la fois, jusqu'à 20 extensions |
| Contexte lu lors de l'extension | Jusqu'à 10 secondes de séquences précédentes | Non spécifié |
| Édition conversationnelle | Oui, via previous_interaction_id |
Non |
| Première et dernière image | Oui | Oui, via lastFrame |
| Média de référence | Jusqu'à 3 clips vidéo de 3 secondes chacun | Jusqu'à 3 images de référence |
| Résolutions | 360p, 720p, 1080p, 4K | 720p, 1080p, 4K (720p uniquement lors de l'extension) |
| Rapports d'aspect | 16:9, 9:16 | 16:9, 9:16 |
| Coût par seconde (720p) | ~0,10 $ | 0,40 $ standard, 0,10 $ rapide, 0,05 $ lite |
| Niveau gratuit | Non | Non |
| Filigrane | SynthID | SynthID |
Quand Omni 1.1 Flash est préférable
Vous avez besoin de modifier quelque chose après l'avoir vu. C'est la véritable distinction. Omni fonctionne avec l'API Interactions ; vous générez un clip, le visualisez, puis envoyez une requête de suivi pour le modifier :
res1 = client.interactions.create(
model="gemini-omni-1.1-flash",
input="A woman playing violin outdoors.",
)
res2 = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=res1.id,
input="Make the violin invisible.",
)
Pas de re-téléchargement, pas de re-description de la scène. Veo n'a pas d'équivalent : chaque requête Veo est une nouvelle génération, et une modification signifie une nouvelle invite et un nouveau coup de dés.
Vous voulez faire des ébauches à moindre coût. Le niveau 360p d'Omni génère jusqu'à 60 % plus rapidement pour un tiers du coût du 720p. La résolution la plus basse de Veo est 720p. Lorsque vous en êtes à la douzième tentative sur une invite, cette différence s'accumule ; la répartition des prix détaille les chiffres.
Vous lui fournissez de la vidéo, pas des images fixes. Omni prend jusqu'à trois clips de référence de trois secondes chacun et mappe leur mouvement sur la nouvelle scène. Les références de Veo sont des images. Si vous faites correspondre un mouvement ou un personnage sur plusieurs plans, les références de mouvement effectuent un travail que les images fixes ne peuvent pas faire.
Vous avez besoin qu'un plan reste cohérent lors d'une extension. Omni lit jusqu'à 10 secondes de séquences précédentes avant de continuer, contre la seule dernière seconde utilisée par le modèle d'aperçu. Le guide d'extension de scène explique ce que cela vous apporte.
Quand Veo 3.1 est préférable
Vous avez besoin d'audio. Veo génère de l'audio natif avec la vidéo. La documentation d'Omni couvre la sortie vidéo et ignore l'audio sur les clips de référence. Si votre livrable contient du son, cela décide de tout, et le guide API de Veo 3.1 est l'intégration à consulter.
Vous avez besoin de plus de 40 secondes. Veo étend par tranches de 7 secondes jusqu'à 20 fois, atteignant 148 secondes. Omni plafonne à 40. Notez la contrainte : la sortie étendue de Veo est uniquement en 720p, donc un clip long et un clip 4K sont des tâches différentes.
Vous voulez la seconde la moins chère possible. Veo 3.1 Lite coûte 0,05 $ par seconde en 720p, soit la moitié du tarif d'Omni. Il abandonne le support 4K en échange. Pour la génération à fort volume et à faible enjeu, Lite est le plancher budgétaire pour les deux familles.
Vous voulez un clip plus court. Veo propose des générations de 4 et 6 secondes. Omni génère 10 secondes. Si vous avez besoin d'une coupe de 4 secondes, Veo facture 4 secondes et Omni facture 10 secondes.
La décision en quatre lignes
- Besoin de son ? Veo 3.1.
- Besoin d'une durée supérieure à 40 secondes ? Veo 3.1.
- Besoin de modifier après l'avoir vu, ou de faire un brouillon à moindre coût ? Omni 1.1 Flash.
- Besoin de la seconde la moins chère et rien d'autre ? Veo 3.1 Lite.
De nombreuses pipelines finissent par utiliser les deux : Omni pour explorer et verrouiller le plan de manière conversationnelle, Veo pour rendre la prise finale avec audio. Ils partagent une clé API, donc l'exécution des deux ne vous coûte rien en termes de configuration.
Deux intégrations, pas une seule
Quelle que soit l'approche que vous choisissez, rappelez-vous qu'il s'agit de points d'extrémité structurellement différents. Omni est une requête POST vers /v1beta/interactions avec le modèle dans le corps, et il renvoie la vidéo en ligne en base64, sauf si le fichier dépasse 4 Mo, auquel cas vous obtenez une URI. Veo fonctionne comme une opération de longue durée que vous interrogez, et les fichiers générés restent sur les serveurs de Google pendant 2 jours avant d'être supprimés.
Cette différence est importante si vous prévoyez de changer de modèle plus tard. Le code écrit pour l'un ne fonctionnera pas avec l'autre par simple modification de la chaîne du modèle, et toute couche d'abstraction que vous construisez doit gérer à la fois une opération interrogée et un corps de réponse à deux formes. La présentation de l'API Omni couvre cette gestion des réponses.
Il est judicieux de les définir avec des requêtes enregistrées avant de les utiliser. Configurez une requête par modèle dans Apidog, conservez la clé API dans une variable d'environnement, vérifiez la forme de la réponse et augmentez les délais d'attente bien au-delà des valeurs par défaut. Lorsque vous comparez la qualité de la sortie, exécuter la même invite via les deux requêtes enregistrées est un travail en deux clics plutôt que deux commandes curl que vous devrez réécrire de mémoire le mois prochain.
FAQ
Gemini Omni remplace-t-il Veo ? Non. Google propose les deux, et Veo 3.1 n'est pas obsolète. Ce sont des outils différents qui génèrent tous deux de la vidéo.
Lequel est le moins cher ? En 720p, Omni (~0,10 $/seconde) et Veo 3.1 Fast (0,10 $/seconde) sont équivalents. Veo 3.1 Lite est moins cher à 0,05 $. Veo 3.1 Standard est le plus cher à 0,40 $.
L'un d'eux peut-il générer des vidéos avec des dialogues ? Veo génère de l'audio natif. La sortie vidéo d'Omni ne couvre pas la génération audio, et il ne peut pas ajouter de dialogue lors de l'extension d'une vidéo téléchargée.
Les deux filigranent-ils leur sortie ? Oui, les deux appliquent SynthID, qui est invisible pour les spectateurs et détectable par programmation.
Qu'en est-il de Sora ou des autres API vidéo ? Fournisseurs différents, compromis différents. OpenAI Sora 2 et Seedance 1.0 méritent d'être examinés si vous évaluez des options en dehors de l'offre de Google.
Avec lequel devrais-je commencer ? Si vous faites du prototypage et n'avez pas besoin de son, commencez avec Omni en 360p. C'est le moyen le moins cher de savoir si la vidéo générée résout votre problème. Téléchargez Apidog et enregistrez cette première requête afin que la comparaison soit reproductible.
Le résumé honnête : Veo rend, Omni converse. La documentation de Google sur la génération vidéo couvre les deux, et aucun des deux ne disparaîtra, alors choisissez en fonction de la tâche plutôt que de l'équipe.
