Google ahora ofrece dos modelos de video generativo bajo la misma clave API, y no son versiones uno del otro. Veo 3.1 es el renderizador cinematográfico con audio nativo. Gemini Omni 1.1 Flash, disponible generalmente desde el 27 de agosto de 2026, es el conversacional que editas en varias interacciones.
Elegir entre ellos se reduce a tres preguntas: ¿necesitas sonido, necesitas iterar en un clip después de verlo y cuánto debe durar el video terminado? Así es como responde cada modelo.
La tabla de comparación
| Gemini Omni 1.1 Flash | Veo 3.1 | |
|---|---|---|
| ID del modelo | gemini-omni-1.1-flash |
veo-3.1-generate-preview (más variantes rápida y ligera) |
| Interfaz API | Interactions API (/v1beta/interactions) |
generateContent, operación de larga duración |
| Audio nativo | No | Sí, siempre activado |
| Duración base del clip | 10 segundos | 4, 6 u 8 segundos |
| Longitud máxima por extensión | 40 segundos, en pasos de 10 segundos | 148 segundos, 7 segundos a la vez, hasta 20 extensiones |
| Contexto leído al extender | Hasta 10 segundos de metraje previo | No especificado |
| Edición conversacional | Sí, vía previous_interaction_id |
No |
| Primer y último fotograma | Sí | Sí, vía lastFrame |
| Medios de referencia | Hasta 3 clips de vídeo de 3 segundos cada uno | Hasta 3 imágenes de referencia |
| Resoluciones | 360p, 720p, 1080p, 4K | 720p, 1080p, 4K (solo 720p al extender) |
| Relaciones de aspecto | 16:9, 9:16 | 16:9, 9:16 |
| Costo por segundo 720p | ~$0.10 | $0.40 estándar, $0.10 rápido, $0.05 ligero |
| Nivel gratuito | No | No |
| Marca de agua | SynthID | SynthID |
Dónde gana Omni 1.1 Flash
Necesitas cambiar algo después de verlo. Este es el verdadero diferenciador. Omni se ejecuta en la API de Interacciones, por lo que generas un clip, lo miras y envías un turno de seguimiento que lo edita:
res1 = client.interactions.create(
model="gemini-omni-1.1-flash",
input="A woman playing violin outdoors.",
)
res2 = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=res1.id,
input="Make the violin invisible.",
)
Sin volver a subir, sin volver a describir la escena. Veo no tiene equivalente: cada solicitud de Veo es una generación nueva, y un cambio significa una nueva instrucción y una nueva tirada de dados.
Quieres hacer borradores de forma económica. El nivel 360p de Omni genera hasta un 60% más rápido a un tercio del costo de 720p. La resolución más baja de Veo es 720p. Cuando llevas doce intentos profundos en una instrucción, esa diferencia se acumula; el desglose de precios muestra los números.
Le estás alimentando vídeo, no imágenes fijas. Omni toma hasta tres clips de referencia de tres segundos cada uno y mapea su movimiento en la nueva escena. Las referencias de Veo son imágenes. Si estás haciendo coincidir un movimiento o un personaje a través de tomas, las referencias de movimiento hacen un trabajo que las imágenes fijas no pueden.
Necesitas que una toma se mantenga unida a través de una extensión. Omni lee hasta 10 segundos de metraje previo antes de continuar, a diferencia del único segundo final que usaba el modelo de vista previa. La guía de extensión de escena cubre lo que eso te ofrece.
Dónde gana Veo 3.1
Necesitas audio. Veo genera audio nativo con el video. La documentación de Omni cubre la salida de video e ignora el audio en los clips de referencia. Si tu entregable tiene sonido, esto lo decide por sí mismo, y la guía de la API de Veo 3.1 es la integración que debes leer.
Necesitas más de 40 segundos. Veo extiende 7 segundos a la vez hasta 20 veces, alcanzando los 148 segundos. Omni tiene un límite de 40. Ten en cuenta la restricción: la salida extendida de Veo es solo 720p, por lo que un clip largo y un clip 4K son trabajos diferentes.
Quieres el segundo más barato posible. Veo 3.1 Lite cuesta $0.05 por segundo a 720p, la mitad de la tarifa de Omni. A cambio, elimina el soporte 4K. Para la generación de alto volumen y bajo riesgo, Lite es el límite inferior del presupuesto en ambas familias.
Quieres un clip más corto. Veo realiza generaciones de 4 y 6 segundos. Omni genera 10 segundos. Si necesitas un corte de 4 segundos, Veo factura 4 segundos y Omni factura 10.
La decisión en cuatro líneas
- ¿Necesitas sonido? Veo 3.1.
- ¿Necesita ser más largo de 40 segundos? Veo 3.1.
- ¿Necesitas editar después de verlo, o hacer borradores con un presupuesto? Omni 1.1 Flash.
- ¿Necesitas el segundo más barato y nada más? Veo 3.1 Lite.
Muchas tuberías terminan usando ambos: Omni para explorar y fijar la toma de forma conversacional, Veo para renderizar la toma final con audio. Comparten una clave API, por lo que ejecutar ambos no te cuesta nada en la configuración.
Dos integraciones, no una
Elijas el camino que elijas, recuerda que son puntos finales estructuralmente diferentes. Omni es una solicitud POST a /v1beta/interactions con el modelo en el cuerpo, y devuelve el video en línea como base64 a menos que el archivo exceda los 4 MB, en cuyo caso obtienes una URI. Veo se ejecuta como una operación de larga duración que sondea, y los archivos generados permanecen en los servidores de Google durante 2 días antes de ser eliminados.
Esa diferencia importa si planeas cambiar de modelo más tarde. El código escrito para uno no se moverá al otro con un cambio de cadena de modelo, y cualquier capa de abstracción que construyas necesita manejar tanto una operación de sondeo como un cuerpo de respuesta de dos formas. El recorrido de la API de Omni cubre ese manejo de respuestas.
Ambos merecen ser fijados con solicitudes guardadas antes de construir sobre ellos. Configura una solicitud por modelo en Apidog, mantén la clave API en una variable de entorno, verifica la forma de la respuesta y aumenta los tiempos de espera mucho más allá de los valores predeterminados. Cuando comparas la calidad de la salida, ejecutar la misma instrucción a través de ambas solicitudes guardadas es un trabajo de dos clics en lugar de dos comandos curl que reescribirás de memoria el próximo mes.
Preguntas frecuentes
¿Es Gemini Omni un reemplazo para Veo? No. Google ofrece ambos, y Veo 3.1 no está en desuso. Son herramientas diferentes que ambas generan video.
¿Cuál es más barato? A 720p, Omni (~$0.10/segundo) y Veo 3.1 Fast ($0.10/segundo) coinciden. Veo 3.1 Lite es más barato a $0.05. Veo 3.1 Standard es el más caro a $0.40.
¿Puede alguno de ellos generar video con diálogo? Veo genera audio nativo. La salida de video de Omni no cubre la generación de audio, y no puede agregar diálogo al extender un video subido.
¿Ambos marcan su salida con marca de agua? Sí, ambos aplican SynthID, que es invisible para los espectadores y detectable programáticamente.
¿Qué hay de Sora o las otras API de video? Diferentes proveedores, diferentes ventajas y desventajas. OpenAI Sora 2 y Seedance 1.0 valen la pena si estás evaluando fuera de la oferta de Google.
¿Con cuál debería empezar? Si estás prototipando y no necesitas sonido, empieza con Omni en 360p. Es la forma más barata de averiguar si el video generado resuelve tu problema. Descarga Apidog y guarda esa primera solicitud para que la comparación sea repetible.
El resumen honesto: Veo renderiza, Omni conversa. La documentación de generación de video de Google cubre ambos, y ninguno desaparecerá, así que elige según el trabajo en lugar de según el equipo.
