Gemini Omni 1.1 Flash: Novedades del modelo de video de IA de Google

Gemini Omni 1.1 Flash alcanzó disponibilidad general el 27 de agosto de 2026 con extensión de escena de 40 segundos, control de fotogramas clave, borrador en 360p y escalado a 4K. Qué cambió, cuánto cuesta y la fecha límite de descontinuación de la vista previa.

Ashley Innocent

Ashley Innocent

28 August 2026

Gemini Omni 1.1 Flash: Novedades del modelo de video de IA de Google

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Google puso su modelo de video conversacional a disposición general el 27 de agosto de 2026. El ID del modelo es gemini-omni-1.1-flash, y reemplaza el punto final gemini-omni-flash-preview que se lanzó en vista previa pública el 30 de junio. Si construyó algo utilizando la vista previa, tiene una fecha límite: Google desactiva el punto final de vista previa el 30 de septiembre de 2026.

El lanzamiento GA no es una simple actualización de versión sin cambios significativos. Con él llegaron cuatro capacidades, y cada una cierra una brecha que dificultaba el uso de la vista previa en producción: extensión de escena hasta 40 segundos, control de primer y último fotograma, un modo borrador económico de 360p y escalado a 4K. Esta publicación cubre lo que cambió, su costo, dónde se ejecuta el modelo y lo que aún se niega a hacer.

Si desea conocer los antecedentes sobre qué es la familia Omni y por qué Google construyó un modelo de video centrado en el razonamiento en primer lugar, comience con qué es Gemini Omni. Esta publicación asume que ya conoce esa parte y desea los detalles de la versión 1.1.

Qué hace Gemini Omni 1.1 Flash

Omni 1.1 Flash toma texto, imágenes y video como entrada, y devuelve video. Se ejecuta en la API de Interacciones en lugar de generateContent, que es la misma superficie que Google usa para la generación con estado y de múltiples turnos. Eso importa más de lo que parece: puede generar un clip, luego enviar un turno de seguimiento que edite el clip que acaba de hacer, sin volver a subir nada.

Las cinco formas de tarea que soporta el modelo:

El audio de los clips de referencia se ignora. El modelo los lee solo para el movimiento y la apariencia.

La extensión de escena ahora lee 10 segundos de contexto

Este es el cambio principal. El modelo de vista previa miraba el último segundo de un clip antes de continuarlo, lo cual es contexto suficiente para mantener la paleta de colores estable y poco más. Los personajes se desviaban. Los movimientos de cámara se reiniciaban. Podías extender un video, pero no podías extender una toma.

Omni 1.1 analiza hasta 10 segundos de contexto previo, y Google describe el resultado como "consistencia visual y adherencia narrativa mejoradas". Se extiende en incrementos de 10 segundos hasta un acumulado de 40 segundos.

Dos límites a considerar. La extensión solo añade al final de un clip: no se puede anteponer metraje ni intercalar en el medio. Y los videos subidos tienen un máximo de 10 segundos de entrada a menos que permanezca dentro de una interacción multi-turno, donde el modelo ya mantiene el estado anterior.

El tutorial de extensión de escena de 40 segundos cubre la forma de la solicitud y dónde aparecen las uniones.

Control de fotogramas clave entre dos imágenes

Ahora puede entregar al modelo un primer fotograma y un último fotograma, además de una instrucción (prompt) que describa el movimiento entre ellos, y genera el metraje que conecta ambos. Google señala las órbitas de cámara, las transiciones de zoom y los clips en bucle como los usos obvios.

Para cualquiera que construya una herramienta de video en lugar de un juguete, esta es la característica que hace que la salida sea predecible. La conversión de texto a video es una máquina tragaperras. La interpolación de fotogramas le da dos puntos fijos y permite que el modelo resuelva el intermedio, que es un espacio mucho más pequeño para equivocarse.

El borrador en 360p y por qué cambia la ecuación de costos

Omni 1.1 genera previsualizaciones en 360p hasta un 60% más rápido que en 720p, a un tercio del costo. Google es explícito sobre el flujo de trabajo previsto: borrador en 360p hasta que la instrucción (prompt) sea correcta, luego renderizar el resultado final en 720p, 1080p o 4K.

Ese único cambio es más valioso para un presupuesto de producción que cualquier otro elemento del lanzamiento. La generación de video es costosa por segundo, y la mayor parte de lo que se genera durante la iteración de la instrucción se desecha. Pagar un tercio menos por las pasadas de descarte es la diferencia entre explorar libremente y racionar sus intentos. El desglose completo de precios tiene el cálculo por segundo.

La resolución se establece en el formato de respuesta, y 1080p y 4k son escalados de los fotogramas generados en lugar de renders nativos.

Dónde se ejecuta

Omni 1.1 Flash está disponible a través de:

Google también nombró socios de lanzamiento que ejecutan el modelo dentro de sus propios productos: Adobe Firefly, Figma Weave, Runway y GMI Cloud. Si utiliza alguna de esas herramientas, ya está enviando tráfico a este modelo.

No hay una capa gratuita en la API. A diferencia de los modelos Flash de texto, donde AI Studio le ofrece un carril gratuito con límite de tasa, cada segundo de salida de Omni se factura desde la primera solicitud. El modelo en sí es gratuito en YouTube Shorts y YouTube Create, que es un producto diferente con límites diferentes; el resumen de acceso gratuito cubre lo que cada ruta le ofrece.

Lo que aún no puede hacer

Lea esta lista antes de definir una función basada en el modelo.

Cada salida lleva una marca de agua SynthID, invisible para los espectadores y detectable programáticamente. Planifique esto si su producto hace afirmaciones de procedencia.

¿Omni 1.1 Flash o Veo 3.1?

Google ahora ofrece dos familias de generación de video con la misma clave API, lo cual es una situación genuinamente confusa. La versión corta: Veo 3.1 es el renderizador cinematográfico con audio nativo, y Omni 1.1 Flash es el conversacional con el que se habla en varios turnos. Un segundo de 720p de Omni cuesta aproximadamente un cuarto de un segundo estándar de Veo 3.1, y Veo no tiene un equivalente al bucle de edición de múltiples turnos.

La comparación lado a lado repasa los casos en los que cada uno es superior. Si ya tiene una integración de Veo, la guía de la API de Veo 3.1 sigue siendo precisa; nada en este lanzamiento la desaprueba.

Migración desde el punto final de vista previa

Todo lo que apunte a gemini-omni-flash-preview dejará de funcionar después del 30 de septiembre de 2026. La migración en sí suele ser un cambio de una sola línea en la cadena del modelo, pero hay dos cosas que vale la pena verificar antes de asumir que eso es todo:

  1. Valores predeterminados de resolución. 720p es el valor predeterminado ahora, y las opciones de 360p y 4K son nuevas. Si su código asumía un tamaño de salida fijo, confirme lo que realmente está obteniendo.
  2. Tamaño de respuesta. Los videos de más de 4 MB se devuelven como una URI en lugar de base64 en línea. Si su manejador solo lee output_video.data, una resolución más alta le entregará silenciosamente nada.

La forma más limpia de detectar ambos es guardar la solicitud en un cliente de API y comparar las respuestas entre los dos ID de modelo antes de hacer el cambio. Apidog lo maneja bien: coloque el ID del modelo en una variable de entorno, mantenga una solicitud guardada, cambie el entorno y compare. El tutorial de la API lo configura paso a paso.

Preguntas frecuentes

¿Cuál es el ID del modelo para Gemini Omni 1.1 Flash? gemini-omni-1.1-flash. El ID de vista previa que se retira es gemini-omni-flash-preview.

¿Cuándo salió Gemini Omni 1.1 Flash? El 27 de agosto de 2026, como lanzamiento GA. La vista previa se lanzó el 30 de junio de 2026.

¿Es gratuito Gemini Omni 1.1 Flash? No. No hay una capa gratuita para Omni, por lo que cada generación se factura. Los modelos de texto como Gemini 3.6 Flash todavía tienen un carril gratuito en AI Studio; este no lo tiene.

¿Qué duración puede tener un video de Gemini Omni? Los clips se generan en 10 segundos, y la extensión de escena los lleva hasta 40 segundos acumulativos en pasos de 10 segundos.

¿Gemini Omni genera audio? Los documentos cubren la salida de video e ignoran el audio en los clips de referencia. Veo 3.1 es el modelo con generación de audio nativo. Si el sonido es importante, comience por ahí.

¿Puedo editar un video que filmé yo mismo? Sí, hasta 10 segundos de entrada, fuera del EEE, Suiza y el Reino Unido. Súbalo con la API de Archivos y pase la URI como entrada.

Omni 1.1 Flash es la primera versión de este modelo que tiene la forma de algo que se podría lanzar. Extensión de escena que mantiene unida una toma, fotogramas clave que hacen predecible la salida y un modo borrador que hace asequible la iteración. Conecte una solicitud guardada con el ID del modelo GA, verifique la forma de la respuesta en cada resolución que planea usar y desactive el punto final de vista previa antes de finales de septiembre. Descargue Apidog si desea que esa verificación se guarde antes de la fecha límite y no después.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs