Google puso su modelo de video conversacional a disposición general el 27 de agosto de 2026. El ID del modelo es gemini-omni-1.1-flash, y reemplaza el punto final gemini-omni-flash-preview que se lanzó en vista previa pública el 30 de junio. Si construyó algo utilizando la vista previa, tiene una fecha límite: Google desactiva el punto final de vista previa el 30 de septiembre de 2026.
El lanzamiento GA no es una simple actualización de versión sin cambios significativos. Con él llegaron cuatro capacidades, y cada una cierra una brecha que dificultaba el uso de la vista previa en producción: extensión de escena hasta 40 segundos, control de primer y último fotograma, un modo borrador económico de 360p y escalado a 4K. Esta publicación cubre lo que cambió, su costo, dónde se ejecuta el modelo y lo que aún se niega a hacer.
Si desea conocer los antecedentes sobre qué es la familia Omni y por qué Google construyó un modelo de video centrado en el razonamiento en primer lugar, comience con qué es Gemini Omni. Esta publicación asume que ya conoce esa parte y desea los detalles de la versión 1.1.
Qué hace Gemini Omni 1.1 Flash
Omni 1.1 Flash toma texto, imágenes y video como entrada, y devuelve video. Se ejecuta en la API de Interacciones en lugar de generateContent, que es la misma superficie que Google usa para la generación con estado y de múltiples turnos. Eso importa más de lo que parece: puede generar un clip, luego enviar un turno de seguimiento que edite el clip que acaba de hacer, sin volver a subir nada.
Las cinco formas de tarea que soporta el modelo:
- Texto a video: se introduce una instrucción (prompt), se obtiene un clip.
- Imagen a video: una imagen se convierte en el fotograma inicial o en una guía de estilo para el movimiento.
- Referencia a video: hasta tres clips de referencia de tres segundos cada uno mapean el movimiento, la apariencia y la consistencia del personaje a una nueva escena.
- Editar: cambiar algo dentro de un video que ya generó, en conversación.
- Extender: añadir otros 10 segundos al final de un clip.
El audio de los clips de referencia se ignora. El modelo los lee solo para el movimiento y la apariencia.
La extensión de escena ahora lee 10 segundos de contexto
Este es el cambio principal. El modelo de vista previa miraba el último segundo de un clip antes de continuarlo, lo cual es contexto suficiente para mantener la paleta de colores estable y poco más. Los personajes se desviaban. Los movimientos de cámara se reiniciaban. Podías extender un video, pero no podías extender una toma.
Omni 1.1 analiza hasta 10 segundos de contexto previo, y Google describe el resultado como "consistencia visual y adherencia narrativa mejoradas". Se extiende en incrementos de 10 segundos hasta un acumulado de 40 segundos.
Dos límites a considerar. La extensión solo añade al final de un clip: no se puede anteponer metraje ni intercalar en el medio. Y los videos subidos tienen un máximo de 10 segundos de entrada a menos que permanezca dentro de una interacción multi-turno, donde el modelo ya mantiene el estado anterior.
El tutorial de extensión de escena de 40 segundos cubre la forma de la solicitud y dónde aparecen las uniones.
Control de fotogramas clave entre dos imágenes
Ahora puede entregar al modelo un primer fotograma y un último fotograma, además de una instrucción (prompt) que describa el movimiento entre ellos, y genera el metraje que conecta ambos. Google señala las órbitas de cámara, las transiciones de zoom y los clips en bucle como los usos obvios.
Para cualquiera que construya una herramienta de video en lugar de un juguete, esta es la característica que hace que la salida sea predecible. La conversión de texto a video es una máquina tragaperras. La interpolación de fotogramas le da dos puntos fijos y permite que el modelo resuelva el intermedio, que es un espacio mucho más pequeño para equivocarse.
El borrador en 360p y por qué cambia la ecuación de costos
Omni 1.1 genera previsualizaciones en 360p hasta un 60% más rápido que en 720p, a un tercio del costo. Google es explícito sobre el flujo de trabajo previsto: borrador en 360p hasta que la instrucción (prompt) sea correcta, luego renderizar el resultado final en 720p, 1080p o 4K.
Ese único cambio es más valioso para un presupuesto de producción que cualquier otro elemento del lanzamiento. La generación de video es costosa por segundo, y la mayor parte de lo que se genera durante la iteración de la instrucción se desecha. Pagar un tercio menos por las pasadas de descarte es la diferencia entre explorar libremente y racionar sus intentos. El desglose completo de precios tiene el cálculo por segundo.
La resolución se establece en el formato de respuesta, y 1080p y 4k son escalados de los fotogramas generados en lugar de renders nativos.
Dónde se ejecuta
Omni 1.1 Flash está disponible a través de:
- La API de Gemini en Google AI Studio, para desarrolladores.
- La API de la Plataforma de Agentes Empresariales de Gemini, para implementaciones empresariales.
- Google Flow, para suscriptores de AI Plus, Pro y Ultra.
- La aplicación Gemini, donde los suscriptores obtienen extensión de escena.
Google también nombró socios de lanzamiento que ejecutan el modelo dentro de sus propios productos: Adobe Firefly, Figma Weave, Runway y GMI Cloud. Si utiliza alguna de esas herramientas, ya está enviando tráfico a este modelo.
No hay una capa gratuita en la API. A diferencia de los modelos Flash de texto, donde AI Studio le ofrece un carril gratuito con límite de tasa, cada segundo de salida de Omni se factura desde la primera solicitud. El modelo en sí es gratuito en YouTube Shorts y YouTube Create, que es un producto diferente con límites diferentes; el resumen de acceso gratuito cubre lo que cada ruta le ofrece.
Lo que aún no puede hacer
Lea esta lista antes de definir una función basada en el modelo.
- No hay controles de instrucción (prompt) que podría esperar. Las instrucciones del sistema,
temperature,top_p, secuencias de detención e instrucciones negativas no son compatibles. Si desea excluir algo, lo escribe en la instrucción regular. - Restricciones regionales. La carga y edición de videos no están disponibles en el Espacio Económico Europeo, Suiza y el Reino Unido, como tampoco lo está la edición de imágenes que contengan menores. Los videos generados por el modelo siguen siendo editables en esas regiones.
- Personas reconocibles. La edición de ciertos individuos identificables está bloqueada.
- Diálogo en video subido. Puede extender un clip subido en silencio o trabajar en una interacción de varios turnos, pero no puede añadir diálogo al extender la subida de otra persona.
- Un video a la vez para el razonamiento. El modelo no razonará a través de múltiples videos de entrada.
- Solo inglés, en la práctica. Google dice que el inglés está totalmente soportado y otros idiomas no han sido probados.
Cada salida lleva una marca de agua SynthID, invisible para los espectadores y detectable programáticamente. Planifique esto si su producto hace afirmaciones de procedencia.
¿Omni 1.1 Flash o Veo 3.1?
Google ahora ofrece dos familias de generación de video con la misma clave API, lo cual es una situación genuinamente confusa. La versión corta: Veo 3.1 es el renderizador cinematográfico con audio nativo, y Omni 1.1 Flash es el conversacional con el que se habla en varios turnos. Un segundo de 720p de Omni cuesta aproximadamente un cuarto de un segundo estándar de Veo 3.1, y Veo no tiene un equivalente al bucle de edición de múltiples turnos.
La comparación lado a lado repasa los casos en los que cada uno es superior. Si ya tiene una integración de Veo, la guía de la API de Veo 3.1 sigue siendo precisa; nada en este lanzamiento la desaprueba.
Migración desde el punto final de vista previa
Todo lo que apunte a gemini-omni-flash-preview dejará de funcionar después del 30 de septiembre de 2026. La migración en sí suele ser un cambio de una sola línea en la cadena del modelo, pero hay dos cosas que vale la pena verificar antes de asumir que eso es todo:
- Valores predeterminados de resolución. 720p es el valor predeterminado ahora, y las opciones de 360p y 4K son nuevas. Si su código asumía un tamaño de salida fijo, confirme lo que realmente está obteniendo.
- Tamaño de respuesta. Los videos de más de 4 MB se devuelven como una URI en lugar de base64 en línea. Si su manejador solo lee
output_video.data, una resolución más alta le entregará silenciosamente nada.
La forma más limpia de detectar ambos es guardar la solicitud en un cliente de API y comparar las respuestas entre los dos ID de modelo antes de hacer el cambio. Apidog lo maneja bien: coloque el ID del modelo en una variable de entorno, mantenga una solicitud guardada, cambie el entorno y compare. El tutorial de la API lo configura paso a paso.
Preguntas frecuentes
¿Cuál es el ID del modelo para Gemini Omni 1.1 Flash? gemini-omni-1.1-flash. El ID de vista previa que se retira es gemini-omni-flash-preview.
¿Cuándo salió Gemini Omni 1.1 Flash? El 27 de agosto de 2026, como lanzamiento GA. La vista previa se lanzó el 30 de junio de 2026.
¿Es gratuito Gemini Omni 1.1 Flash? No. No hay una capa gratuita para Omni, por lo que cada generación se factura. Los modelos de texto como Gemini 3.6 Flash todavía tienen un carril gratuito en AI Studio; este no lo tiene.
¿Qué duración puede tener un video de Gemini Omni? Los clips se generan en 10 segundos, y la extensión de escena los lleva hasta 40 segundos acumulativos en pasos de 10 segundos.
¿Gemini Omni genera audio? Los documentos cubren la salida de video e ignoran el audio en los clips de referencia. Veo 3.1 es el modelo con generación de audio nativo. Si el sonido es importante, comience por ahí.
¿Puedo editar un video que filmé yo mismo? Sí, hasta 10 segundos de entrada, fuera del EEE, Suiza y el Reino Unido. Súbalo con la API de Archivos y pase la URI como entrada.
Omni 1.1 Flash es la primera versión de este modelo que tiene la forma de algo que se podría lanzar. Extensión de escena que mantiene unida una toma, fotogramas clave que hacen predecible la salida y un modo borrador que hace asequible la iteración. Conecte una solicitud guardada con el ID del modelo GA, verifique la forma de la respuesta en cada resolución que planea usar y desactive el punto final de vista previa antes de finales de septiembre. Descargue Apidog si desea que esa verificación se guarde antes de la fecha límite y no después.
