O Google disponibilizou seu modelo de vídeo conversacional em 27 de agosto de 2026. O ID do modelo é gemini-omni-1.1-flash, e ele substitui o endpoint gemini-omni-flash-preview que foi lançado em prévia pública em 30 de junho. Se você construiu algo usando a prévia, você tem um prazo: o Google desativará o endpoint de prévia em 30 de setembro de 2026.
O lançamento da GA (Disponibilidade Geral) não é apenas um aumento de versão sem novidades. Quatro recursos foram adicionados, e cada um deles preenche uma lacuna que tornava a prévia difícil de usar em produção: extensão de cena para até 40 segundos, controle de primeiro e último quadro, um modo de rascunho 360p barato e upscaling para 4K. Esta postagem aborda o que mudou, os custos, onde o modelo roda e o que ele ainda não faz.
Se você quer o contexto sobre o que é a família Omni e por que o Google construiu um modelo de vídeo focado em raciocínio, comece com o que é Gemini Omni. Esta postagem assume que você já conhece essa parte e quer os detalhes da versão 1.1.
O que o Gemini Omni 1.1 Flash faz
O Omni 1.1 Flash aceita texto, imagens e vídeo como entrada, e retorna vídeo. Ele roda na API de Interações em vez de generateContent, que é a mesma superfície que o Google usa para geração multi-turn com estado. Isso é mais importante do que parece: você pode gerar um clipe, então enviar uma interação de acompanhamento que edita o clipe que você acabou de fazer, sem precisar reenviar nada.
Os cinco tipos de tarefa que o modelo suporta:
- Texto para vídeo: um prompt entra, um clipe sai.
- Imagem para vídeo: uma imagem se torna o quadro de abertura, ou um guia de estilo para movimento.
- Referência para vídeo: até três clipes de referência de três segundos cada mapeiam movimento, aparência e consistência de personagem para uma nova cena.
- Editar: altere algo dentro de um vídeo que você já gerou, em conversação.
- Estender: adicione mais 10 segundos ao final de um clipe.
O áudio nos clipes de referência é ignorado. O modelo os lê apenas para movimento e aparência.
Extensão de cena agora lê 10 segundos de contexto
Esta é a principal mudança. O modelo de prévia olhava para o último segundo de um clipe antes de continuá-lo, o que é contexto suficiente para manter a paleta de cores estável e não muito mais. Personagens se deslocavam. Movimentos de câmera eram redefinidos. Você podia estender um vídeo, mas não podia estender um plano.
O Omni 1.1 analisa até 10 segundos de contexto anterior, e o Google descreve o resultado como “consistência visual e aderência narrativa aprimoradas”. Você estende em incrementos de 10 segundos até um total acumulado de 40 segundos.
Dois limites a serem considerados. A extensão apenas adiciona ao final de um clipe: você não pode prender filmagens ou emendar no meio. E vídeos carregados têm um máximo de 10 segundos de entrada, a menos que você permaneça dentro de uma interação multi-turn, onde o modelo já mantém o estado anterior.
O passo a passo da extensão de cena de 40 segundos do Gemini Omni aborda o formato da requisição e onde as emendas aparecem.
Controle de keyframe entre duas imagens
Agora você pode entregar ao modelo um primeiro e um último quadro, além de um prompt descrevendo o movimento entre eles, e ele gera a filmagem que conecta os dois. O Google aponta para órbitas de câmera, transições de zoom e clipes em loop como os usos óbvios.
Para qualquer um que esteja construindo uma ferramenta de vídeo em vez de um brinquedo, este é o recurso que torna a saída previsível. Texto para vídeo é uma máquina caça-níqueis. A interpolação de quadros oferece dois pontos fixos e permite que o modelo resolva o que está no meio, o que é um espaço muito menor para errar.
Rascunho em 360p e por que ele muda a matemática de custos
O Omni 1.1 gera prévias em 360p até 60% mais rápido que em 720p, a um terço do custo. O Google é explícito sobre o fluxo de trabalho pretendido: rascunhe em 360p até que o prompt esteja correto, então renderize a versão final em 720p, 1080p ou 4K.
Essa única mudança vale mais para um orçamento de produção do que qualquer outro item no lançamento. A geração de vídeo é cara por segundo, e a maior parte do que você gera durante a iteração de prompts é descartada. Pagar um terço a menos pelos rascunhos descartáveis é a diferença entre explorar livremente e racionar suas tentativas. O detalhamento completo de preços tem a matemática por segundo.
A resolução é definida no formato da resposta, e 1080p e 4k são upscales dos quadros gerados, em vez de renderizações nativas.
Onde ele roda
O Omni 1.1 Flash está disponível através de:
- A API Gemini no Google AI Studio, para desenvolvedores
- A API Gemini Enterprise Agent Platform, para implementações corporativas
- Google Flow, para assinantes AI Plus, Pro e Ultra
- O aplicativo Gemini, onde os assinantes obtêm extensão de cena
O Google também nomeou parceiros de lançamento que estão executando o modelo em seus próprios produtos: Adobe Firefly, Figma Weave, Runway e GMI Cloud. Se você usa alguma dessas ferramentas, já está enviando tráfego para este modelo.
Não há camada gratuita na API. Diferente dos modelos de texto Flash, onde o AI Studio oferece uma faixa gratuita com limite de taxa, cada segundo de saída do Omni é cobrado desde a primeira requisição. O modelo em si é gratuito no YouTube Shorts e YouTube Create, que é um produto diferente com limites diferentes; o resumo de acesso gratuito cobre o que cada caminho oferece.
O que ele ainda não consegue fazer
Leia esta lista antes de definir um recurso em torno do modelo.
- Nenhum controle de prompt que você esperaria. Instruções do sistema,
temperature,top_p, sequências de parada e prompts negativos não são suportados. Se você quiser excluir algo, você escreve isso no prompt regular. - Restrições regionais. O upload e a edição de vídeos não estão disponíveis no Espaço Econômico Europeu, Suíça e Reino Unido, assim como a edição de imagens que contenham menores. Vídeos gerados pelo modelo permanecem editáveis nessas regiões.
- Pessoas reconhecíveis. A edição de certos indivíduos identificáveis é bloqueada.
- Diálogo em vídeo carregado. Você pode estender um clipe carregado silenciosamente, ou trabalhar em uma interação multi-turn, mas você não pode adicionar diálogo ao estender o upload de outra pessoa.
- Um vídeo por vez para raciocínio. O modelo não raciocinará entre múltiplos vídeos de entrada.
- Apenas inglês, na prática. O Google diz que o inglês é totalmente suportado e outras línguas não foram testadas.
Cada saída carrega uma marca d'água SynthID, invisível para os espectadores e detectável programaticamente. Planeje isso se seu produto fizer alegações de proveniência.
Omni 1.1 Flash ou Veo 3.1?
O Google agora oferece duas famílias de geração de vídeo na mesma chave de API, o que é uma situação genuinamente confusa. A versão curta: Veo 3.1 é o renderizador cinematográfico com áudio nativo, e Omni 1.1 Flash é o conversacional com o qual você interage em várias etapas. O segundo de 720p do Omni custa cerca de um quarto de um segundo padrão do Veo 3.1, e o Veo não tem equivalente ao loop de edição multi-turn.
A comparação lado a lado aborda os casos em que cada um se destaca. Se você já tem uma integração Veo, o guia da API Veo 3.1 ainda é preciso; nada neste lançamento o deprecia.
Migrando do endpoint de prévia
Qualquer coisa apontando para gemini-omni-flash-preview deixará de funcionar após 30 de setembro de 2026. A migração em si é geralmente uma mudança de uma linha na string do modelo, mas duas coisas valem a pena verificar antes de assumir que é só isso:
- Padrões de resolução. 720p é o padrão agora, e as opções 360p e 4K são novas. Se seu código assumia um tamanho de saída fixo, confirme o que você realmente está recebendo de volta.
- Tamanho da resposta. Vídeos com mais de 4MB retornam como um URI em vez de base64 embutido. Se seu manipulador só lê
output_video.data, uma resolução mais alta silenciosamente não retornará nada.
A maneira mais limpa de pegar ambos é salvar a requisição em um cliente de API e comparar as respostas entre os dois IDs de modelo antes de mudar. O Apidog lida bem com isso: coloque o ID do modelo em uma variável de ambiente, mantenha uma requisição salva, altere o ambiente e compare. O passo a passo da API configura isso etapa por etapa.
FAQ
Qual é o ID do modelo para Gemini Omni 1.1 Flash? gemini-omni-1.1-flash. O ID da prévia que será desativado é gemini-omni-flash-preview.
Quando o Gemini Omni 1.1 Flash foi lançado? 27 de agosto de 2026, como lançamento GA. A prévia foi lançada em 30 de junho de 2026.
O Gemini Omni 1.1 Flash é gratuito? Não. Não há camada gratuita para o Omni, então toda geração é cobrada. Modelos de texto como Gemini 3.6 Flash ainda têm uma faixa gratuita no AI Studio; este não tem.
Quanto tempo pode ter um vídeo Gemini Omni? Os clipes são gerados com 10 segundos, e a extensão de cena os leva a 40 segundos acumulados em etapas de 10 segundos.
O Gemini Omni gera áudio? A documentação cobre a saída de vídeo e ignora o áudio em clipes de referência. Veo 3.1 é o modelo com geração de áudio nativo. Se o som é importante, comece por lá.
Posso editar um vídeo que filmei? Sim, até 10 segundos de entrada, fora do EEE, Suíça e Reino Unido. Faça o upload com a API Files e passe o URI como entrada.
O Omni 1.1 Flash é a primeira versão deste modelo que se assemelha a algo que você lançaria. Extensão de cena que mantém um plano coeso, keyframes que tornam a saída previsível e um modo de rascunho que torna a iteração acessível. Conecte uma requisição salva ao ID do modelo GA, verifique o formato da resposta em todas as resoluções que você planeja usar e saia do endpoint de prévia antes do final de setembro. Baixe o Apidog se você quiser essa verificação salva antes do prazo, em vez de depois.
