O Google agora oferece dois modelos de vídeo generativos com a mesma chave de API, e eles não são versões um do outro. O Veo 3.1 é o renderizador cinematográfico com áudio nativo. O Gemini Omni 1.1 Flash, geralmente disponível desde 27 de agosto de 2026, é o modelo conversacional que você edita em várias interações.
A escolha entre eles se resume a três perguntas: você precisa de som, precisa iterar em um clipe depois de vê-lo e qual o tempo de duração que o vídeo final deve ter. Veja como cada modelo responde.
A tabela de comparação
| Gemini Omni 1.1 Flash | Veo 3.1 | |
|---|---|---|
| ID do Modelo | gemini-omni-1.1-flash |
veo-3.1-generate-preview (mais variantes fast e lite) |
| Superfície da API | API de Interações (/v1beta/interactions) |
generateContent, operação de longa duração |
| Áudio nativo | Não | Sim, sempre ativado |
| Duração base do clipe | 10 segundos | 4, 6 ou 8 segundos |
| Duração máxima via extensão | 40 segundos, em etapas de 10 segundos | 148 segundos, 7 segundos por vez, até 20 extensões |
| Contexto lido ao estender | Até 10 segundos de filmagem anterior | Não declarado |
| Edição conversacional | Sim, via previous_interaction_id |
Não |
| Primeiro e último quadro | Sim | Sim, via lastFrame |
| Mídia de referência | Até 3 clipes de vídeo de 3 segundos cada | Até 3 imagens de referência |
| Resoluções | 360p, 720p, 1080p, 4K | 720p, 1080p, 4K (apenas 720p ao estender) |
| Proporções de tela | 16:9, 9:16 | 16:9, 9:16 |
| Custo por segundo em 720p | ~$0.10 | $0.40 padrão, $0.10 rápido, $0.05 lite |
| Nível gratuito | Não | Não |
| Marca d'água | SynthID | SynthID |
Onde o Omni 1.1 Flash se destaca
Você precisa mudar algo depois de vê-lo. Este é o verdadeiro diferencial. O Omni funciona com a API de Interações, então você gera um clipe, o visualiza e envia uma interação de acompanhamento que o edita:
res1 = client.interactions.create(
model="gemini-omni-1.1-flash",
input="A woman playing violin outdoors.",
)
res2 = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=res1.id,
input="Make the violin invisible.",
)
Sem fazer upload novamente, sem redescrever a cena. O Veo não tem equivalente: cada solicitação do Veo é uma geração nova, e uma mudança significa um novo prompt e uma nova tentativa.
Você quer fazer rascunhos de forma barata. O nível 360p do Omni gera até 60% mais rápido com um terço do custo de 720p. A resolução mais baixa do Veo é 720p. Quando você está doze tentativas em um prompt, essa diferença se acumula; a análise de preços mostra os números.
Você está alimentando-o com vídeo, não com imagens estáticas. O Omni aceita até três clipes de referência de três segundos cada e mapeia seu movimento para a nova cena. As referências do Veo são imagens. Se você está combinando um movimento ou um personagem em várias tomadas, as referências de movimento fazem um trabalho que as imagens estáticas não conseguem.
Você precisa que uma cena se mantenha coesa durante uma extensão. O Omni lê até 10 segundos de filmagem anterior antes de continuar, em contraste com o único segundo final que o modelo de pré-visualização usava. O guia de extensão de cena aborda o que isso oferece.
Onde o Veo 3.1 se destaca
Você precisa de áudio. O Veo gera áudio nativo com o vídeo. A documentação do Omni cobre a saída de vídeo e ignora o áudio em clipes de referência. Se sua entrega tem som, isso por si só decide a escolha, e o guia da API do Veo 3.1 é a integração a ser lida.
Você precisa de mais de 40 segundos. O Veo estende 7 segundos por vez, até 20 vezes, atingindo 148 segundos. O Omni limita a 40. Observe a restrição: a saída estendida do Veo é apenas em 720p, então um clipe longo e um clipe em 4K são trabalhos diferentes.
Você quer o segundo mais barato possível. O Veo 3.1 Lite custa $0.05 por segundo em 720p, metade da taxa do Omni. Em troca, ele não oferece suporte a 4K. Para geração de alto volume e baixo risco, o Lite é o piso orçamentário em ambas as famílias.
Você quer um clipe mais curto. O Veo faz gerações de 4 e 6 segundos. O Omni gera 10 segundos. Se você precisa de um corte de 4 segundos, o Veo cobra por 4 segundos e o Omni cobra por 10.
A decisão em quatro linhas
- Precisa de som? Veo 3.1.
- Precisa ser mais longo que 40 segundos? Veo 3.1.
- Precisa de edição depois de vê-lo, ou fazer rascunhos com orçamento limitado? Omni 1.1 Flash.
- Precisa do segundo mais barato e nada mais? Veo 3.1 Lite.
Muitas pipelines acabam usando ambos: Omni para explorar e fixar a cena de forma conversacional, Veo para renderizar a tomada final com áudio. Eles compartilham uma chave de API, então usar ambos não custa nada na configuração.
Duas integrações, não uma
Seja qual for o caminho escolhido, lembre-se de que eles são endpoints estruturalmente diferentes. O Omni é um POST para /v1beta/interactions com o modelo no corpo, e ele retorna o vídeo inline como base64, a menos que o arquivo exceda 4MB, caso em que você recebe uma URI. O Veo funciona como uma operação de longa duração que você consulta (polling), e os arquivos gerados ficam nos servidores do Google por 2 dias antes de serem removidos.
Essa diferença importa se você planeja trocar de modelos mais tarde. O código escrito para um não funcionará com o outro apenas mudando a string do modelo, e qualquer camada de abstração que você construir precisará lidar tanto com uma operação consultada (polled) quanto com um corpo de resposta de duas formas. O tutorial da API Omni aborda esse tratamento de resposta.
Ambos valem a pena serem definidos com requisições salvas antes de você construir sobre eles. Configure uma requisição por modelo no Apidog, mantenha a chave de API em uma variável de ambiente, verifique a forma da resposta e aumente os tempos limite bem além dos padrões. Ao comparar a qualidade da saída, executar o mesmo prompt por meio de ambas as requisições salvas é um trabalho de dois cliques, em vez de dois comandos curl que você reescreverá da memória no próximo mês.
FAQ
O Gemini Omni é um substituto para o Veo? Não. O Google oferece ambos, e o Veo 3.1 não está obsoleto. São ferramentas diferentes que por acaso geram vídeo.
Qual é mais barato? Em 720p, Omni (~$0.10/segundo) e Veo 3.1 Fast ($0.10/segundo) se igualam. Veo 3.1 Lite é mais barato a $0.05. O Veo 3.1 padrão é o mais caro a $0.40.
Algum deles pode gerar vídeo com diálogo? O Veo gera áudio nativo. A saída de vídeo do Omni não inclui geração de áudio, e ele não pode adicionar diálogo ao estender um vídeo carregado.
Ambos adicionam marca d'água à saída? Sim, ambos aplicam SynthID, que é invisível para os espectadores e detectável programaticamente.
E quanto ao Sora ou outras APIs de vídeo? Provedores diferentes, tradeoffs diferentes. OpenAI Sora 2 e Seedance 1.0 valem a pena ser considerados se você estiver avaliando opções fora da linha do Google.
Com qual devo começar? Se você está prototipando e não precisa de som, comece com o Omni em 360p. É a maneira mais barata de descobrir se o vídeo gerado resolve seu problema. Baixe o Apidog e salve essa primeira requisição para que a comparação seja repetível.
O resumo honesto: Veo renderiza, Omni conversa. A documentação de geração de vídeo do Google abrange ambos, e nenhum deles vai desaparecer, então escolha por trabalho em vez de por equipe.
