PUBLICIDADE

Google eleva a geração de vídeo por IA a outro nível: Gemini Omni 1.1 Flash chega com cenas de até 40 segundos, controle cinematográfico e upscaling em 4K

29/08/2026
121 visualizações
4 min de leitura
Imagem principal do post

Google lança Gemini Omni 1.1 Flash com controle de cena de até 40 segundos e upscaling para 4K

O Google disponibilizou nesta semana o Gemini Omni 1.1 Flash, atualização de produção do seu modelo nativo de geração e edição de vídeo com múltiplas modalidades. O lançamento transforma o Omni de um gerador de clipes em uma ferramenta direcionável, com novos mecanismos para controlar continuidade de cenas, movimentos de câmera, consistência de personagens e custo de renderização.

A principal mudança está na extensão de cenas. Antes, o modelo analisava apenas o último frame de um vídeo ao continuar uma sequência. Agora, o Omni 1.1 Flash é capaz de ler até dez segundos de contexto prévio. Cada extensão opera em incrementos de dez segundos e pode acumular um total de até 40 segundos, com o modelo gerando de três a dez segundos de continuação por chamada. A função anexa trechos apenas ao final do clipe, sem permitir inserções no meio ou no início.

Imagem complementar

Outra adição é a interpolação por quadros-chave. O usuário pode fixar o primeiro e o último frame de uma cena, e o modelo gera o vídeo contínuo entre eles. Esse mecanismo habilita movimentos de câmera específicos, como órbitas e dolly-zooms, além de loops sem costura. Para organizar as instruções, a API utiliza tags que vinculam mídias a funções, como , , e . As referências em vídeo aceitam até três clipes, com duração máxima de três segundos cada, e são indicadas especialmente para preservar a aparência de personagens. O áudio presente em vídeos de referência é ignorado pelo sistema.

O controle de custos também foi repensado. O parâmetro de resolução na resposta da API aceita 360p, 720p como padrão, 1080p e 4K, sendo as duas últimas obtidas por upscaling. Segundo o Google, os rascunhos em 360p podem ser gerados até 60% mais rápido e a um terço do custo da versão 720p, considerando a vazão do sistema. A lógica recomendada para produção é iterar economicamente em baixa resolução e renderizar a versão final uma única vez em alta definição.

PUBLICIDADE

A precificação é definida por tokens. A entrada custa 1,50 dólar por milhão de tokens para texto, imagem, vídeo e áudio combinados. A saída tem valores distintos: 9,00 dólares por milhão de tokens de texto e 17,50 dólares por milhão de tokens de vídeo. A cobrança de vídeo considera 5.792 tokens por segundo em 720p, o que resulta em aproximadamente 0,10 dólar por segundo sob a tarifa padrão. Todo vídeo gerado recebe a marca d'água SynthID, invisível ao espectador, mas detectável por sistemas para fins de rastreamento de origem.

A edição conversacional foi implementada por meio da Interactions API. As alterações são stateful, ou seja, o modelo mantém o estado das edições anteriores. Basta enviar o identificador da interação prévia, chamado previous_interaction_id, para que o sistema aplique a nova instrução preservando tudo aquilo que não foi mencionado, sem necessidade de reenviar o vídeo anterior.

O modelo se apoia em três propriedades destacadas pelo Google: a multimodalidade nativa, que processa texto, imagem, áudio e vídeo em conjunto; a edição conversacional via API; e o conhecimento de mundo herdado da família Gemini. Entre as limitações conhecidas estão a ausência de suporte a instruções de sistema, temperatura, top_p, sequências de parada e prompts negativos, estes últimos devendo ser incluídos diretamente no texto do comando. A edição de voz e o uso de referências em áudio não são suportados, e URLs do YouTube não podem ser utilizadas como fonte. Apenas o inglês foi completamente avaliado; outros idiomas permanecem sem validação formal. Para arquivos gerados acima de 4 MB, é necessário utilizar o parâmetro delivery="uri" e consultar a Files API até que o arquivo esteja com status ACTIVE.

O Gemini Omni 1.1 Flash está disponível por meio da Gemini API no Google AI Studio e na plataforma Gemini Enterprise Agent. O Google já cita quatro clientes運用 em produção: Adobe, com o Firefly, Figma Weave, GMI Cloud e Runway. O modelo também foi integrado ao Google Flow para assinantes dos planos AI Plus, Pro e Ultra, e a extensão de cenas está presente no aplicativo Gemini.

A atualização representa um passo importante na maturidade dos modelos de geração de vídeo, ao introduzir controles finos de câmera e continuidade narrativa que aproximam o uso da ferramenta de fluxos profissionais de produção audiovisual.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE