Tecnologia e inovação

Gemini escolhe quais cenas assistir — tokens caem até 88%

|Autor: Equipe editorial da QUASA|5 min de leitura| 1
Gemini escolhe quais cenas assistir — tokens caem até 88%

Em 1º de setembro de 2026, o Google lançou o processamento agentic de vídeo para o Gemini; o anúncio oficial do recurso registra disponibilidade pela Gemini API no Google AI Studio e na Gemini Enterprise Agent Platform, uso com vídeos enviados ou públicos do YouTube, cobrança normal de tokens sem tarifa adicional e, nos benchmarks da empresa, consumo até 88% menor de tokens, redução de custo de até 66% e ganho de precisão de até 7%.

A mudança substitui a análise integral em cadência predeterminada por uma busca guiada pela pergunta: a cobertura independente da TechRepublic descreve como o Gemini procura uma faixa relevante na transcrição, nos quadros ou no áudio e amplia a inspeção quando precisa de mais evidências. Para desenvolvedores, o efeito potencial é gastar contexto apenas nos momentos úteis, sobretudo em gravações longas — mas os percentuais divulgados são máximos do fornecedor, não uma economia garantida para qualquer vídeo.

Como a busca dirigida escolhe os trechos

Gemini localiza um momento pela transcrição e volta ao trecho para examinar áudio e quadros.

No processamento estático, a frequência de amostragem é definida antes da análise. O sistema extrai quadros ao longo do intervalo solicitado e coloca esse material no contexto em uma passagem, produzindo um consumo mais previsível e diretamente relacionado à duração processada.

No modo agentic, o prompt orienta uma sequência de decisões. O modelo pode começar pela transcrição para localizar um assunto, carregar os quadros correspondentes, consultar o áudio e voltar ao trecho com outra frequência de amostragem quando uma ação rápida exigir mais detalhe. Se a primeira faixa não sustentar a resposta, o ciclo pode procurar outro ponto da gravação.

Isso não torna o vídeo gratuito em termos de tokens. Há consumo no raciocínio de navegação, nos trechos carregados sob demanda e na resposta final; a diferença é que a duração completa deixa de determinar, sozinha, quanto conteúdo entra no processamento.

O que os percentuais dos benchmarks significam

Processamento estático cobre toda a gravação, enquanto o modo agentic carrega apenas trechos relevantes.

Os três máximos medem dimensões diferentes: volume de tokens, custo da análise e precisão. Eles não devem ser somados nem interpretados como resultados que necessariamente ocorrerão juntos. Uma carga pode economizar muito contexto e ainda exigir várias buscas internas, enquanto outra pode encontrar rapidamente o momento necessário, mas apresentar ganho pequeno de qualidade.

O cenário mais favorável é uma gravação longa na qual a resposta depende de poucos intervalos, como localizar uma fala específica em uma aula extensa ou investigar uma anomalia breve. Nesse caso, a busca dirigida pode ignorar grande parte da linha do tempo e aprofundar apenas os candidatos relevantes.

A vantagem tende a diminuir quando o pedido exige cobertura uniforme: resumir cada etapa de um clipe, conferir todas as mudanças de cena ou verificar continuamente o que aparece na tela obriga o modelo a carregar uma parcela maior do conteúdo. A duração do arquivo importa, mas a distribuição da evidência e a abrangência da pergunta também influenciam o resultado.

O ganho de precisão divulgado tem limite semelhante. Rever um movimento em maior frequência pode recuperar detalhes perdidos pela amostragem fixa, mas não garante respostas melhores quando o áudio está ruim, a transcrição é incompleta ou a própria pergunta não delimita o que deve ser procurado.

Quais modelos aceitam cada modo

Clipe curto recebe cobertura estática uniforme e aula longa é examinada por busca agentic dirigida.

A documentação de vídeo da Gemini API, atualizada em 3 de setembro de 2026, lista Gemini 3.8 Flash, 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite no modo agentic, mantém o estático disponível para todos os modelos Gemini, informa amostragem estática padrão de 1 FPS e alerta que a navegação pode elevar ligeiramente o tempo até o primeiro token em clipes com menos de 5 minutos.

A decisão entre os modos pode ser resumida pelo tipo de cobertura exigida:

  • Agentic: gravações longas, busca por uma ocorrência rara, investigação de uma faixa específica ou análise de movimentos que podem exigir nova amostragem.
  • Estático: clipes curtos, tarefas que precisam de inspeção uniforme das amostras ou situações em que a previsibilidade da passagem única pesa mais que a economia potencial.
  • Combinação: pedidos com vários vídeos podem atribuir processamento dirigido ao material extenso e estático ao trecho que precisa ser coberto de maneira contínua.

O modo estático continua sendo o padrão. A análise agentic precisa ser selecionada na configuração do vídeo, o que permite decidir por arquivo em vez de impor uma única estratégia a toda a solicitação.

Como a redução de tokens afeta a cobrança

Não existe uma tarifa separada para ativar o recurso. A cobrança segue os tokens usados pela Gemini API, incluindo o raciocínio de navegação e o conteúdo recuperado; por isso, uma redução no material carregado pode baixar a conta, mas o custo final depende do caminho seguido pelo modelo.

Em vídeo longo com uma pergunta pontual, a busca seletiva pode evitar que toda a duração seja colocada no contexto. Já um pedido abrangente pode provocar múltiplas consultas a transcrição, áudio e quadros, aproximando o consumo do processamento estático e reduzindo a diferença financeira.

Também não se deve confundir custo total com velocidade inicial. O modo agentic pode usar menos tokens no conjunto e, ao mesmo tempo, demorar mais para começar a responder, porque primeiro precisa decidir onde procurar e executar as recuperações internas.

O que ainda falta medir fora dos testes do fornecedor

O recurso está disponível na API para os modelos compatíveis, mas os materiais públicos não apresentam uma distribuição completa dos resultados por duração, gênero de vídeo, qualidade do áudio, tipo de pergunta e quantidade de ciclos de inspeção. Sem esse detalhamento, os melhores resultados não podem ser convertidos em previsão confiável para uma carga de produção específica.

A mudança técnica está estabelecida: o Gemini agora pode distribuir a atenção de forma desigual pela linha do tempo e aprofundar os momentos que julga relevantes. O tamanho do benefício continuará dependente da tarefa, e medições independentes em vídeos curtos, consultas de cobertura integral e arquivos com sinais deficientes serão necessárias para definir economias e níveis de precisão típicos.

Leia também:

Compartilhar:

Assine nossa newsletter

Receba as últimas notícias sobre Web3, IA e cripto diretamente no seu e-mail.

0