← Voltar Inteligência Artificial Link da matéria
Gemini vídeo agente

Gemini da Google Apresenta Compreensão Agente de Vídeo, Otimizando Consumo de Tokens

O Google lançou a funcionalidade de compreensão de vídeo agente para os modelos Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite. Esta novidade permite que a IA analise vídeos dinamicamente, otimizando o consumo de tokens em até 88% e reduzindo custos em até 66%, ao mesmo tempo que aumenta a precisão em até 7%, especialmente em conteúdos de longa duração.

Redação USO IA Edição de Emerson Zanoti 📖 4 min 👁 3
Imagem gerada por IA · Gemini vídeo agente · Assunto apurado por: DeepMind Blog
Imagem gerada por IA · Gemini vídeo agente · Assunto apurado por: DeepMind Blog

O Google lançou uma nova funcionalidade de compreensão de vídeo agente para seus modelos de inteligência artificial Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite. Conforme anunciado no blog oficial da DeepMind, esta inovação promete otimizar drasticamente a análise de vídeos, cortando o consumo de tokens em até 88% e os custos em até 66%, enquanto melhora a precisão em até 7%.

Como a Compreensão de Vídeo Agente Transforma a Análise

A principal mudança reside na forma como os modelos processam os vídeos. Diferente do método 'estático' atual, que ingere o vídeo a uma taxa fixa de quadros por segundo (geralmente 1 FPS), a compreensão de vídeo agente permite que o Gemini atue de forma mais inteligente e direcionada. O modelo, utilizando suas ferramentas de vídeo nativas, consegue buscar, escanear e inspecionar segmentos específicos do vídeo dinamicamente, abrangendo quadros visuais, áudio e transcrições.

Este processamento dinâmico não apenas reduz o consumo de tokens e os custos, mas também aumenta a qualidade da análise. Os ganhos de eficiência são particularmente notáveis em vídeos de longa duração, como tutoriais de 10 minutos, palestras de 90 minutos ou gravações de várias horas. Nessas situações, o processamento estático frequentemente força os desenvolvedores a escolher entre altos custos de tokens ou a perda de detalhes cruciais.

A DeepMind destaca que, com a compreensão agente, o Gemini 3.7 Flash oferece a melhor qualidade geral e a melhor combinação de qualidade e eficiência de custo, colocando-o na fronteira de Pareto de precisão-custo entre os modelos testados para compreensão de vídeo.

Novas Capacidades e Aplicações Práticas

A funcionalidade agente desbloqueia uma série de novas capacidades para o processamento de vídeo, transformando como os desenvolvedores podem trabalhar com conteúdo de longa duração. Entre elas, estão:

  • Recuperação de momentos em sub-segundos: Permite identificar mudanças de estado em frações de segundo e cortes precisos que seriam facilmente perdidos a 1 FPS, possibilitando edições de vídeo automatizadas mais exatas.
  • Busca 'agulha no palheiro' em vídeos longos: Capacidade de responder a consultas complexas em vídeos de várias horas sem consumir milhões de tokens.
  • Detecção de anomalias: Reamostrar janelas de tempo interessantes em FPS mais altos para inspecionar movimentos rápidos e artefatos visuais sutis.
  • Contagem precisa de ações e objetos: Rastrear com exatidão movimentos físicos repetidos e objetos distintos ao longo do tempo.

Os desenvolvedores podem ativar a compreensão de vídeo agente hoje mesmo, configurando a API para 'agentic' no Google AI Studio ou na Gemini Enterprise Agent Platform. A funcionalidade utiliza o preço padrão dos tokens da API Gemini, sem custos adicionais, segundo o DeepMind Blog.

Expansão para Usuários e YouTube

Além de estar disponível para desenvolvedores, o Google planeja levar os benefícios da compreensão de vídeo agente para bilhões de usuários em seus produtos. Em breve, a funcionalidade será lançada para todos os usuários do aplicativo Gemini nos modelos Flash e Flash-Lite. Nos próximos meses, a mesma tecnologia também irá impulsionar o recurso 'Perguntar ao YouTube' (Ask YouTube) na página de visualização de vídeos, aproveitando o Gemini para fornecer respostas de maior qualidade baseadas no conteúdo visual.

A DeepMind agradece a Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin e à equipe Agentic Vision pelas suas contribuições neste trabalho.

Achou um erro nesta matéria? Avise a redação — corrigimos e registramos a data da correção.

Discussao

Comentarios

Troque ideia com outros leitores, responda em contexto e mantenha a conversa útil.

Carregando comentários...