← Voltar Smartphones e Gadgets Link da matéria
Gemini 3.5 Transcribe Google

Google Lança Gemini 3.5 Transcribe, Transformando Voz em Texto Polido para Gboard e Chrome

Google apresentou o Gemini 3.5 Transcribe, seu modelo de fala para texto mais preciso, capaz de converter áudio bruto em texto formatado, remover vícios de linguagem e lidar com correções. A tecnologia já impulsiona o Gboard Rambler e chegará em breve ao navegador Chrome, prometendo maior eficiência na digitação por voz.

Redação USO IA Edição de Emerson Zanoti 📖 4 min 👁 9
Imagem gerada por IA · Gemini 3.5 Transcribe Google · Assunto apurado por: 9to5Google
Imagem gerada por IA · Gemini 3.5 Transcribe Google · Assunto apurado por: 9to5Google

O que é o Gemini 3.5 Transcribe e como ele funciona?

O Google acaba de introduzir o Gemini 3.5 Transcribe, seu modelo de fala para texto mais preciso até o momento, que já está em funcionamento em vários produtos da empresa e em breve será integrado ao navegador Chrome. Diferente dos modelos convencionais de reconhecimento de fala, que frequentemente enfrentam dificuldades com ruídos de fundo, jargões complexos e hesitações na fala, o Gemini 3.5 Transcribe se destaca por converter áudio bruto diretamente em texto preciso, polido e já formatado, conforme apurado pelo 9to5Google.

Este modelo é especificamente "projetado para capturar seu estilo de fala natural para entender melhor sua intenção e reconhecer vocabulário personalizado", de acordo com a empresa. Como já pode ser observado no recurso Rambler do Gboard, o Gemini 3.5 Transcribe consegue identificar e corrigir autocorreções durante a fala — como em "vamos nos encontrar terça-feira, não, quarta-feira" — e eliminar os "ãhns", "ehs" e outras palavras de preenchimento do resultado final. Ele também auto-formata o texto e permite a edição por voz de maneira natural.

Precisão Aprimorada e Identificação Multilíngue

A precisão é um dos pilares do Gemini 3.5 Transcribe. Medido pela Artificial Analysis, o modelo alcança uma Taxa de Erro de Palavras (WER) média de 4,0% para casos de uso em tempo real (streaming) e 2,6% para casos de uso não em tempo real. Ele demonstra um desempenho robusto mesmo em ambientes ruidosos do mundo real, capturando com exatidão entidades alfanuméricas como códigos postais e IDs de pedidos.

O Google também ressalta outras capacidades avançadas:

  • Vocabulário Personalizado: Reconhece jargões especializados e grafias únicas, adaptando-se facilmente a vocabulários personalizados fornecidos pelo usuário.
  • Suporte Global a Idiomas: Detecta e transcreve automaticamente mais de 85 idiomas, lidando com sotaques regionais e dialetos diversos sem dificuldades.
  • Identificação Multi-falante: Atribui com precisão a fala em áudios pré-gravados, com marcações de tempo para até três falantes. O suporte para mais de três falantes ainda está em fase experimental.

O DeepMind Blog, em sua cobertura, reforça que "agora você pode obter uma transcrição de fala para texto mais inteligente com o Gemini 3.5 Transcribe".

Desempenho Superior e Novas Funcionalidades

Em termos de performance, o Gemini 3.5 Transcribe representa um "grande avanço" em capacidade, com taxas de erro de palavra aprimoradas e latência significativamente melhor em comparação com o modelo de transcrição Chirp 3, lançado em 2025. O tempo para a transcrição final, por exemplo, melhorou em 70%, segundo medições da Artificial Analysis. No benchmark FLEURS, o modelo entrega um desempenho multilíngue preciso, superando o Chirp 3 e alcançando um WER de 5,50% no modo streaming e 5,04% em casos de uso não streaming.

Um dos objetivos da nova ferramenta é permitir que os usuários "executem tarefas com a voz". A funcionalidade de chamada de função permite que o Gemini 3.5 Transcribe "delegue tarefas complexas (como geração de imagens e análise de arquivos) a outros modelos Gemini". Esta capacidade já pode ser vista no recurso "Speak to Window" do aplicativo Gemini para macOS.

A Google, através de sua conta oficial no X, demonstrou o funcionamento do Gemini 3.5 Transcribe, explicando como ele se adapta à forma natural de falar, lidando com autocorreções e removendo palavras de preenchimento para entregar um texto limpo e formatado.

Instead of typing out every thought, Gemini 3.5 Transcribe works with the way you actually talk:

✅ Seamlessly handles self-corrections
✨ Removes filler words to deliver clean, formatted text
🎯 Understands your natural intent and speaking style
🔊 Accurately captures audio in…

Frame do vídeo publicado por Google no X
Ver a publicação no X26 de agosto de 2026
Publicação de Google (@Google) no X, em 26 de agosto de 2026.

Disponibilidade e Integração Futura

Além do aplicativo Gemini para macOS e do Gboard Rambler no Android, o Gemini 3.5 Transcribe já está disponível no microfone da caixa de prompt do Google Antigravity, onde "combina o contexto da tela e o histórico do bate-papo, com sua permissão, para garantir a precisão da transcrição de nomes de arquivos, pensamentos do agente e documentos ativos".

A próxima etapa é a integração ao navegador Chrome. Com isso, será possível "falar para digitar em qualquer campo da web — tornando fácil ditar respostas, rascunhar postagens ou interagir com o Gemini no Chrome de forma mais natural e fácil com a sua voz", segundo informou o Engadget, que destacou a capacidade do modelo de transformar "divagações em texto estruturado". Para desenvolvedores, a ferramenta está em prévia pública na API Gemini, via Google AI Studio e Google Antigravity. Para empresas, está em prévia pública através da Gemini Enterprise Agent Platform e em breve na Gemini Enterprise for Customer Experience, reforçando a expansão da inteligência artificial para diversas plataformas.

Achou um erro nesta matéria? Avise a redação — corrigimos e registramos a data da correção.

Discussao

Comentarios

Troque ideia com outros leitores, responda em contexto e mantenha a conversa útil.

Carregando comentários...