Google Lança Gemini 3.5 Transcribe, Transformando Voz em Texto Polido para Gboard e Chrome
Google apresentou o Gemini 3.5 Transcribe, seu modelo de fala para texto mais preciso, capaz de converter áudio bruto em texto formatado, remover vícios de linguagem e lidar com correções. A tecnologia já impulsiona o Gboard Rambler e chegará em breve ao navegador Chrome, prometendo maior eficiência na digitação por voz.

O que é o Gemini 3.5 Transcribe e como ele funciona?
O Google acaba de introduzir o Gemini 3.5 Transcribe, seu modelo de fala para texto mais preciso até o momento, que já está em funcionamento em vários produtos da empresa e em breve será integrado ao navegador Chrome. Diferente dos modelos convencionais de reconhecimento de fala, que frequentemente enfrentam dificuldades com ruídos de fundo, jargões complexos e hesitações na fala, o Gemini 3.5 Transcribe se destaca por converter áudio bruto diretamente em texto preciso, polido e já formatado, conforme apurado pelo 9to5Google.
Este modelo é especificamente "projetado para capturar seu estilo de fala natural para entender melhor sua intenção e reconhecer vocabulário personalizado", de acordo com a empresa. Como já pode ser observado no recurso Rambler do Gboard, o Gemini 3.5 Transcribe consegue identificar e corrigir autocorreções durante a fala — como em "vamos nos encontrar terça-feira, não, quarta-feira" — e eliminar os "ãhns", "ehs" e outras palavras de preenchimento do resultado final. Ele também auto-formata o texto e permite a edição por voz de maneira natural.
Precisão Aprimorada e Identificação Multilíngue
A precisão é um dos pilares do Gemini 3.5 Transcribe. Medido pela Artificial Analysis, o modelo alcança uma Taxa de Erro de Palavras (WER) média de 4,0% para casos de uso em tempo real (streaming) e 2,6% para casos de uso não em tempo real. Ele demonstra um desempenho robusto mesmo em ambientes ruidosos do mundo real, capturando com exatidão entidades alfanuméricas como códigos postais e IDs de pedidos.
O Google também ressalta outras capacidades avançadas:
- Vocabulário Personalizado: Reconhece jargões especializados e grafias únicas, adaptando-se facilmente a vocabulários personalizados fornecidos pelo usuário.
- Suporte Global a Idiomas: Detecta e transcreve automaticamente mais de 85 idiomas, lidando com sotaques regionais e dialetos diversos sem dificuldades.
- Identificação Multi-falante: Atribui com precisão a fala em áudios pré-gravados, com marcações de tempo para até três falantes. O suporte para mais de três falantes ainda está em fase experimental.
O DeepMind Blog, em sua cobertura, reforça que "agora você pode obter uma transcrição de fala para texto mais inteligente com o Gemini 3.5 Transcribe".
Desempenho Superior e Novas Funcionalidades
Em termos de performance, o Gemini 3.5 Transcribe representa um "grande avanço" em capacidade, com taxas de erro de palavra aprimoradas e latência significativamente melhor em comparação com o modelo de transcrição Chirp 3, lançado em 2025. O tempo para a transcrição final, por exemplo, melhorou em 70%, segundo medições da Artificial Analysis. No benchmark FLEURS, o modelo entrega um desempenho multilíngue preciso, superando o Chirp 3 e alcançando um WER de 5,50% no modo streaming e 5,04% em casos de uso não streaming.
Um dos objetivos da nova ferramenta é permitir que os usuários "executem tarefas com a voz". A funcionalidade de chamada de função permite que o Gemini 3.5 Transcribe "delegue tarefas complexas (como geração de imagens e análise de arquivos) a outros modelos Gemini". Esta capacidade já pode ser vista no recurso "Speak to Window" do aplicativo Gemini para macOS.
A Google, através de sua conta oficial no X, demonstrou o funcionamento do Gemini 3.5 Transcribe, explicando como ele se adapta à forma natural de falar, lidando com autocorreções e removendo palavras de preenchimento para entregar um texto limpo e formatado.
Disponibilidade e Integração Futura
Além do aplicativo Gemini para macOS e do Gboard Rambler no Android, o Gemini 3.5 Transcribe já está disponível no microfone da caixa de prompt do Google Antigravity, onde "combina o contexto da tela e o histórico do bate-papo, com sua permissão, para garantir a precisão da transcrição de nomes de arquivos, pensamentos do agente e documentos ativos".
A próxima etapa é a integração ao navegador Chrome. Com isso, será possível "falar para digitar em qualquer campo da web — tornando fácil ditar respostas, rascunhar postagens ou interagir com o Gemini no Chrome de forma mais natural e fácil com a sua voz", segundo informou o Engadget, que destacou a capacidade do modelo de transformar "divagações em texto estruturado". Para desenvolvedores, a ferramenta está em prévia pública na API Gemini, via Google AI Studio e Google Antigravity. Para empresas, está em prévia pública através da Gemini Enterprise Agent Platform e em breve na Gemini Enterprise for Customer Experience, reforçando a expansão da inteligência artificial para diversas plataformas.
Achou um erro nesta matéria? Avise a redação — corrigimos e registramos a data da correção.




Comentarios
Troque ideia com outros leitores, responda em contexto e mantenha a conversa útil.
Faça login para comentar
Entre com sua conta Google para participar da discussão com nome e avatar.
Os comentários já publicados continuam visíveis mesmo sem login.