A Google lançou o Gemini 3.5 Transcribe, seu modelo de reconhecimento de fala mais avançado até agora, que entrega transcrições em texto polido e formatado em tempo real.
O novo sistema já está disponível no aplicativo Gemini no macOS e no recurso Rambler do Gboard no Pixel 11, ambos com acesso imediato. Segundo a Google, o Gemini 3.5 Transcribe foi pensado para superar as limitações de sistemas tradicionais de fala para texto. Ele processa o áudio bruto diretamente, sem etapas intermediárias, e filtra ruídos de fundo, jargões especializados e as típicas hesitações da fala — os famosos uhs e ums — entregando um texto limpo.
Como funciona o novo modelo
A empresa afirma que a taxa de erro ao vivo caiu para 5,5%, contra 7,32% do Chirp 3. O modelo suporta 85 idiomas e reconhece até três falantes em áudios pré-gravados. Também é possível fornecer um vocabulário personalizado para termos técnicos específicos.
De acordo com o Ars Technica, o Gemini 3.5 Transcribe já opera no Pixel 11 por meio do Gboard Rambler. A Google informou que pretende levar o Rambler a mais dispositivos com Gemini Intelligence ainda neste ano.

Disponibilidade e próximos passos
No macOS, a transcrição via Gemini 3.5 Transcribe já roda no aplicativo Gemini. Desenvolvedores podem acessar o modelo pela API do Gemini e pela plataforma AI Studio, ambas atualizadas hoje.
A Google disse que o recurso chegará em breve ao navegador Chrome, permitindo digitação por voz em qualquer campo da web.
Diferente do reconhecimento de fala padrão, o Gemini 3.5 Transcribe pode reescrever o que foi dito, corrigindo hesitações e reformulando frases. Isso traz clareza, mas — como destacou o Ars Technica — pode não ser ideal quando se exige fidelidade literal à fala original.

