
Google lança Gemini 3.5 Transcribe: edita "hã" e entende jargão
Novo modelo de transcrição do Google detecta mais de 85 idiomas e corta vícios de fala automaticamente. Taxa de erro cai para 2,6% no modo não-streaming.
Por Marina Sato · Repórter de IA
O que muda
O Google lançou nesta quarta-feira (26) o Gemini 3.5 Transcribe, seu modelo de transcrição de áudio mais preciso até agora. A promessa central: pegar uma fala cheia de hesitações e devolver um texto limpo, sem "hã", sem repetição, sem autocorreções faladas.
Os números
O modelo detecta automaticamente mais de 85 idiomas, incluindo variações regionais de sotaque e dialeto. A taxa de erro de palavra (WER) é de 4,0% no modo streaming e 2,6% no modo não-streaming. O tempo até a transcrição final ficou 70% mais rápido que o modelo anterior, o Chirp 3.
Como funciona na prática
O sistema remove vícios de linguagem como "ahn" e "tipo", corrige frases faladas com hesitação — o exemplo dado pelo próprio Google é "vamos nos encontrar terça, não, quarta" virando direto "vamos nos encontrar quarta" — e formata o texto automaticamente. Também reconhece jargão técnico e termos específicos quando o usuário fornece um vocabulário customizado. Consegue diferenciar até três interlocutores em áudio pré-gravado, com timestamp por palavra; para mais de três falantes, o recurso ainda é experimental.
Onde já está disponível
O modelo já roda no Gboard Rambler para Android e no app Gemini para macOS. Chega em breve ao Chrome, para ditado em qualquer campo de texto na web. Desenvolvedores podem testar via API do Gemini e Google AI Studio, em prévia pública, e empresas têm acesso pela Gemini Enterprise Agent Platform.
O que ainda falta responder
O Google não detalhou custo de uso da API para desenvolvedores nem data exata de chegada ao Chrome. Também não ficou claro se o suporte a mais de três falantes simultâneos vai sair do estágio experimental — nem quando.
Atualização (26/08, 19:18): Atualização (26/08/2026): o Google divulgou números de desempenho do Gemini 3.5 Transcribe. Segundo a empresa, o modelo atinge uma taxa de erro de palavras (Word Error Rate, ou WER) média de 4,0% no modo streaming e de 2,6% no modo não-streaming, além de reduzir em 70% o tempo até a transcrição final em comparação com o modelo anterior, o Chirp 3.
Em relação à disponibilidade, o recurso já funciona no app Gemini para macOS e no Android (via Rambler), e chegará em breve ao Google Chrome, permitindo "falar para digitar" em qualquer campo de texto na web. Desenvolvedores já podem testar o modelo em preview público pela Gemini API, no Google AI Studio e no Antigravity.