Gemini 3.5 Transcribe: Google apresenta nova IA para transcrição de áudio
Modelo promete transcrições mais precisas e pode transformar comandos de voz em ações dentro do ecossistema Google

O Google apresentou o Gemini 3.5 Transcribe, novo modelo de inteligência artificial desenvolvido para transformar fala em texto com mais precisão e compreender melhor a maneira natural como as pessoas se expressam.
A tecnologia também consegue reconhecer vocabulário personalizado e interpretar correções feitas durante a fala.
A empresa destaca que o modelo realiza transcrições em tempo real e processa arquivos de áudio. A ferramenta vai além da simples conversão de voz em texto e aceita comandos falados para executar diferentes tarefas.
Leia também: Gemini Enterprise: conheça a nova IA do Google feita para escritórios
COMO FUNCIONA O GEMINI 3.5 TRANSCRIBE?
Um dos destaques é a chamada transcrição inteligente. O modelo ajusta autocorreções, quando o falante altera informações no discurso, e elimina automaticamente marcas de hesitação vocal, como “hum” e “ah”.
A ferramenta também formata automaticamente o texto e consegue reconhecer termos específicos a partir de um vocabulário personalizado. Isso pode ser útil para nomes, jargões profissionais, códigos e outras palavras que normalmente podem gerar erros em sistemas de transcrição.
O Google afirma ainda que o Gemini 3.5 Transcribe apresenta uma taxa média de erro de palavras de 4% em streaming e 2,6% em situações sem streaming, segundo medições da Artificial Analysis.
IA RECONHECE MAIS DE 85 IDIOMAS
Outro recurso é o suporte a mais de 85 idiomas, com capacidade de detectar e transcrever automaticamente diferentes línguas, sotaques regionais e dialetos.
Em áudios pré-gravados, o modelo também consegue realizar a identificação de múltiplos falantes, atribuindo cada trecho à pessoa correspondente e adicionando marcações de tempo.
O recurso suporta até três falantes, enquanto o reconhecimento de três ou mais participantes está em caráter experimental.
Leia também: Gemini 3.7 Flash chegou! Nova versão programa melhor e custa menos
GEMINI 3.5 TRANSCRIBE TAMBÉM EXECUTA TAREFAS
O modelo não fica restrito à transcrição. Por meio de chamadas de funções, ele pode delegar tarefas mais complexas a outros modelos Gemini, como geração de imagens e análise de arquivos.
Esse recurso está disponível atualmente no aplicativo Gemini para macOS. Nesse ambiente, a IA pode considerar o contexto apresentado na tela para executar comandos de voz.
Assim, o usuário pode pedir, por exemplo, um resumo de arquivos locais, reutilizar um texto em outro aplicativo ou gerar uma imagem diretamente na posição do cursor usando a voz.
ONDE APLICAR A TECNOLOGIA?
O Gemini 3.5 Transcribe também aparece em diferentes produtos do Google. No Gboard para Android, o recurso Rambler utiliza a tecnologia para transformar fala em texto formatado, além de permitir correções ortográficas e mudanças no estilo do texto por comandos de voz.
No Google Antigravity, o modelo combina o contexto da tela e o histórico da conversa, com autorização do usuário, para melhorar a transcrição de nomes de arquivos, documentos e outros elementos.
Já no Google AI Studio, o Transcribe 3.5 pode ser utilizado no modo Build para controlar aplicativos de código com a voz em tempo real.
O Google também afirma que lançará a tecnologia em breve no Chrome, permitindo o ditado de textos em campos de páginas da web, como respostas e rascunhos.