IA da Meta transcreve reuniões ao vivo; saiba como usar o Muse Voice Transcribe

Muse Voice Transcribe reconhece mais de 25 idiomas e consegue identificar participantes em reuniões

Microfone e logo da Meta
Crédito: Unsplash/Pexels

Lilian Campos 1 minutos de leitura
Favoritar no Google

A Meta apresentou o Muse Voice Transcribe, modelo de inteligência artificial desenvolvido para transcrever áudio em tempo real. A ferramenta consegue transformar conversas em texto enquanto elas acontecem e também identifica quem está falando durante uma reunião.

Segundo a Meta, o modelo é o primeiro sistema de percepção de áudio em tempo real desenvolvido pela Meta Superintelligence Labs.

A tecnologia combina transcrição automática, identificação de diferentes participantes e detecção do momento em que uma pessoa começa ou termina de falar.

Leia também: Muse: como funciona o novo agente de IA da Meta

COMO FUNCIONA O MUSE VOICE TRANSCRIBE

O Muse Voice Transcribe trabalha com transcrição contínua de áudio, permitindo acompanhar uma conversa sem precisar esperar o fim da gravação. O sistema também utiliza a chamada diarização para separar as falas de diferentes participantes.

A Meta afirma que o modelo consegue reconhecer mais de 25 idiomas entre os idiomas validados inicialmente e também lida com mudanças de idioma durante uma mesma conversa. 

Dessa forma, uma pessoa pode alternar entre línguas sem precisar configurar manualmente o sistema.

Outro recurso é o chamado context biasing, que usa palavras-chave e informações de contexto para melhorar o reconhecimento de termos específicos. Isso pode ajudar, por exemplo, quando uma conversa envolve nomes, lugares ou termos técnicos.

COMO USAR A FERRAMENTA?

A própria página de apresentação da Meta disponibiliza uma demonstração interativa do Muse Voice Transcribe. Para testar, basta acessar a página oficial, iniciar o recurso e permitir o uso do microfone.

Durante a demonstração, a ferramenta transforma a fala captada pelo microfone em texto. A Meta alerta que a IA gera as transcrições e pode apresentar erros.

O sistema processa o áudio utilizado na demonstração para gerar a transcrição e, segundo a empresa, não armazena o arquivo.

IA CONSEGUE TRANSCREVER REUNIÕES LONGAS

O Muse Voice Transcribe também foi desenvolvido para lidar com áudios extensos. De acordo com a Meta, o modelo suporta entradas de áudio com mais de uma hora de duração e consegue identificar mais de 20 participantes, sem necessidade de pós-processamento.

A tecnologia faz parte da família de modelos Muse Spark e foi apresentada pela Meta como uma etapa inicial para sistemas de IA capazes de compreender conversas em tempo real.


SOBRE A AUTORA

Lilian Campos é jornalista colaboradora da Fast Company Brasil. saiba mais