OCTO+

Microsoft lança MAI-Transcribe-2-Streaming e modelos de voz MAI-Voice-2.1

Modelos de transcrição em streaming e síntese de voz multilíngue ficam disponíveis em prévia no Microsoft Foundry, com detalhes de preços e idiomas segundo a IT

02 de out., 05:04 8 fontes · 5 países Modelos Produto
ModelosMicrosoft
Ilustração de onda de voz representando inteligência artificial de áudio Foto: Thomas Lineweaver / Pexels

Microsoft divulgou, em 1º de outubro de 2026, seu primeiro modelo de transcrição em streaming, chamado MAI-Transcribe-2-Streaming, juntamente com os modelos de síntese de voz MAI-Voice-2.1 e sua versão rápida MAI-Voice-2.1-Flash, disponíveis em prévia pública no Microsoft Foundry.

Transcrição em tempo real

Segundo a ITmedia, o MAI-Transcribe-2-Streaming devolve resultados de transcrição enquanto o usuário ainda está falando, com latência de pouco mais de 100 milissegundos para uma saída preliminar. O modelo identifica automaticamente o idioma falado entre 60 línguas, incluindo japonês, e ajusta o texto conforme o contexto avança. A precisão foi apontada pela Artificial Analysis como a primeira colocada em avaliações de streaming de transcrição. O custo de uso foi definido em 0,54 dólar por hora de áudio como preço introdutório válido até o fim do ano.

Síntese de voz multilíngue

O modelo MAI-Voice-2.1 produz fala em 23 idiomas mantendo o tom original da voz de referência, permitindo troca de idioma sem perder o sotaque nativo de cada língua. Seu preço é de 22 dólares por milhão de caracteres processados. Já a variante MAI-Voice-2.1-Flash gera 45 segundos de áudio com atraso de cerca de 150 milissegundos e é cerca de 60 % mais barata, custando 15 dólares por milhão de caracteres. Ambos os modelos incluem clonagem de voz a partir de poucos segundos de referência, porém exigem aprovação de acesso e somente vozes com consentimento explícito podem ser sintetizadas. A lista de vozes padrão divulgada não contém japonês, embora a região de disponibilidade inclua o Japão Leste.

Disponibilidade e demonstrativos

Além do Foundry, os três modelos podem ser acessados por meio do MAI Playground e da plataforma Vercel. No Playground há uma demonstração chamada "Chatter" que combina transcrição e síntese para criar um agente de voz; ao falar em japonês o sistema compreende a fala, mas responde em inglês, já que o idioma de resposta não está configurado para japonês no demo. A ITmedia também menciona que, no mesmo período, concorrentes anunciaram soluções similares: OpenAI apresentou o GPT-Realtime-Whisper em maio, Google revelou o Gemini 3.8 Live em setembro e a Meta lançou, no ano anterior, o Omnilingual ASR com suporte a mais de 1.600 línguas em código aberto.

O que ainda não foi divulgado

Apurado em 8 fontes

ITmedia (Japão)

ver as 8 fontes

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)