Microsoft divulgou, em 1º de outubro de 2026, seu primeiro modelo de transcrição em streaming, chamado MAI-Transcribe-2-Streaming, juntamente com os modelos de síntese de voz MAI-Voice-2.1 e sua versão rápida MAI-Voice-2.1-Flash, disponíveis em prévia pública no Microsoft Foundry.
Transcrição em tempo real
Segundo a ITmedia, o MAI-Transcribe-2-Streaming devolve resultados de transcrição enquanto o usuário ainda está falando, com latência de pouco mais de 100 milissegundos para uma saída preliminar. O modelo identifica automaticamente o idioma falado entre 60 línguas, incluindo japonês, e ajusta o texto conforme o contexto avança. A precisão foi apontada pela Artificial Analysis como a primeira colocada em avaliações de streaming de transcrição. O custo de uso foi definido em 0,54 dólar por hora de áudio como preço introdutório válido até o fim do ano.
Síntese de voz multilíngue
O modelo MAI-Voice-2.1 produz fala em 23 idiomas mantendo o tom original da voz de referência, permitindo troca de idioma sem perder o sotaque nativo de cada língua. Seu preço é de 22 dólares por milhão de caracteres processados. Já a variante MAI-Voice-2.1-Flash gera 45 segundos de áudio com atraso de cerca de 150 milissegundos e é cerca de 60 % mais barata, custando 15 dólares por milhão de caracteres. Ambos os modelos incluem clonagem de voz a partir de poucos segundos de referência, porém exigem aprovação de acesso e somente vozes com consentimento explícito podem ser sintetizadas. A lista de vozes padrão divulgada não contém japonês, embora a região de disponibilidade inclua o Japão Leste.
Disponibilidade e demonstrativos
Além do Foundry, os três modelos podem ser acessados por meio do MAI Playground e da plataforma Vercel. No Playground há uma demonstração chamada "Chatter" que combina transcrição e síntese para criar um agente de voz; ao falar em japonês o sistema compreende a fala, mas responde em inglês, já que o idioma de resposta não está configurado para japonês no demo. A ITmedia também menciona que, no mesmo período, concorrentes anunciaram soluções similares: OpenAI apresentou o GPT-Realtime-Whisper em maio, Google revelou o Gemini 3.8 Live em setembro e a Meta lançou, no ano anterior, o Omnilingual ASR com suporte a mais de 1.600 línguas em código aberto.
O que ainda não foi divulgado
- Data exata de disponibilidade geral além da fase de prévia pública.
- Detalhes sobre suporte regional específico para o Brasil ou outras localidades da América Latina.
- Informações sobre limites de uso, cotas ou níveis de serviço oferecidos no Foundry.
- Eventuais requisitos de hardware ou largura de banda recomendados para usar os modelos em produção.


