✨︎ Resumen (TL;DR):
- Microsoft lanzó el 1 de octubre de 2026 MAI-Transcribe-2-Streaming y los modelos de voz MAI-Voice-2.1 y MAI-Voice-2.1-Flash.
- El transcriptor admite 60 idiomas y entrega sus primeras versiones de texto en poco más de 100 milisegundos.
- Los tres modelos están en vista previa pública en Azure y Microsoft no recomienda usarlos en cargas de producción.
Microsoft lanzó el 1 de octubre de 2026 MAI-Transcribe-2-Streaming, un modelo que transcribe mientras una persona habla, junto con los generadores de voz MAI-Voice-2.1 y MAI-Voice-2.1-Flash. En Azure, los tres están en vista previa pública y buscan reducir la espera en asistentes y servicios de atención al cliente. El transcriptor admite 60 idiomas, incluido el español, y entrega sus primeras transcripciones provisionales en poco más de 100 milisegundos después de recibir el audio.

Transcripción provisional desde que llega el audio
MAI-Transcribe-2-Streaming es un modelo de transcripción que devuelve texto mientras una persona habla. Detecta automáticamente el idioma durante la sesión y admite 60 idiomas, incluido el español.
Microsoft afirma que el modelo entrega sus primeras transcripciones provisionales en poco más de 100 milisegundos después de recibir el audio. El modelo corrige esas versiones conforme llega más contexto y confirma el texto de cada intervención cuando termina.
Ese texto provisional permite que una aplicación empiece a identificar lo que pide una persona antes de que termine la frase. La ficha del modelo describe el uso del texto definitivo para completar formularios o dirigir una solicitud a un sistema de atención.
Microsoft lo sitúa en el primer puesto de precisión de Artificial Analysis para las transcripciones provisionales y finales. La evaluadora usa unas ocho horas de audio de tres conjuntos de datos.
La latencia requiere una lectura aparte. Artificial Analysis mide desde el final del habla detectado, mientras Microsoft toma como referencia la recepción del audio al describir los primeros resultados. Son puntos de partida distintos.
Streaming cuesta más y cambia las funciones
La tarifa de lanzamiento de MAI-Transcribe-2-Streaming es de 0.54 dólares por hora de audio hasta el 31 de diciembre de 2026. La versión para grabaciones, MAI-Transcribe-2, ya mencionada en septiembre, sigue listada a 0.10 dólares por hora en la comparación oficial.
A esas tarifas, transcribir 100 horas cuesta 54 dólares con Streaming o 10 dólares con archivos.
La ficha comparativa indica que Streaming no ofrece separación de hablantes, marcas de tiempo por palabra ni ajuste mediante palabras clave. MAI-Transcribe-2 sí incluye esas funciones. Elegir subtítulos en vivo implica trabajar con un conjunto distinto de capacidades.
Dos voces con español de México y España
MAI-Voice-2.1 y MAI-Voice-2.1-Flash convierten texto en audio en 23 idiomas, con variantes de español de México y de España. Microsoft afirma que una misma voz puede conservar su identidad al cambiar de idioma y adaptar su acento a cada lengua.
MAI-Voice-2.1, la versión estándar, apunta a narraciones, audiolibros y contenido donde importa la expresividad. Su precio es de 22 dólares por millón de caracteres.
MAI-Voice-2.1-Flash se dirige a asistentes y centros de llamadas con muchas solicitudes. Su tarifa es de 15 dólares por millón de caracteres.
Para Flash, Microsoft anuncia la generación de 45 segundos de audio con una latencia de 150 milisegundos. Esa cifra corresponde a la generación de voz. La respuesta de un asistente también depende de transcribir la solicitud, procesarla y consultar las herramientas que necesite.
Las dos versiones permiten recrear una voz a partir de un breve audio de referencia. La documentación de Azure indica que la función tiene acceso restringido y requiere voces autorizadas con consentimiento.
Acceso para desarrollo, con límites en Azure
Microsoft anunció los tres modelos en Foundry, MAI Playground, Vercel y Azure Voice Live. Las dos voces también llegan a OpenRouter, mientras la integración con LiveKit figura como próxima.
Para mostrar cómo se combinan, la empresa presentó Chatter, una demostración de conversación en MAI Playground.
La documentación permite integrar el transcriptor mediante una API compatible con OpenAI Realtime o con Azure Speech SDK. Esas vías dan acceso al reconocimiento de voz; cada aplicación debe aportar la lógica que interpreta la solicitud y prepara la respuesta.
Las páginas técnicas mantienen una advertencia para las empresas: en Azure, los tres modelos están en vista previa pública, sin acuerdo de nivel de servicio, y Microsoft no recomienda estas funciones para cargas de producción.
