Meta presume 70 idiomas, pero la prueba solo mide inglés

Meta presume 70 idiomas, pero la prueba solo mide inglés

Meta lidera con Muse Voice Transcribe: 3.1% de error en una prueba de streaming que solo evalúa inglés.

Por Humberto Toledo el 1 de septiembre del 2026 a las 5:14 pm PDT

✨︎ Resumen (TL;DR):

  • Meta Superintelligence Labs lanzó Muse Voice Transcribe el 1 de septiembre de 2026 y lo puso disponible en Meta AI para Mac, Muse Code y Meta Model API.
  • El modelo marcó 3.1% de error de palabra en AA-WER Streaming, 0.3 puntos menos que el segundo lugar, con un examen de unas ocho horas de audio en inglés.
  • Meta reporta entrenamiento en más de 70 idiomas y verificación a fondo de 25, pero no publicó el error por idioma; la API cuesta 3 dólares por cada 1,000 minutos.

Meta Superintelligence Labs lanzó el 1 de septiembre de 2026 Muse Voice Transcribe, su primer modelo de percepción de audio en tiempo real, y encabezó el índice AA-WER Streaming de Artificial Analysis con 3.1% de error de palabra. La limitación del resultado es concreta: la prueba usa unas ocho horas de audio en inglés y un normalizador de texto en inglés, aunque Meta reporta que entrenó el modelo con más de 70 idiomas y verificó a fondo 25.

Muse Voice Transcribe es un modelo multimodal autorregresivo de percepción de audio en tiempo real que genera transcripciones mientras recibe el audio. Forma parte de la familia Muse Spark, la misma del modelo insignia de Meta.

El modelo ya opera en Meta AI para Mac, Muse Code y Meta Model API.

Muse Glimmer: el modelo de Meta que corre en tu PC
Te podría interesar:
Muse Glimmer: el modelo de Meta que corre en tu PC
Imagen abstracta vibrante con patrones dinámicos de luz púrpura y azul.
Foto: Anni Roenkae / Pexels

El primer lugar se midió con ocho horas de inglés

Artificial Analysis detalla cómo arma AA-WER Streaming: unas ocho horas de audio de tres conjuntos con pesos fijos. AA-AgentTalk, propio y reservado, representa la mitad del índice con 469 muestras de entre 8 y 109 segundos pensadas para agentes de voz.

VoxPopuli aporta un cuarto del peso mediante su subconjunto en inglés de sesiones del Parlamento Europeo. Earnings22 aporta el cuarto restante con seis llamadas de resultados corporativos de entre 14 y 22 minutos.

Antes de contar los errores, Artificial Analysis normaliza la transcripción del modelo y la de referencia con el normalizador de Whisper, de OpenAI. También aplica reglas propias para equivalencias de ortografía británica y estadounidense, contracciones del inglés y formatos de hora e identificadores.

En su historial de versiones, Artificial Analysis describe esa pieza como un normalizador de texto en inglés. Frederic Lardinois, de The New Stack, señaló que este benchmark aplica solo al habla en inglés.

Sobre ese material, Muse Voice Transcribe quedó en primer lugar con 3.1% de error de palabra, 0.3 puntos por debajo de Cartesia Ink-2. La lista continúa así:

  • Cartesia Ink-2: 3.4%.
  • ElevenLabs Scribe v2 Realtime: 3.6%.
  • GPT Live Transcribe: 3.9%.
  • Gemini 3.5 Transcribe Live: 4.0%.

Los cuatro números no cuentan lo mismo

El anuncio de Meta reúne cuatro cifras que miden cosas distintas y provienen de materiales diferentes:

  • 3.1% de error de palabra: mide la transcripción final, después de detectar el fin del habla. Sale del índice AA-WER Streaming, con unas 8 horas de audio en inglés.
  • 0.16 segundos: mide el tiempo hasta esa transcripción final e incluye la latencia de red. Corresponde al mismo conjunto en inglés.
  • 17.5% de error de diarización: mide la separación de quién habla en cada tramo del audio. Meta publicó el promedio de AMI-IHM, AMI-SDM y VoxConverse.
  • Más de 70 idiomas y 25 verificados: los primeros corresponden al entrenamiento; los segundos, a los idiomas que Meta verificó a fondo y recomienda para la versión inicial. Meta no publicó una medición de error por idioma.

El español sí aparece en la página de Meta, junto con chino, francés, hindi, japonés y vietnamita. Meta también publicó dos demostraciones de cambio de idioma a media frase; ambas mezclan mandarín e inglés.

El modelo decide cuánto escuchar

El audio entra en trozos de 80 milisegundos, 12.5 por segundo, y el modelo convierte cada trozo en un solo token. En cada paso, el modelo elige entre dos acciones: escribir un token de texto o pedir el siguiente trozo de audio mediante un token especial, que el sistema sustituye por el sonido que sigue.

Cuando el audio se acaba, otro token le avisa que no viene nada más y el modelo vacía el texto que tenía pendiente.

Meta llama retraso adaptativo al comportamiento que resulta de este diseño. Como el modelo controla cuánto escucha antes de comprometerse con una palabra, también controla su propia latencia: las palabras fáciles salen casi de inmediato y las difíciles esperan más contexto.

Ese equilibrio se aprende durante el aprendizaje por refuerzo. La recompensa por acertar y la recompensa por responder rápido se multiplican en lugar de sumarse.

El resultado que Meta grafica llega a 0.16 segundos hasta la transcripción final, con un error cercano al 3%, por debajo de la frontera que antes formaban Soniox, Cartesia y ElevenLabs. Es el mejor equilibrio de esa gráfica, no la menor latencia.

Artificial Analysis apunta que Cartesia Ink-2, configurado con endpoints externos, entrega la transcripción final en 0.07 segundos, con 4.0% de error.

Separar a los hablantes sigue siendo difícil

La diarización es la métrica estándar para evaluar la separación de hablantes. Muse Voice Transcribe promedia 17.5% de error, frente a un rango de 21.1% a 28.6% en los otros cinco sistemas de la gráfica de Meta. Encabeza esa comparación, pero la mejor cifra disponible todavía supera 17%.

Frederic Lardinois, de The New Stack, señaló que todos los modelos fallan en esta tarea más de lo que a la gente le gustaría.

Ese promedio usa AMI-IHM, AMI-SDM y VoxConverse. Artificial Analysis retiró AMI SDM de su prueba de transcripción en febrero de 2026 por problemas de calidad en las transcripciones de referencia.

Son pruebas distintas. Que una casa haya retirado AMI SDM no invalida el uso que otra haga del conjunto, aunque el antecedente debe considerarse al comparar cifras de diarización entre laboratorios.

Meta sostiene que el modelo separa más de 20 voces y aguanta audio de más de una hora sin ningún paso de procesamiento posterior. La demostración larga que publicó dura una hora y 52 segundos, con 11 hablantes etiquetados.

Precio, Mac y pesos que no se publicaron

La API cobra 3 dólares por cada 1,000 minutos de audio, unos 0.18 dólares por hora. En la comparación publicada por Artificial Analysis, el costo queda por debajo de los 4 dólares de Cartesia Ink-2 y a menos de la mitad de los 6.50 dólares de ElevenLabs Scribe v2 Realtime y Deepgram Flux por esos mismos 1,000 minutos.

Meta no publicó los pesos del modelo. The New Stack señala que tampoco dio indicios de que vaya a hacerlo, a diferencia de lo que hizo con Muse Glimmer.

El contraste importa para quien quiera correr transcripción en español sobre infraestructura propia, en lugar de pagar por minuto.

En Mac, Muse Voice Transcribe es el motor del dictado dentro de Meta AI y Muse Code. Para dictar sobre cualquier aplicación, hay que mantener presionada la tecla Fn.

La prueba del español todavía falta

El terreno de los modelos de streaming se llenó en cuestión de semanas. Lardinois enumera a OpenAI, Google, xAI y Alibaba entre las compañías que lanzaron modelos de streaming casi al mismo tiempo.

Su lectura es que una ventaja de 0.3 puntos en un campo así no aguanta mucho. El contrapeso está en los productos que le importan a Meta, desde las gafas hasta la aplicación de Mac, que necesitan que esta capacidad funcione.

Para quien habla español, el dato decisivo todavía no aparece. Meta incluye este idioma entre los que muestra, pero no acompaña la lista con un porcentaje de error por idioma. Las dos demostraciones de cambio de idioma mezclan mandarín e inglés, y no sustituyen una medición comparable del español.

Por ahora, el 3.1% acredita el primer lugar de Muse Voice Transcribe en el benchmark de streaming en inglés de Artificial Analysis. Meta todavía no publicó un dato equivalente que permita compararlo con otros modelos en español.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed