✨︎ Resumen (TL;DR):
- Xiaomi liberó MiMo-V2.6-Pro y Flash con pesos bajo licencia MIT, informe técnico, código de RL y más de 7,000 entornos de tareas.
- MiMo-V2.6-Pro reúne 1.02 billones de parámetros totales y activa 42,000 millones por token; Flash suma 309,000 millones y activa 15,000 millones.
- Xiaomi reporta resultados cercanos a Claude Opus 5 y GPT-5.6 Sol, pero su tabla deja ventajas repartidas y una brecha clara en ExploitBench.
Xiaomi publicó la familia MiMo-V2.6, integrada por los modelos omnimodales Pro y Flash, y liberó sus pesos bajo licencia MIT. La compañía también entregó un informe técnico, código de aprendizaje por refuerzo (RL) y más de 7,000 entornos de tareas. Xiaomi afirma que Pro queda “a la par” de Claude Opus 5 y GPT-5.6 Sol en la mayoría de los benchmarks de agentes, aunque los resultados publicados no muestran una victoria general.
Además del código de aprendizaje por refuerzo, Xiaomi publicó un framework de RL de extremo a extremo y una versión destilada de 9,000 millones de parámetros basada en Qwen. También transmitió parte del proceso de RL en público y reportó un costo conjunto de aproximadamente 3.47 millones de dólares en menos de 6 días.

Pro y Flash comparten una ventana de un millón de tokens
Modelo omnimodal es un sistema de IA que acepta texto, imágenes, video y audio. Los dos modelos trabajan con una ventana de contexto de un millón de tokens.
MoE es una arquitectura de mezcla de expertos que activa una parte de sus parámetros por token. MiMo-V2.6-Pro usa este esquema con 1.02 billones de parámetros totales, es decir, 1.02 millones de millones, y activa 42,000 millones de parámetros por token.
MiMo-V2.6-Flash suma 309,000 millones de parámetros y activa 15,000 millones por token. Xiaomi lo plantea como la variante más eficiente, mientras que Pro ocupa el lugar insignia de la familia.
Las fichas de ambos repositorios en Hugging Face identifican la licencia MIT. La publicación también incluye el informe técnico, el framework de RL de extremo a extremo, los entornos de tareas y la versión destilada de 9,000 millones de parámetros basada en Qwen.
La comparación con Opus 5 no es una barrida
La afirmación de Xiaomi se refiere a la mayoría de sus pruebas para agentes, no a todos los escenarios. La ficha pública compara Pro y Flash con Claude Opus 5 y GPT-5.6 Sol en programación, automatización, uso de herramientas, terminal, ciberseguridad y tareas visuales.
Esta selección de la tabla publicada por Xiaomi muestra los puntajes de Pro frente a los dos modelos cerrados:
| Benchmark | MiMo-V2.6-Pro | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|
| DeepSWE v1.1 | 71.9 | 74.0 | 73.0 |
| AutomationBench v1.0.6 | 53.1 | 50.3 | 45.8 |
| Terminal Bench 2.1 | 89.9 | 89.1 | 88.8 |
| ProgramBench | 26.5 | 37.0 | 25.0 |
| Terminal Bench 4.0 | 34.9 | 49.0 | 39.9 |
| OSWorld-Verified | 82.0 | 83.4 | 83.0 |
| ExploitBench | 47.9 | 70.0 | 78.5 |
Los datos sostienen la descripción de “a la par” en algunas pruebas, pero no una victoria completa. Pro supera a Claude Opus 5 y GPT-5.6 Sol en AutomationBench v1.0.6 y Terminal Bench 2.1. En DeepSWE v1.1 queda detrás de ambos; en ProgramBench queda debajo de Opus 5, pero supera a GPT-5.6 Sol; y en Terminal Bench 4.0 vuelve a quedar por debajo de los dos.
En OSWorld-Verified, sus 82.0 puntos quedan cerca de 83.4 y 83.0. La diferencia es mayor en ExploitBench, donde registra 47.9 frente a 70.0 y 78.5. La lectura razonable es que Xiaomi redujo mucho la distancia en tareas agénticas, no que eliminó la diferencia con los mejores modelos cerrados.
Como referencia externa, Artificial Analysis le asigna 46 puntos a MiMo-V2.6-Pro en su Intelligence Index, construido con 10 evaluaciones independientes. Esa medición lo coloca en la parte alta de los modelos de pesos abiertos, pero no sustituye una reproducción independiente de toda la tabla de Xiaomi.
Xiaomi sitúa el entrenamiento de RL en 3.47 millones de dólares
La cifra corresponde a una ejecución corta y muy intensiva. Xiaomi estima 2.62 millones de dólares para Pro y 850,000 dólares para Flash. En conjunto, ambos modelos suman aproximadamente 3.47 millones de dólares en menos de 6 días.
Cada variante completó 30 pasos y las dos acumularon cerca de 750,000 trayectorias. El equipo escaló el aprendizaje por refuerzo en tres frentes:
- Cada actualización utilizó 1,568 muestras.
- La ejecución llegó a entre 3,500 y 3,700 millones de tokens por paso.
- Las tareas combinaron programación, agentes generales, entradas visuales y ciberseguridad.
En lugar de una recompensa binaria de aprobado o reprobado, Xiaomi construyó evaluadores que comparan las trayectorias exitosas dentro de cada grupo. Así, el sistema favorece soluciones más cortas y eficientes.
En sus propias mediciones, Xiaomi reportó que la tasa promedio de aprobación de las tareas creció 25% en términos relativos para Flash y 12% para Pro. En DeepSWE v1.1, Flash pasó de 48.8 a 65.7 y Pro de 58.4 a 72.6. Estos resultados pertenecen a la evaluación de la compañía; todavía no representan una replicación independiente.
Los pesos son abiertos, el despliegue no es sencillo
MiMo-V2.6 combina pesos descargables, entradas de texto, imagen, video y audio, además de una divulgación detallada del entrenamiento por RL. La licencia MIT facilita el uso comercial, la modificación y el ajuste posterior. El informe técnico, el código y los entornos permiten examinar el método con más profundidad que una simple tabla de resultados.
Los pesos pueden descargarse y auditarse, pero el tamaño de Pro eleva las exigencias de memoria y despliegue. Sus 1.02 billones de parámetros totales y 42,000 millones activos lo orientan a equipos con infraestructura de alto rendimiento.
Flash reduce la escala activa a 15,000 millones, aunque sigue siendo un modelo grande. Quien quiera operar los pesos por su cuenta tendrá que resolver la memoria, la distribución entre aceleradores y la velocidad de inferencia.
Para quienes no quieran administrarlos, Xiaomi anunció acceso mediante su plataforma API y un cliente de escritorio.
La validación pendiente está fuera de la tabla
MiMo-V2.6 no demuestra que los modelos abiertos ya superen de forma general a los cerrados. Sí muestra que Xiaomi puede publicar pesos, código y recursos de RL mientras coloca a su modelo insignia cerca de la frontera en varias pruebas.
La validación que falta es concreta: terceros deben repetir las mediciones y comprobar que el rendimiento se mantenga al pasar de la tabla de laboratorio a cargas de trabajo reales. Por ahora, la afirmación de paridad describe una parte de los benchmarks de agentes, no el desempeño general de la familia.
