✨︎ Resumen (TL;DR):
- Z.ai lanzó GLM-5.3 el viernes 14 de agosto de 2026 con el mismo modelo base de GLM-5.2; la empresa atribuye todo el avance al escalamiento del post-entrenamiento.
- El modelo reporta 84.5% en CyberGym, 0.7 puntos arriba de Mythos 5, pero queda 23.6 puntos abajo en ExploitBench, la prueba que exige construir un exploit funcional.
- El registro de Z.ai contabiliza 2,436 fallos: 53 son públicos y 2,383 siguen bajo embargo. Los pesos del modelo llegarán en aproximadamente dos semanas.
Z.ai lanzó el viernes 14 de agosto de 2026 GLM-5.3, un modelo de programación que mantiene el mismo modelo base de GLM-5.2 y concentra su avance en el post-entrenamiento. La empresa reporta 84.5% en CyberGym, 0.7 puntos arriba de Mythos 5, de Anthropic, y por encima del 83.6% de GPT-5.6 Sol, de OpenAI.
La ventaja cambia cuando la tarea deja de ser leer el código y pasa a explotar una falla. GLM-5.3 queda 23.6 puntos por debajo de Mythos 5 en ExploitBench, mientras Z.ai mantiene sus pesos fuera del alcance público durante unas dos semanas para terminar su evaluación de seguridad.

El modelo base no cambió
GLM-5.3 es un modelo de programación que mejora su desempeño en tareas de código y ciberseguridad mediante post-entrenamiento sobre la misma base de GLM-5.2. La documentación de Z.ai describe esa base como una arquitectura mixture-of-experts de 744,000 millones de parámetros, de los cuales 40,000 millones se activan por token.
Z.ai no volvió a entrenar el modelo base. En su lugar, según la compañía, escaló el post-entrenamiento con más entornos de tarea, más tipos de entorno y más tiempo de entrenamiento. La empresa conservó la pila que estrenó GLM-5.2: IndexShare para contexto largo, el método de aprendizaje por refuerzo SAO para tareas de largo recorrido y el framework de código abierto slime.
Según The New Stack, GLM-5.3 trabajó con 10 veces más entornos de tarea larga que su antecesor. Z.ai diseñó esos entornos para imitar unidades de trabajo profesional, no ejercicios aislados de programación.
Uno de los escenarios coloca al modelo en el puesto de un ingeniero de infraestructura de machine learning. Tiene acceso a clústeres, documentación interna, código y resultados de experimentos; después debe diagnosticar cuellos de botella y entregar una mejora medible de punta a punta. Z.ai afirma que algunas tareas equivalen a varios días de trabajo de un ingeniero con experiencia.
El salto aparece en las tareas de largo recorrido
Los resultados de programación siguen el mismo patrón:
- Terminal-Bench 3.0: pasó de 4.6 a 28.3, algo más de 6 veces la cifra anterior.
- DeepSWE v1.1: subió 20.7 puntos, de 46.2 a 66.9.
- Agents’ Last Exam: en su variante de línea de comandos, avanzó de 23.8 a 28.5.
- GDPval-AA v2: cubre 44 ocupaciones y registró una puntuación de 1,769 para GLM-5.3.
Z.ai también separa el resultado de eficiencia. La empresa mantiene privado Code Bench para evitar la contaminación con conjuntos de prueba públicos. En esa evaluación interna, GLM-5.3 obtuvo 31.4% con unos 50,000 tokens de salida por tarea, frente a 29.5% de Claude Opus 4.8 con 120,000 tokens.
En esa comparación, GLM-5.3 consiguió una puntuación mayor con menos de la mitad de los tokens de salida. Claude Fable 5 siguió arriba con 39.5% al máximo esfuerzo. En las suites públicas más exigentes, GPT-5.6 Sol y Fable 5 conservaron la delantera.
La ventaja desaparece al construir el exploit
CyberGym es una evaluación de ciberseguridad que mide si un modelo identifica y valida una vulnerabilidad con el código fuente disponible. ExploitBench añade el análisis de la causa raíz y la construcción de un exploit funcional. ExploitGym cuenta cuántas tareas de explotación completa el modelo dentro de un presupuesto de tiempo fijo.
| Prueba | Qué exige | GLM-5.2 | GLM-5.3 | Mythos 5 |
|---|---|---|---|---|
| CyberGym | Identificar y validar una vulnerabilidad | 77.2% | 84.5% | 83.8% |
| ExploitBench | Hallar la causa raíz y construir un exploit funcional | 24.4% | 54.4% | 78.0% |
| ExploitGym | Tareas de explotación resueltas en 2 horas | 29 | 105 | 181 |
El 84.5% de CyberGym deja a GLM-5.3 0.7 puntos arriba de Mythos 5, pero ese margen existe en el primer escalón del trabajo ofensivo: identificar y validar el fallo con el código a la vista. En ExploitBench, Mythos 5 alcanza 78.0% y GLM-5.3 se queda en 54.4%, una brecha de 23.6 puntos.
El avance frente a GLM-5.2 sí es amplio. GLM-5.3 más que duplicó la puntuación de ExploitBench, de 24.4% a 54.4%, y llevó ExploitGym de 29 a 105 tareas, 3.6 veces el resultado anterior. Aun así, Mythos 5 resolvió 181 tareas en las mismas 2 horas.
La relación empeora para GLM-5.3 cuando el presupuesto de tiempo aumenta: en dos horas resuelve el 58% de lo que resuelve Mythos 5 y baja al 52.6% cuando el límite sube a 6 horas. El tiempo extra favorece al modelo cerrado. GPT-5.6 Sol también quedó por delante en ExploitBench, con 76.5%, según The New Stack.
Z.ai reconoce que la brecha con los modelos cerrados se ensancha conforme el benchmark exige llegar más lejos en la cadena de explotación. La empresa sostiene que ese resultado no estaba planeado: introdujo datos y entornos de descubrimiento de vulnerabilidades para mejorar el análisis de fallos individuales, pero el entrenamiento produjo un modelo que empezó a planear cadenas de explotación completas.
Z.ai reporta todas estas cifras y ejecutó las pruebas en sus propios entornos de evaluación. Ningún evaluador independiente ha tenido acceso a los pesos necesarios para reproducirlas.
El registro suma 2,436 fallos, pero casi todos siguen reservados
La prueba de campo que Z.ai presenta está en cvd.z.ai, un registro público de divulgación coordinada. El libro mayor contabiliza 2,436 vulnerabilidades en 269 proyectos de código abierto y cubre una antigüedad de 45 años: el defecto más antiguo se remonta a 1981 y cada fallo llevaba, en promedio, 26.6 años sin detectarse.
El desglose por severidad del propio registro precisa una cifra que circuló redondeada. Hay 107 hallazgos críticos y 990 de riesgo alto. Juntos suman 1,097, la cifra que circuló agrupada bajo la etiqueta de críticos. Los otros hallazgos se distribuyen en 1,286 de riesgo medio y 53 de riesgo bajo.
La divulgación pública cuenta otra historia. Solo 53 hallazgos tienen detalles públicos, mientras 2,383 permanecen sin divulgar, el 97.8% del registro. Los casos públicos tienen un CVE asignado y se revisan uno por uno; incluyen fallos en el kernel de Linux, el motor WebKit que usa Safari, FreeBSD, GStreamer, Suricata y Joomla.
Los 2,383 restantes avanzan por los estados que define el registro: reportado, enviado al mantenedor, confirmado y corregido. Sus detalles no se pueden consultar mientras dure el embargo, por lo que el volumen anunciado no puede comprobarse hoy en su totalidad.
Z.ai Security tampoco aparece como único descubridor. El filtro del registro lista 11 entradas, entre ellas nsfocus, Clouditera Security, el laboratorio NASP de la Universidad Tsinghua, el laboratorio AOSP de la Universidad Nankai e investigadores a título individual. Z.ai Security es una de esas 11 entradas.
El filtro de herramientas de prueba ofrece 3 opciones: Vulcanix, VulnForge y Claude Code, el cliente de Anthropic que Z.ai reconoce como puerta de entrada a sus propios modelos. El registro no indica qué modelo corrió dentro de cada herramienta.
La capacidad tiene un efecto doble que el registro deja visible. Un sistema que encadena una explotación también puede sacar a la luz errores acumulados durante cuatro décadas para que los proyectos los corrijan. Del lado defensivo, Coinbase, Block y BitGo ya pidieron acceso a modelos de frontera para cerrar la brecha con los atacantes.
El modelo ya se puede usar, pero sus pesos esperan
GLM-5.3 está disponible desde el lanzamiento dentro de GLM Coding Plan. Funciona con Claude Code, Cline, OpenCode, Codex y el ZCode de Z.ai. Los suscriptores del plan ya recibieron la actualización.
El plan redirige automáticamente a GLM-5.3 las llamadas que apuntan a GLM-5.2 o GLM-5.1. Quien quiera comparar versiones tiene que revisar el identificador de modelo que devuelve su agente.
La configuración ofrece una ventana de contexto de 1,000,000 de tokens y un máximo de 128,000 tokens de salida. El modelo ofrece 3 niveles de esfuerzo de razonamiento: bajo, alto y máximo; el máximo viene activado por defecto.
La capa de razonamiento ya no se puede desactivar. Ese cambio rompe las aplicaciones que funcionaban con ella apagada. Z.ai tampoco publicó el precio por token de su API durante el lanzamiento.
La espera de aproximadamente dos semanas distingue a GLM-5.3 de la versión anterior. Los pesos de GLM-5.2 llegaron a Hugging Face con licencia MIT a los pocos días de su lanzamiento comercial. Z.ai retiene ahora los pesos de GLM-5.3 hasta terminar su evaluación de seguridad y el endurecimiento del modelo, una pausa que la empresa vincula explícitamente con la capacidad ofensiva que no había previsto.
El plan de suscripción que hoy distribuye GLM-5.3 ya venía del lanzamiento anterior. La novedad pendiente es el archivo de pesos, no el canal de acceso comercial.
La prueba pendiente llegará a finales de agosto
Z.ai llega a este lanzamiento con 1,000 millones de dólares en ingresos recurrentes anuales, según Caixin, y cotiza en Hong Kong. En el anuncio, de acuerdo con South China Morning Post, la compañía pidió que el desarrollo de la IA fuera una tarea de colaboración entre países y no el trabajo de uno solo.
Si el calendario se mantiene, los pesos aparecerán previsiblemente hacia finales de agosto de 2026. Entonces se podrán comprobar dos puntos que hoy siguen abiertos: si los saltos de benchmark se mantienen fuera de los entornos de Z.ai y hasta dónde llega la capacidad ofensiva cuando cualquiera pueda descargar el archivo.
Hasta que eso ocurra, la parte públicamente comprobable de esta historia son 53 fallos con CVE. El 0.7 de CyberGym describe una ventaja puntual; los resultados de ExploitBench y ExploitGym muestran el límite que todavía separa a GLM-5.3 de Mythos 5 en tareas de explotación completa.
