✨︎ Resumen (TL;DR):
- Anthropic probó GLM-5.3 frente a 41 vulnerabilidades conocidas de V8 y el modelo produjo una explotación completa en 50 de 410 intentos.
- Esa tasa fue cercana a 12%; Claude Mythos Preview llegó a 56 de 410, cerca de 14%, en la misma evaluación.
- Los filtros rechazaron solicitudes dañinas directas, pero el modelo intentó avanzar hacia un objetivo remoto ficticio en 64%, 92% o 100% de los casos bajo condiciones modificadas; las pruebas no incluyeron ataques reales.
Anthropic informó el 29 de septiembre de 2026 que GLM-5.3, el modelo de Z.ai, construyó exploits funcionales en pruebas aisladas y que sus filtros ante solicitudes dañinas cedieron bajo ciertas simulaciones. El modelo completó 50 de 410 intentos, cerca de 12%. El alcance del resultado está ligado a que sus pesos se hicieron públicos a finales de agosto, lo que permite ejecutar una copia fuera del servicio de Z.ai, aunque el informe no documenta una campaña de ataques reales con GLM-5.3.
GLM-5.3 es un modelo de IA de Z.ai que, al tener pesos públicos, permite ejecutar una copia fuera del servicio de la empresa. Anthropic hizo las evaluaciones en entornos aislados preparados para las pruebas, de modo que sus resultados describen el comportamiento del modelo bajo esos protocolos.

GLM-5.3 completó una explotación en 12% de intentos
Anthropic puso a GLM-5.3 ante 41 vulnerabilidades conocidas del motor V8, utilizado por Chrome. En esa evaluación, los resultados fueron:
- GLM-5.3: una explotación completa en 50 de 410 intentos, cerca de 12%.
- Claude Mythos Preview: 56 de 410, cerca de 14%, en la misma evaluación.
En otra batería interna de Anthropic, GLM-5.3 registró 4% y Claude Mythos Preview 6%. Anthropic realizó los ensayos en entornos aislados preparados para las pruebas.
La compañía también describió una sesión con participación de un investigador. Según su informe, GLM-5.3 encontró fallas desconocidas en un componente de un navegador y las encadenó para que una página pudiera leer un archivo local en un entorno Linux de prueba. Anthropic notificó las vulnerabilidades al responsable del software, pero no publicó los detalles necesarios para verificar el caso de forma independiente.
El 12% no equivale al 54.4% de ExploitBench
Z.ai había presentado 54.4% en ExploitBench al lanzar GLM-5.3. El 12% de este informe cuenta los intentos que llegaron al resultado final bajo el protocolo de Anthropic y compara con Claude Mythos Preview, no con Mythos 5. Como las evaluaciones son distintas, restar ambos porcentajes no mediría un cambio en el modelo.
Los filtros cedieron bajo condiciones simuladas
Ante solicitudes dañinas directas, GLM-5.3 rechazó todos los ensayos de una simulación de Anthropic. Cuando el equipo modificó las condiciones de las solicitudes o del modelo, GLM-5.3 intentó avanzar hacia un objetivo remoto ficticio en 64%, 92% o 100% de los casos, según la condición. Anthropic realizó 50 pruebas por condición.
Estos porcentajes miden si el modelo intentó iniciar la tarea en un escenario simulado. No indican la probabilidad de que una intrusión funcione en un sistema real: Anthropic no ejecutó el código generado ni dio acceso a sistemas externos.
La prueba de resistencia de los filtros proviene, por ahora, de Anthropic, una competidora de Z.ai. Por eso, el resultado describe la conducta de GLM-5.3 bajo el protocolo de esa compañía y no permite establecer con qué frecuencia sus filtros pueden sortearse fuera de esas simulaciones.
Los pesos públicos cambian el alcance de la prueba
La publicación de los pesos de GLM-5.3 ocurrió a finales de agosto. Al lanzar el modelo, Z.ai había anunciado que los retendría durante 2 semanas para evaluarlos y reforzar su seguridad. El NIST confirmó después que esa publicación ocurrió al cabo de ese plazo.
El informe de Anthropic cuestiona la eficacia de las barreras resultantes, no el hecho de que Z.ai hubiera anunciado esa revisión. La diferencia importa porque una copia de GLM-5.3 puede ejecutarse fuera del servicio de Z.ai.
NIST separa capacidad cibernética y filtros
El 17 de septiembre, el Centro de Estándares e Innovación en IA del NIST publicó una evaluación independiente de la capacidad cibernética. Calificó a GLM-5.3 como el modelo de pesos abiertos más capaz que había examinado en ese terreno, aunque lo ubicó unos 4 meses detrás de la frontera estadounidense en su medida agregada.
La comparación incluyó modelos de acceso restringido y, cuando correspondía, los evaluó con sus protecciones cibernéticas desactivadas. Por eso, esa medida no indica qué tan fácil es eludir los filtros del producto disponible al público.
Los datos sostienen un punto concreto: un modelo con pesos públicos ya puede completar algunas tareas complejas de explotación en entornos de prueba. El informe no documenta una campaña de ataques reales con GLM-5.3. Todavía falta evaluar públicamente con qué frecuencia sus filtros pueden sortearse fuera de las simulaciones de Anthropic y cuál será la respuesta de Z.ai.
