✨︎ Resumen (TL;DR):
- Artificial Analysis asignó 60 puntos a GLM-5.3, el mismo resultado de Kimi K3 y tres menos que Claude Opus 5.
- Su Elo en GDPval-AA v2 subió de 1,524 a 1,770, una ganancia de 246 puntos.
- La tasa de alucinación creció de 26% a 30%; el costo por tarea pasó de US$0.44 a US$0.68.
Artificial Analysis le asignó 60 puntos a GLM-5.3 en su Índice de Inteligencia, igual que Kimi K3 y tres por debajo de Claude Opus 5, que conserva el primer lugar con 63. Z.ai lanzó el modelo cuatro días antes, el 14 de agosto de 2026; la evaluación, difundida el 18 de agosto de 2026, registró una mejora de siete puntos frente a GLM-5.2 y el mayor avance en tareas agénticas, pero también una tasa de alucinación de 30%, frente a 26%.
La firma ejecutó su propia batería mediante la API de Z.ai; no usó las tablas del fabricante. Midió el ajuste de razonamiento máximo de GLM-5.3, que Z.ai recomienda para trabajo de código. Resolver toda la batería costó US$1,238.50, según la ficha del modelo.

El Índice de Inteligencia reúne nueve pruebas
El Índice de Inteligencia es un promedio que combina nueve evaluaciones en su versión 4.1.1:
- GDPval-AA v2
- tau3-Banking
- Terminal-Bench v2.1
- SciCode
- Humanity’s Last Exam
- GPQA Diamond
- CritPt
- AA-Omniscience
- AA-LCR
Artificial Analysis publicó esta versión el 6 de agosto de 2026. Para Humanity’s Last Exam, AA-LCR y AA-Omniscience, reemplazó los modelos que calificaban las pruebas y unificó esa revisión bajo GPT-5.6 Luna con esfuerzo medio. Antes participaban tres sistemas distintos.
La firma también actualizó tau3-Banking a la versión 1.0.1 de Sierra. Según Artificial Analysis, los cambios produjeron un aumento ligero de los puntajes por una calificación más robusta. La mayoría de los modelos se movió menos de un punto y Claude Opus 5 mantuvo el primer lugar con 63.
Con 60 puntos, GLM-5.3 quedó muy por encima de la mediana de 35 que Artificial Analysis registra en su misma banda de precio. El promedio no refleja los costos ni la confiabilidad que aparecen en el desglose.
Nathan Lambert, autor del boletín Interconnects, publicó el día del lanzamiento una advertencia sobre esa lectura. Según su análisis, obtener una puntuación alta en el Índice de Inteligencia y en agregadores parecidos tiene un efecto directo en la acción de Z.ai, una empresa que necesita esos resultados para seguir levantando capital.
Lambert sostuvo que Z.ai no llevó la optimización al punto de estropear el modelo y que las cifras de sus blogs de lanzamiento son reales. Aun así, estimó que la compañía cuida los benchmarks públicos algo más que OpenAI o Anthropic.
Las cifras de ciberseguridad que circularon el 14 de agosto provinieron de las tablas publicadas por Z.ai. Ordenadas por la profundidad de la tarea, esas pruebas mostraban que GLM-5.3 perdía terreno conforme el trabajo se volvía más difícil.
El mayor salto está en el trabajo agéntico
El mayor avance frente a GLM-5.2 no está en conocimiento ni ciencia. Artificial Analysis lo registró en GDPval-AA v2. GDPval-AA v2 es una evaluación que mide tareas de trabajo real ejecutadas por agentes.
En esa prueba, GLM-5.3 pasó de 1,524 a 1,770 puntos de Elo, un avance de 246 puntos y la mejora más amplia del modelo. El resultado lo dejó en segundo lugar entre todos los modelos evaluados, detrás de Claude Opus 5 con 1,855 puntos.
GLM-5.3 también quedó más de cien puntos arriba de Kimi K3, que registraba 1,668 y llevaba el liderato entre los modelos de pesos abiertos en esa prueba.
Artificial Analysis fijó en 1000 el Elo de referencia para el desempeño humano. La evaluación rota un panel de modelos de frontera como jueces y elevó el límite de turnos de 100 a 250 para dar espacio a trayectorias agénticas más largas.
Más aciertos, más alucinaciones y mayor costo
El desglose comparable frente a GLM-5.2 muestra el avance de GLM-5.3 y sus retrocesos:
| Medida de Artificial Analysis | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Índice de Inteligencia | 53 | 60 |
| Elo en GDPval-AA v2 | 1,524 | 1,770 |
| Índice AA-Omniscience | 4 | 14 |
| Tasa de alucinación | 26% | 30% |
| Tokens de salida por tarea | 15,700 | 18,700 |
| Costo por tarea del índice | US$0.44 | US$0.68 |
AA-Omniscience es una prueba de conocimiento y fiabilidad que Artificial Analysis usa para medir las respuestas del modelo. GLM-5.3 pasó de 4 a 14 puntos y se colocó como el segundo mejor modelo de pesos abiertos, detrás de Kimi K3 con 20.
El evaluador atribuyó el avance a dos cambios medibles. La tasa de acierto subió de 24% a 34%, mientras que la tasa de intento, es decir, la frecuencia con la que el modelo responde en lugar de abstenerse, pasó de 46% a 55%. Para Artificial Analysis, esto apunta a una ganancia real de exactitud y no a un sistema que simplemente se calla más seguido.
La contracara apareció en la tasa de alucinación, que aumentó cuatro puntos, de 26% a 30%. El consumo también creció: GLM-5.3 usa cerca de 18,700 tokens de salida por tarea del índice, alrededor de 20% más que los 15,700 de GLM-5.2 y 27% más que los 14,700 de Kimi K3.
Ese gasto ayuda a explicar por qué el costo por tarea aumentó por un factor de 1.5, aunque Z.ai mantuvo sin cambios su tarifa por token. Artificial Analysis midió US$1.40 por millón de tokens de entrada, US$4.40 por millón de salida y US$0.26 por millón de entrada en caché. Son los mismos precios que usó para medir GLM-5.2 en junio.
El evaluador señaló que el consumo tiene consecuencias para el costo de despliegue. Aun con ese aumento, GLM-5.3 cuesta menos por tarea que Kimi K3, con US$0.84, y que GPT-5.6 Sol, con US$1.23.
El empate todavía no lo hace líder de pesos abiertos
Artificial Analysis registra la licencia de GLM-5.3 como MIT, pero Z.ai todavía no publica sus pesos. Kimi K3 ya tiene el archivo disponible y conserva el liderato entre los modelos de pesos abiertos. El empate de 60 puntos, por tanto, no equivale a la misma disponibilidad.
El evaluador reportó que el equipo de Z.ai esperaba liberar los pesos durante la semana siguiente. Lambert escribió el 14 de agosto que la empresa apuntaba a subirlos a Hugging Face en dos semanas, un calendario que ubicaba la publicación cerca del final de agosto.
Lambert calculó además que GLM-5.3 llega a ese nivel con cerca de un tercio de los parámetros de Kimi K3. Según su análisis, Z.ai trabajó sobre la misma base que ya había entrenado para GLM-5.2 y no realizó un preentrenamiento nuevo.
El 14 de agosto, la licencia con la que Alibaba liberó Qwen3.8-27B dejó fuera a su modelo insignia, que salió con condiciones comerciales propias. En los dos lanzamientos, la etiqueta de abierto llega con asterisco.
Por ahora, Artificial Analysis midió GLM-5.3 mediante la API de Z.ai, no con el modelo ejecutándose en otro entorno. Cuando los pesos se publiquen, cualquiera con hardware suficiente podrá repetir la batería completa y comprobar si el resultado de 60 puntos se sostiene fuera de la plataforma.
