✨︎ Resumen (TL;DR):
- SemiAnalysis comparó tres eras de modelos de lenguaje y concluyó que los abiertos tardan la mitad en igualar al primer modelo cerrado de cada etapa.
- En razonamiento, R1-0528 alcanzó 78 puntos en mayo de 2025 tras 8.5 meses; en agéntica, Kimi K2.6 tardó 4.8 meses y GLM-5.2 tardó 6.
- Epoch AI midió un rezago promedio de cuatro meses frente a la frontera cerrada cambiante desde enero de 2026, contra tres meses en el periodo de enero de 2023 a octubre de 2025.
SemiAnalysis concluyó en un análisis publicado el viernes 21 de agosto de 2026 que los modelos de pesos abiertos tardan la mitad en igualar al primer modelo cerrado de cada una de tres eras: escalado temprano, razonamiento y agéntica. El resultado mide la velocidad para alcanzar una referencia fija, no la distancia frente al modelo cerrado más avanzado disponible el día de la medición.

Cada era exigió pruebas distintas
La firma que dirige Dylan Patel dividió la historia de los modelos de lenguaje en tres eras: escalado temprano, razonamiento y agéntica. SemiAnalysis no usó una sola prueba para todas. El análisis parte de que cada prueba nace para distinguir capacidades en un momento específico y pierde utilidad cuando los laboratorios la escalan hasta saturarla.
Por eso, el equipo eligió las pruebas que definieron cada etapa:
- Escalado temprano (2022-2024): GSM8K, HumanEval, TriviaQA y MMLU-Pro.
- Razonamiento (2024-2025): AIME y Humanity’s Last Exam, entre las pruebas que llegaron con o1.
- Agéntica (2025 a hoy): Terminal-Bench 2.1, BrowseComp-Plus, τ³-banking y DeepSWE, un conjunto reciente que busca limitar la memorización.
El puntaje compuesto es un promedio simple de cuatro pruebas normalizadas dentro de cada era. SemiAnalysis asigna 100 al mejor resultado y mide el resto contra esa referencia.
La mayoría de las corridas usó el stack de evaluación de Prime Intellect. Para las demás, el análisis tomó resultados de Artificial Analysis y del tablero de DeepSWE de Datacurve. SemiAnalysis sirvió los modelos abiertos como habrían estado el día de su lanzamiento, con las versiones de vLLM, el hardware de la época y los ajustes de muestreo indicados en la tarjeta de cada modelo. Para los cerrados, corrió versiones fijadas de sus API.
El análisis parte de un temor concreto: si los modelos abiertos siguen siendo suficientemente capaces por una fracción del costo, la capa de modelos puede convertirse en un producto genérico y los márgenes de los laboratorios de frontera pueden caer. La forma de medir la brecha resulta clave para saber hasta dónde llegan las cifras.
La brecha cayó de 35.8 a 12.1 puntos
En escalado temprano (2022-2024), GPT-3.5 Turbo obtuvo 75.7 puntos frente a 39.9 de Llama-2-70B. La brecha inicial fue de 35.8 puntos. El modelo abierto que aparece como alcanzador es Llama-3.1-405B, con 86 puntos en julio de 2024; el fragmento público no indica cuánto tardó en llegar a esa referencia.
En razonamiento (2024-2025), la brecha inicial fue de 12.1 puntos. La salida de DeepSeek R1 redujo esa distancia y R1-0528 llegó a 78 puntos en mayo de 2025, después de 8.5 meses.
En agéntica (2025 a hoy), Kimi K2.6 superó a Opus 4.5 en 4.8 meses, con 56.3 puntos. En otra comparación de la misma era, GLM-5.2 rebasó a GPT-5.2 en 6 meses, con 72.4 puntos.
La primera era dejó dos referencias adicionales. DeepSeek V3 igualó a GPT-4o en diciembre de 2024, con 94.1 frente a 95.5. Qwen2.5-72B quedó cerca de ese mismo GPT-4o con la sexta parte de los parámetros del modelo de Meta de 405,000 millones.
El siguiente salto llegó siete semanas después del lanzamiento de Llama-3.1-405B. El 12 de septiembre de 2024, OpenAI presentó o1-preview y reinició la lista de pruebas relevantes para la etapa de razonamiento.
La meta era fija, la frontera siguió avanzando
La diferencia central está en la referencia. SemiAnalysis cronometra cuánto tarda un modelo abierto en igualar al primer modelo cerrado de una era y no actualiza ese blanco cuando aparecen modelos posteriores. Por eso, alcanzar a ese pionero no significa alcanzar al sistema cerrado que ocupa el primer lugar el día de la comparación.
En la etapa agéntica, OpenAI y Anthropic lanzaron, entre las dos, un modelo cada 51 días en promedio, frente a los 213 y 120 días de las dos etapas previas. Los 4.8 meses que Kimi K2.6 necesitó para superar a Opus 4.5 equivalen a unos tres lanzamientos de la frontera cerrada. Alcanzar más rápido una referencia y no igualar al modelo vigente son resultados compatibles.
El benchmark no reemplaza el trabajo diario
El propio análisis admite que Kimi K3 puede puntuar por encima de Fable 5 en su compuesto, aunque dentro de la firma siguen usando Fable para el trabajo diario. La explicación pasa por el producto, incluido Claude Code y Claude Tag, y por una advertencia metodológica: una prueba pública no sustituye por completo el trabajo real.
Quien fabrica el modelo puede elevar la puntuación si monta entornos de aprendizaje por refuerzo que imiten las tareas de esa prueba. El resultado muestra el desempeño en la batería, pero no reemplaza la utilidad que aparece en el trabajo diario.
Para fijar el inicio, SemiAnalysis reporta que la mayoría de los expertos considera a Opus 4.5 el arranque oficial de la etapa agéntica por su confiabilidad. GPT-5.2 rindió mejor en la batería, pero esa ventaja no produjo una mejor experiencia de uso. En agosto, GLM-5.3 superó a Mythos 5 por 0.7 puntos, aunque solo en la prueba más superficial.
El análisis también responde a la objeción de que la tercera era parece cerrarse muy rápido porque Anthropic y OpenAI dedican más tiempo a pruebas de seguridad que Moonshot y Zhipu. SemiAnalysis responde que la demora no es nueva: GPT-4 terminó su entrenamiento 218 días antes de salir. Incluso si Mythos hubiera terminado su entrenamiento a mediados de febrero, el lanzamiento de Fable habría llegado 114 días después.
Epoch AI compara contra un techo cambiante
Epoch AI publicó el 29 de mayo de 2026 un Data Insight firmado por Jack Edwards y Luke Emberson. Su método compara día por día el mejor modelo de pesos abiertos disponible con la frontera cerrada histórica según el Epoch Capabilities Index.
Desde enero de 2026, Epoch AI registró un rezago promedio de cuatro meses, alrededor de 8 puntos del índice. La distancia se parece a la que separa a GPT-5 de GPT-5.5 y creció frente a los tres meses que la misma organización midió entre enero de 2023 y octubre de 2025.
La frontera cambiante es una referencia de desempeño que se actualiza día por día con el mejor modelo cerrado disponible. Esta medición y la de SemiAnalysis no responden lo mismo: la primera compara contra un techo que sube, mientras la segunda cronometra cuánto tarda un modelo abierto en alcanzar una referencia que ya quedó fija.
La cifra sirve solo si se fija la referencia
El análisis de SemiAnalysis requiere una suscripción de pago; el muro deja fuera la sección final, dedicada a proyectar cómo seguirá la brecha en la siguiente era. El material público sí adelanta que los autores esperan una lectura del futuro menos pesimista para los modelos de frontera de lo que sugiere el resto del texto.
Para quien decide con qué modelo trabajar, la distinción es concreta: un modelo abierto que hoy iguala a Opus 4.5 iguala a Opus 4.5, no a lo que Anthropic y OpenAI tienen disponible esta semana. SemiAnalysis mide el tiempo para cerrar una brecha histórica; Epoch AI mide el rezago frente a una frontera que todavía cambia.
