✨︎ Resumen (TL;DR):
- DeepSeek V4 Flash alcanzó el umbral de corte de la IMO 2026 con 30 de 42 puntos.
- El modelo de pesos abiertos gastó 12 centavos de dólar, 143 veces menos que Claude Fable 5, que obtuvo una puntuación mayor.
- El caso se relaciona con la reducción del consumo energético, la eficiencia de inferencia y el gasto en tokens de los modelos de razonamiento de frontera.
DeepSeek V4 Flash, un modelo de inteligencia artificial de pesos abiertos, alcanzó el umbral de aprobación de la Olimpiada Internacional de Matemáticas (IMO) 2026 con 30 de 42 puntos y un gasto reportado de 12 centavos de dólar. Según un informe de Cline, Claude Fable 5 consiguió una puntuación mayor, pero necesitó un gasto 143 veces superior.
El informe registra que al menos 5 modelos de inteligencia artificial alcanzaron una buena calificación en la evaluación. DeepSeek V4 Flash no obtuvo la nota más alta, pero sí consiguió superar el corte de 30 puntos, con un máximo posible de 42.
El texto describe estos sistemas como modelos que, según se supone, fueron entrenados exclusivamente para superar las pruebas de la Olimpiada. No es la primera vez que un modelo preparado para ese objetivo alcanza una puntuación aprobatoria, aunque el costo registrado por DeepSeek V4 Flash cambia la comparación.

La IMO exige resolver y demostrar
Los modelos enfrentaron las 6 pruebas oficiales de la Olimpiada Internacional de Matemáticas. Estas pruebas constan de 6 problemas y exigen algo más que entregar una respuesta: cada modelo debe resolver los ejercicios y demostrar de manera ordenada cómo llegó a sus soluciones.
El umbral de corte se fijó en 30 puntos, frente a un máximo de 42. DeepSeek V4 Flash llegó a esa marca con 12 centavos de dólar. Claude Fable 5 obtuvo una puntuación aún mayor, pero con un gasto 143 veces más alto, de acuerdo con la comparación del informe.
La cifra no convierte a DeepSeek en el modelo con la mejor calificación. Su interés está en la relación entre el resultado y los recursos utilizados para alcanzar una puntuación aprobatoria en una prueba de razonamiento matemático.
Capacidad de razonamiento y costo
Modelos de OpenAI ya habían conseguido superar las pruebas de la IMO en un pasado reciente, aunque con un consumo mucho mayor. El resultado de DeepSeek V4 Flash se suma a esa secuencia de evaluaciones centradas en el razonamiento de frontera.
El texto vincula estos hitos con una tendencia concreta: las capacidades de los modelos se distancian cada vez más, mientras bajan los costos relacionados con el consumo energético, mejora la eficiencia de inferencia y disminuye el gasto en tokens.
No se trata únicamente de conseguir una respuesta correcta. En la IMO, el modelo debe construir una demostración ordenada, por lo que el resultado combina la puntuación obtenida con el costo de producirla.
De Deep Blue a un smartphone
La comparación con el ajedrez muestra cómo ha cambiado la escala de estas capacidades. En 1997, IBM Deep Blue se enfrentó al campeón mundial de ajedrez Garry Kasparov. Crear una supercomputadora capaz de vencerlo implicó cerca de 9.5 millones de dólares, al ajustar la cifra por inflación.
Hoy, para un caso como ese, bastaría un motor de ajedrez especializado y de pesos abiertos. Un motor de ajedrez especializado y de pesos abiertos es un sistema que puede instalarse incluso en un smartphone con suficiente memoria RAM, según el texto.
En la comparación con Claude Fable 5, la puntuación mayor y el gasto menor no pertenecen al mismo modelo: DeepSeek V4 Flash alcanzó el umbral de la IMO 2026 con 30 de 42 puntos por 12 centavos de dólar.
Fuente: 1
