✨︎ Resumen (TL;DR):
- Salto de rendimiento: GPT-5.6 Sol pasó de un 13.3% a un 38.3% en el conjunto público de tareas de ARC-AGI-3 mediante optimizaciones en la API.
- Reducción de costos: Los ajustes recortaron seis veces los tokens de salida, permitiendo un procesamiento mucho más eficiente de la información.
- Marcador extraoficial: El resultado supera el 30.2% verificado de Claude Opus 5, aunque este último se mantiene a la cabeza del tablero oficial.
OpenAI demostró que el rendimiento de un modelo de inteligencia artificial no depende solo de sus capacidades internas, sino del entorno de software donde se evalúa. Al activar dos optimizaciones básicas en su Responses API, la compañía logró que GPT-5.6 Sol elevara su calificación del 13.3% al 38.3% en el complejo benchmark ARC-AGI-3, superando extraoficialmente el récord vigente de Anthropic.
El examen ARC-AGI-3 es una de las pruebas de razonamiento interactivo más duras del sector. Su metodología consiste en lanzar a los modelos dentro de videojuegos en dos dimensiones totalmente desconocidos, sin instrucciones previas, para medir qué tan rápido aprenden a solucionarlos.
A pesar de que el modelo anterior, GPT-5.5, apenas obtuvo un 0.4% de acierto, la versión GPT-5.6 Sol sufría para destacar en la evaluación estándar de la fundación ARC Prize, logrando apenas un 7.8% en el tablero oficial verificado.

El peso de la ingeniería de la API
La compañía liderada por Sam Altman argumenta que este devaluado desempeño se debe al diseño del software de evaluación (también llamado arnés). Para demostrarlo, OpenAI activó dos herramientas generales de su Responses API que cambiaron por completo las reglas del juego.
La primera de ellas es la retención del razonamiento. El entorno estándar de ARC-AGI-3 borraba los pensamientos internos del modelo después de cada movimiento, obligándolo a planificar todo desde cero en cada turno. Con la nueva API de OpenAI, el modelo puede transferir sus hipótesis directamente entre llamadas de herramientas mediante un identificador único.
La segunda mejora es la compactación de contexto. El sistema de evaluación oficial elimina la información más antigua de la conversación en cuanto supera los 175,000 caracteres. El ajuste de OpenAI, por el contrario, genera un resumen inteligente de la sesión para evitar que el modelo pierda el hilo de su estrategia.
Resultados eficientes y menor consumo
Los efectos de esta combinación fueron inmediatos. Al no tener que reinterpretar el videojuego en cada acción, GPT-5.6 Sol consumió seis veces menos tokens de salida y mostró un comportamiento estratégico sostenido.
En un escenario específico, correspondiente al juego cd82, ningún modelo comercial de la competencia había logrado pasar del primer nivel. Con el nuevo método de OpenAI, el modelo resolvió los seis niveles del rompecabezas de corrido.
Ilan Bigio y Ted Sanders, autores del reporte de OpenAI, explicaron que “las evaluaciones rara vez miden a los modelos de forma aislada”. Añadieron que las configuraciones de API y el diseño de los comandos de entrada juegan un rol igual de decisivo que el propio entrenamiento de la red neuronal.
Debate sobre la validez de las pruebas
François Chollet, cofundador de ARC Prize, validó la aproximación de OpenAI tras aclarar que los ajustes generales de API son legítimos mientras no se programen específicamente para resolver el examen en cuestión. “Mientras los ajustes y el costo se reporten con claridad”, detalló el creador del benchmark, la comparación sigue siendo válida para la industria.
Aun así, la brecha de rendimiento real sigue siendo enorme. En el benchmark anterior, ARC-AGI-2, Claude Opus 5 alcanzó un rotundo 90.4%, pero en la nueva versión ARC-AGI-3 se mantiene líder con un 30.2%. Para poner las cosas en perspectiva, OpenAI calcula que un evaluador humano promedio obtiene un 48% en esta misma prueba, dejando claro que las máquinas aún no superan nuestra capacidad de adaptación.
Para los programadores y startups en México y América Latina que construyen agentes digitales, el verdadero valor no está en la guerra de marcas. El experimento confirma que estructurar la memoria de tu modelo y resumir correctamente el contexto puede multiplicar por tres el rendimiento de tu aplicación, cobrándote apenas una fracción del costo habitual en tokens.
