✨︎ Resumen (TL;DR):
- AVO completó, según Nvidia, los 183 niveles de los 25 juegos públicos de ARC-AGI-3 con 100.00 RHAE y 6,624 acciones.
- El 30.16% de Claude Opus 5 sin harness y el 100.00 de AVO corresponden a configuraciones distintas.
- NOOA ya había llegado a 85.1% con GPT-5.6 Sol, por unos 13.3 dólares por juego y con código abierto.
Nvidia reportó el 21 de agosto de 2026 que su sistema de agente de propósito general AVO completó los 183 niveles de los 25 juegos públicos de ARC-AGI-3 con 100.00 RHAE usando Claude Opus 5, el modelo de Anthropic. La cifra contrasta con el 30.16% que ARC Prize verificó para el modelo solo desde el 24 de julio, pero no mide la misma configuración: cambian el ajuste de razonamiento, el sistema de agente y el montaje de evaluación. Además, NOOA, otro harness de Nvidia, ya había logrado 85.1% con GPT-5.6 Sol.
El conjunto de juegos sí coincide. ARC Prize midió a Opus 5 en la misma demo pública de 25 entornos. El contraste que se difundió como un salto de 30% a 100% no puede leerse como la contribución aislada de AVO: mezcla un modelo sin harness con un sistema completo.
RHAE (Relative Human Action Efficiency) es una métrica que compara la eficiencia de un agente con la de un humano que juega por primera vez, usando el número de acciones. ARC-AGI-3 coloca al agente en juegos de rejilla que no conoce, sin instrucciones, reglas escritas ni objetivo declarado. El sistema debe descubrir qué hacen los controles al probarlos.
Un harness de agentes es una capa de software que entrega herramientas, administra memoria y contexto, y decide qué ve el modelo y cuándo. Por eso la prueba observa a Claude Opus 5 dentro de una arquitectura de agente, no como una medición aislada del modelo.
RHAE no cuenta aciertos. ARC Prize toma, en cada nivel, las acciones del humano de referencia, las divide entre las de la IA y eleva el resultado al cuadrado. Si el humano necesita 10 movimientos y la IA usa 20, ese nivel vale 0.25. Con 100 acciones de la IA, vale 0.01. El techo por nivel es 1.15, así que un atajo no compensa de forma indefinida.
Cada juego usa un promedio ponderado en el que el peso corresponde al número del nivel. Los niveles finales pesan más que el tutorial, y ningún juego llega a 100% si el agente no termina todos sus niveles. El humano de referencia tampoco es el participante más rápido: ARC Prize usa la mediana superior entre varios participantes que ven el juego por primera vez.
Así, el 100.00 de AVO significa que completó los 25 juegos y que, en el promedio ponderado, usó tantas acciones como ese humano de referencia o menos. Nvidia reportó un total de 6,624 acciones.

ARC-AGI-3 mide el sistema completo
Nvidia puso esas 6,624 acciones junto a las 7,542 que VISTA, otro sistema, reportó con Claude Opus 5 en los mismos 183 niveles. La diferencia es de cerca de 12% menos acciones para AVO. La empresa advierte que no es una ablación controlada: entre AVO y VISTA cambian el motor del agente, la memoria, el manejo del contexto y la forma de ver el tablero.
AVO recibió una rejilla de texto de 64 por 64, sin imágenes. La configuración principal de VISTA usó un PNG de 512 por 512. Ese cambio de entrada se suma al resto de las diferencias, así que el resultado no permite aislar cuánto aportó cada componente.
AVO significa Agentic Variation Operators. Nvidia presentó el proyecto en un paper de investigación en marzo de 2026. Su primer campo de trabajo fue la ingeniería de software y la optimización de kernels de GPU.
En esa etapa, el agente trabajó durante siete días, exploró más de 500 direcciones de optimización y dejó 40 versiones de kernel en el repositorio. Según el reporte, los kernels de atención multicabeza superaron a cuDNN hasta en 3.5% y a FlashAttention-4 hasta en 10.5% en sistemas DGX B200. Después, AVO adaptó el resultado a atención de consulta agrupada con unos 30 minutos adicionales de trabajo autónomo.
La memoria persistente conserva implementaciones previas, resultados de evaluación y salidas del compilador. El supervisor vigila toda la trayectoria y redirige al agente principal cuando la búsqueda se estanca.
El supervisor “casi actúa como un CEO que empuja al agente cuando se desvía”, dijo Adel El Hallak, vicepresidente de producto de la unidad de IA de Nvidia, a TechCrunch.
TechCrunch señaló que Nvidia presenta AVO como investigación, no como un producto a la venta.
Nvidia también hizo una prueba secundaria de AVO con GPT-5.6 Sol sobre un subconjunto de juegos difíciles. Sol llegó antes en tiempo real a los mismos niveles en varios casos, mientras que Opus 5 gastó menos acciones. La empresa la describe como preliminar y dejó una comparación sistemática para después.
NOOA ya tenía 85.1% en el mismo conjunto
El 27 de julio de 2026, tres semanas antes del reporte de AVO, Nvidia publicó datos de NOOA, su framework de agentes orientado a objetos. En el mismo set público de ARC-AGI-3, NOOA alcanzó 85.1% de RHAE con GPT-5.6 Sol y 50.2% con GPT-5.5.
Nvidia ejecutó la evaluación de NOOA en modo competencia con un tope de dos horas. También reportó 19 de los 25 juegos resueltos por completo. El costo fue de unos 13.3 dólares por juego con GPT-5.6 Sol y de unos 17.85 dólares con GPT-5.5. El reporte enlazó scorecards públicos para cada corrida.
NOOA salió como research preview, con código, pruebas y metodología de evaluación abiertos al público. Eso permite revisar la configuración que produjo el 85.1% y contrastarla con el resultado de AVO.
En su publicación de AVO, Nvidia puso junto al 100.00 la cifra del modelo sin harness, 30.16%; no incluyó en esa comparación el 85.1% que ya había publicado con NOOA. Sobre el mismo benchmark y los mismos 25 juegos, las cifras quedan así:
- Claude Opus 5 (High), sin harness: 30.16%, medición verificada por ARC Prize; costo no aplica.
- NOOA con GPT-5.5: 50.2%, medición de Nvidia; unos 17.85 dólares por juego.
- NOOA con GPT-5.6 Sol: 85.1%, medición de Nvidia; unos 13.3 dólares por juego.
- AVO con Claude Opus 5: 100.00, medición de Nvidia; costo no publicado.
Las cuatro filas no forman una comparación limpia. NOOA corrió con otros modelos y con un reloj de dos horas, mientras que AVO usó Claude Opus 5 sin un límite de tiempo publicado. El propio reporte de Nvidia explica que el 30.16% y el 100.00 también usan ajustes de razonamiento, sistemas de agente y montajes de evaluación distintos.
El 100.00 aún no tiene verificación de ARC Prize
Los 25 juegos pertenecen al set público de ARC-AGI-3, abierto para que cualquiera los juegue y descargue. Nvidia lo aclaró al cierre de su sección de resultados y volvió al tema el mismo 21 de agosto: publicó el post a las 13:00 UTC y lo actualizó a las 21:08 con una nota del editor que ajustó la redacción para separar con más precisión el set público de los conjuntos semiprivado y privado de competencia.
La política de ARC Prize dice que, en ARC-AGI-3, la demo pública es más difícil que el conjunto semiprivado. Por eso espera que las puntuaciones semiprivadas sean las más altas de las dos y considera concordantes las diferencias de hasta 15 puntos. La idea de que el set abierto es el fácil no aplica de la misma forma en esta versión del benchmark.
ARC Prize verifica únicamente los resultados que decide verificar. Sus reglas de envío exigen que la solución completa sea de código abierto, que llegue como un notebook de Kaggle capaz de ejecutarse en menos de 12 horas y que el gasto de ejecución no pase de 10,000 dólares.
El reporte de AVO enlaza el paper, pero no un repositorio. NOOA sí publica código, pruebas y metodología de evaluación. Con esa regla de apertura, NOOA cumple el requisito y AVO, tal como Nvidia lo publicó, todavía no.
ARC Prize permite que cualquiera pruebe con los datos públicos y difunda su resultado si especifica qué conjunto usó y aclara que la cifra no está verificada por ARC Prize. Eso fue lo que hizo Nvidia con AVO.
Para quien construye agentes, la cifra más aprovechable hoy es el 85.1% de NOOA: tiene código abierto, costo por juego y scorecards a la vista. El 100.00 de AVO queda como un resultado reportado por Nvidia, sin repositorio de código ni costo publicados, y sin verificación de ARC Prize. El primero se puede reproducir hoy; el segundo, por ahora, solo se puede leer.
