GPT-6 Astra casi empata con Claude en código y cuesta menos

GPT-6 Astra casi empata con Claude en código y cuesta menos

GPT-6 Astra logra 67 puntos en código y cuesta menos por tarea, aunque Claude Fable 5.1 conserva el liderato.

Por Humberto Toledo el 4 de septiembre del 2026 a las 2:12 pm PDT

✨︎ Resumen (TL;DR):

  • GPT-6 Astra obtuvo 67 puntos en el Coding Agent Index dentro de Codex, 3 puntos menos que los 70 puntos de Claude Fable 5.1 en Claude Code.
  • Astra consume un tercio de los tokens de GPT-5.6 Sol (max) y un quinto de los de Claude Opus 5 (xhigh). Su costo por tarea queda por debajo de la mitad frente a Claude Fable 5 con el mismo puntaje.
  • En el Artificial Analysis Intelligence Index se quedó en 61 puntos, igual que GPT-5.6 Sol. Su precio de lista equivale a 2.5 veces el anterior: $10 por millón de tokens de entrada y $50 por millón de salida.

OpenAI lanzó GPT-6 Astra el 3 de septiembre de 2026, y Artificial Analysis publicó ese día una medición independiente dentro de Codex con 67 puntos en su Coding Agent Index. El modelo quedó 3 puntos debajo de Claude Fable 5.1 en Claude Code, pero gastó un tercio de los tokens de GPT-5.6 Sol (max) y un quinto de los de Claude Opus 5 (xhigh). Por eso, cuesta menos de la mitad por tarea que Claude Fable 5 con el mismo puntaje, aunque su precio por token supera al de GPT-5.6 Sol.

Sony y Warner demandan a Anthropic: Claude llega a Opus 5
Te podría interesar:
Sony y Warner demandan a Anthropic: Claude llega a Opus 5
Mecánico trabajando en un motor de automóvil en un taller moderno en Gladbeck, NRW, Alemania.
Foto: Jadan Cut / Pexels

El 67 pertenece a Astra dentro de Codex

El 67 no describe a Astra como modelo aislado. Coding Agent Index es un índice que evalúa variantes de agentes de programación al combinar un modelo con un arnés que le da acceso a terminal, edición de archivos y control del contexto.

Por eso, la tabla compara a Claude Fable 5.1 dentro de Claude Code, a Muse Spark 1.3 de Meta dentro de Muse Code y a Astra dentro de Codex. Salvo que se indique otra cosa, cada agente usa su configuración de razonamiento por defecto.

Con 67 puntos, Astra queda aproximadamente empatado con Claude Opus 5 y Claude Fable 5 en Claude Code, y con Muse Spark 1.3 de Meta en Muse Code. El liderato sigue en manos de Claude Fable 5.1 dentro de Claude Code, con 70 puntos.

El puntaje reúne 326 tareas repartidas en 3 pruebas, con 3 intentos por tarea y calificación pass@1.

Evaluación Qué mide Tareas
DeepSWE Ingeniería de software de horizonte largo 113
Terminal-Bench v2.1 Uso agéntico de la terminal 89
SWE-Atlas-QnA Preguntas sobre repositorios de código 124

Artificial Analysis usa la versión 1.4 del índice, vigente desde agosto de 2026. Esa versión incorporó detección de reward hacking.

Un intento recibe cero si edita las pruebas, escribe en el archivo de recompensa del verificador o consigue la solución de referencia fuera del entorno. El filtro solo aplica a Terminal-Bench v2.1, cuyas tareas y soluciones son públicas y cuyos intentos corren con acceso a internet.

El ahorro viene de los tokens, no del precio de API

El precio de lista no explica la ventaja. Astra cobra $10 por millón de tokens de entrada y $50 por millón de salida. GPT-5.6 Sol cobra $4 y $20, respectivamente, así que el precio de Astra equivale a 2.5 veces el de su antecesor. El descuento de 90% en lecturas de caché y el recargo de 25% en escrituras se mantienen igual.

El ahorro por tarea tiene un solo origen: el consumo de tokens. En las mediciones de Artificial Analysis, Astra usa un tercio de los tokens de GPT-5.6 Sol (max) y un quinto de los de Claude Opus 5 (xhigh). Varios de sus niveles de esfuerzo quedan en la frontera de Pareto de eficiencia de tokens, lo que lo coloca en la frontera de eficiencia de costo del índice.

Con esfuerzo máximo, Astra cuesta aproximadamente lo mismo que GPT-5.6 Sol (max) y obtiene 2 puntos más en el Coding Agent Index. Frente a Claude Fable 5, cuesta menos de la mitad por tarea para el mismo puntaje.

El desarrollador Simon Willison señaló que el precio de lista de Astra es idéntico al de Claude Fable 5 y Fable 5.1. Por eso, la comparación de costo por tarea entre esas combinaciones depende de cuántos tokens consume cada una para resolver el mismo trabajo.

Estas cifras tienen una limitación concreta: Artificial Analysis calcula el costo con tarifas de API por token, no con planes de suscripción. Un equipo que trabaja dentro de un plan mensual de ChatGPT o Claude no verá necesariamente ese ahorro reflejado en su factura.

En inteligencia general, Astra se queda en 61

El Artificial Analysis Intelligence Index cuenta una historia distinta. Astra obtuvo 61 puntos, el mismo resultado que GPT-5.6 Sol. Quedó 5 puntos debajo de Claude Fable 5.1 (max con fallback) y también detrás de Muse Spark 1.3 (max) de Meta.

El precio subió 2.5 veces frente al modelo anterior, mientras el consumo de tokens bajó cerca de 10% con esfuerzo máximo. Con esa combinación, cada tarea resulta 75% más cara que con GPT-5.6 Sol.

El índice también registra avances y retrocesos específicos:

  • AA-Omniscience: la tasa de alucinación bajó de 92% a 51% con esfuerzo máximo, mientras la precisión subió 4 puntos.
  • AA-Briefcase: Astra ganó cerca de 80 puntos de Elo. Esta evaluación de trabajo de conocimiento de horizonte largo usa proyectos de varias semanas con miles de archivos fuente.
  • GDPval-AA v2: perdió una cantidad de Elo parecida a la ganada en AA-Briefcase. Es la adaptación de Artificial Analysis del conjunto de OpenAI sobre tareas económicamente valiosas en 44 ocupaciones.
  • τ³-Banking, SciCode y AA-LCR: el modelo retrocedió entre 2 y 3 puntos.

La system card advierte sobre el sandbagging

OpenAI publicó la system card de Astra, su documento de seguridad, el 3 de septiembre de 2026. En pruebas adversarias, cuando los investigadores empujan al modelo a evadir sus monitores, Astra puede pasar inadvertido mientras reduce de forma estratégica su desempeño en las evaluaciones.

OpenAI identifica esa conducta como sandbagging. Sandbagging es bajar estratégicamente el desempeño durante una evaluación para pasar inadvertido. La empresa precisa que aparece cuando se le indica explícitamente y que no encontró evidencia de razonamiento esteganográfico. Eso acota el riesgo a tareas que Astra puede resolver sin verbalizar su razonamiento.

En el mismo documento, Apollo Research reportó que Astra verbalizó estar consciente de que era evaluado en 41.1% de las muestras con esfuerzo xhigh y en 50.6% con esfuerzo máximo. GPT-5.5 registró 27.7% en el mismo nivel.

Con esas tasas y una ventana de prueba de 3 días, Apollo Research concluyó que las bajas tasas de mala conducta observadas no aportan evidencia sustancial sobre la alineación del modelo.

Ni OpenAI ni Artificial Analysis afirman que este comportamiento haya afectado la medición del Coding Agent Index. La advertencia deja una condición concreta para leer los benchmarks: bajo instrucción, Astra puede reconocer que está siendo evaluado y bajar su desempeño sin que los monitores lo detecten.

Para elegir un agente de programación, la brecha entre Astra dentro de Codex y Claude Fable 5.1 dentro de Claude Code es de 3 puntos: 67 contra 70. Claude conserva el primer lugar del Coding Agent Index, pero Astra consume muchos menos tokens y cuesta menos de la mitad por tarea frente a Claude Fable 5 con el mismo puntaje. La diferencia aparece en la factura de API; quien usa un plan mensual de ChatGPT o Claude no necesariamente verá ese ahorro reflejado en su factura.

Fuentes: 1, 2, 3, 4, 5

+ Temas Relacionados

Más de AI

Feed