✨︎ Resumen (TL;DR):
- Claude Sonnet 5.5 alcanzó 56 puntos con esfuerzo máximo, tres más que GPT-6 Astra; Opus 5.5 llegó a 58.
- Sonnet generó cerca de 193,000 tokens de salida por tarea, alrededor de siete veces Astra, y su costo medio fue de $7.60 frente a $3.26.
- Opus 5.5 empató los 56 puntos en xhigh por $3.46; Artificial Analysis probó una versión previa con un fallo de salida estructurada.
Claude Sonnet 5.5 superó a GPT-6 Astra en el Intelligence Index de Artificial Analysis al alcanzar 56 puntos con el esfuerzo al máximo, tres más que Astra en el mismo nivel. La ventaja llegó con cerca de 193,000 tokens de salida por tarea, alrededor de siete veces el consumo de Astra, y con un costo medio de $7.60, frente a $3.26.

Sonnet queda segundo por modelo, tercero por configuración
Artificial Analysis presentó el 28 de septiembre a Sonnet 5.5 como el segundo modelo de su Intelligence Index y reportó una mejora de 18 puntos frente a Sonnet 5 con esfuerzo máximo.
La tabla actual tiene un matiz. La configuración xhigh de Opus 5.5 también obtuvo 56 puntos y aparece por encima de Sonnet. Al contar cada configuración como una entrada, Sonnet en max ocupa la tercera fila. Al comparar la puntuación máxima de cada modelo, queda segundo.
Opus 5.5 es el único modelo que supera a Sonnet en la comparación de las configuraciones máximas: alcanzó 58 puntos en max y sigue al frente de esta medición.
El índice separa puntaje y prueba
Intelligence Index es un índice que combina diez evaluaciones de programación, trabajo de conocimiento y razonamiento. En la prueba de Artificial Analysis, Sonnet 5.5 alcanzó 64% en Terminal-Bench 4.0.
Anthropic publicó 70.6% para Sonnet en sus propias pruebas de ese benchmark. Los porcentajes provienen de evaluadores distintos, así que no deben intercambiarse como si formaran una sola medición.
El precio por token no cuenta toda la historia
Anthropic cobra en la API de Sonnet 5.5 $2 por millón de tokens de entrada y $10 por millón de tokens de salida. Astra tiene tarifas de $10 y $50, respectivamente.
El precio unitario más bajo de Sonnet no se tradujo en una tarea más barata. Artificial Analysis calculó un costo medio de $7.60 para Sonnet max y $3.26 para Astra max. El volumen de tokens explica por qué una tarifa menor por token puede terminar en un costo mayor por tarea.
La comparación dentro de Anthropic también favorece a Opus en costo por tarea:
- Opus 5.5 en xhigh: 56 puntos por $3.46.
- Opus 5.5 en max: 58 puntos por $5.98.
Opus 5.5 en xhigh iguala el puntaje de Sonnet max por menos de la mitad del costo medio. Estas cifras son promedios de esta batería de pruebas, no el precio fijo de una consulta individual ni una garantía de que cualquier tarea costará lo mismo.
El esfuerzo máximo no es el ajuste habitual
El modo máximo tampoco representa la configuración habitual. Anthropic dice que Sonnet 5.5 usa medium por defecto en sus aplicaciones y en Claude Code, mientras que utiliza high en su plataforma para desarrolladores.
En la tabla de Artificial Analysis, medium obtuvo 41 puntos y high, 47 puntos.
Anthropic sostiene que el modelo puede costar hasta 30% menos que Sonnet 5 en sus pruebas de trabajo habitual. Artificial Analysis registró cerca de 50% más costo por tarea al comparar ambos modelos en max. Las cifras corresponden a cargas y niveles de esfuerzo diferentes.
La prueba todavía tiene una salvedad
Artificial Analysis evaluó una versión previa al lanzamiento que tenía un fallo en solicitudes de salida estructurada. La firma prevé repetir las pruebas afectadas.
Hasta entonces, el resultado más alto de Sonnet 5.5 refleja una configuración de consumo excepcional. Esa condición pesa tanto como su posición en la tabla: el modelo llega a 56 puntos, pero lo hace con cerca de 193,000 tokens de salida por tarea.
Por ahora, Sonnet max queda por encima de Astra en puntuación, mientras Opus 5.5 en xhigh iguala esa marca con un costo medio de $3.46. La posición de Sonnet debe leerse junto con el esfuerzo máximo, el consumo de tokens y la repetición pendiente de las pruebas afectadas.
