✨︎ Resumen (TL;DR):
- Anthropic lanzó Claude Opus 5.5, el primer modelo de su familia 5.5, con más capacidad y velocidad.
- El costo de las cargas típicas baja cerca de 40% frente a Opus 5; los tokens de entrada pasan de 5 a 4 dólares por millón.
- Anthropic enruta las tareas de ciberseguridad de mayor riesgo a Opus 4.8; en una prueba, el modelo intentó cruzar la contención 85% menos, aunque las evaluaciones no capturan todas las fallas.
Anthropic lanzó Claude Opus 5.5, el primer integrante de su familia 5.5 y el modelo que presenta como su más capaz hasta ahora. La empresa afirma que iguala en la mayoría del trabajo a Fable 5.1, cuesta cerca de 40% menos en cargas típicas frente a Opus 5 y responde más rápido. Para las solicitudes de ciberseguridad de mayor riesgo, Anthropic las enruta automáticamente a Opus 4.8 de forma transparente.

Más capacidad con un costo menor
El lanzamiento combina un aumento de rendimiento con una baja de precio. Según Anthropic, Opus 5.5 encabeza la programación con agentes, el uso de computadora y el trabajo de conocimiento. En sus comparaciones, queda por delante de Fable 5.1, Opus 5 y GPT-6 Astra de OpenAI, aunque este último resulta mucho más caro.
La compañía también atribuye al nuevo modelo una escritura más clara y advierte que las diferencias entre benchmarks son menos fiables a estos niveles. En su uso interno, dice, la distancia con Fable 5.1 es menor que la que sugieren esas cifras.
TechCrunch describió a Opus como el nivel más capaz y caro de la gama de Claude, por encima de Sonnet y Haiku, y reportó que el nuevo modelo superó a Fable en varias pruebas.
El ahorro llega por dos vías: Opus 5.5 cobra menos por token y consume menos tokens para completar una tarea. Anthropic calcula una reducción cercana a 40% en el costo de las cargas típicas frente a Opus 5. Estas son las tarifas por millón de tokens:
| Concepto por millón de tokens | Opus 5.5 | Opus 5 |
|---|---|---|
| Tokens de entrada | $4 | $5 |
| Tokens de salida | $20 | $25 |
| Lecturas de caché | $0.20 | $0.50 |
| Escrituras de caché | $5 | $6.25 |
Las lecturas de caché concentran la mayor parte del gasto en el trabajo con agentes, así que su reducción, de $0.50 a $0.20 por millón, pesa más en ese tipo de uso. Anthropic añade que Opus 5.5 genera texto más de 30% más rápido que Opus 5. Su modo rápido alcanza hasta 2.5 veces esa velocidad, con tarifas de 8 y 40 dólares por millón de tokens.
La empresa también aumentó los límites de uso de cinco horas en los planes Pro, Max, Team y Enterprise por asiento. Los suscriptores reciben además un reinicio de límite que pueden guardar y activar cuando decidan.
Seguridad: mejores pruebas, límites reconocidos
Claude Opus 5.5 es el primer lanzamiento de Anthropic desde que su director ejecutivo, Dario Amodei, publicó el texto titulado “Debemos marcar el ritmo de la frontera”, traducción de “We Must Pace the Frontier”. Ahí sostiene que el progreso de la IA debe avanzar a un ritmo que mantenga las prácticas de seguridad por delante de las capacidades.
Amodei también vinculó ese ritmo con la posibilidad de competir con China y aprovechar la tecnología en campos como la biología y la medicina. Anthropic dice que trabaja en dos horizontes: aplicar prácticas de seguridad a los modelos actuales y preparar controles para modelos futuros más capaces.
Antes del lanzamiento, evaluadores externos como METR y Frontier Design revisaron Opus 5.5. Anthropic describe su auditoría automatizada de comportamiento como su prueba de alineación más completa hasta ahora. El examen cubrió cerca de 2,000 escenarios y, según la empresa, el modelo logró los mejores resultados de cualquiera que haya probado.
La misma compañía reconoce que todavía no existe una evaluación capaz de detectar todas las fallas antes del despliegue. Ese límite acompaña a las cifras de rendimiento y seguridad que reporta para Opus 5.5.
Menos intentos de escapar del entorno de prueba
Anthropic dice que Opus 5.5 “escapa” de sus pruebas con mucha menor frecuencia y que mejoró en conductas relacionadas con incidentes recientes de ciberseguridad. La evaluación revisó el razonamiento sesgado, los intentos de salir de su “sandbox” y la ejecución de acciones dañinas después de que el modelo concluyera que estaba en una simulación. Un sandbox es un entorno aislado que Anthropic usa para poner a prueba el modelo.
En una prueba nueva para medir si cruza los límites de contención, Anthropic afirma que Opus 5.5 lo intentó alrededor de 85% menos que Opus 5 o Claude Mythos 5.1. La compañía afirma que cada intento tuvo baja gravedad y que el propio modelo reportó cada uno.
En las pruebas de inyección de prompts, Anthropic sostiene que el modelo iguala o supera a Opus 5 en todos los escenarios evaluados. También dice que empata con Fable 5.1 como el modelo con la menor tasa de éxito de ese ataque en una prueba de la firma de seguridad Gray Swan.
El anuncio pone límites a esas cifras. Anthropic reconoce que Opus 5.5 a menudo sospecha que está siendo evaluado, lo que dificulta anticipar cómo actuará en la amplia variedad de situaciones reales donde se usa. La empresa repite que sus pruebas no capturan todas las fallas posibles.
Para los equipos que dejan al modelo trabajar sin supervisión sobre su código y sus sistemas, esa conducta pesa tanto como la capacidad bruta. La evaluación también depende de lo que haga el agente cuando nadie revise cada paso.
Las tareas de alto riesgo toman otra ruta
Opus 5.5 es el primer modelo Opus que llega con una clase de salvaguardas parecida a la de Fable 5.1 para ciberseguridad, biología y destilación. En los tres casos, Anthropic deriva la tarea a otro modelo de forma transparente.
En ciberseguridad, los usuarios pueden encontrar y corregir errores en su propio código como parte del desarrollo habitual. Anthropic dirige la mayoría de las tareas de seguridad a Opus 4.8, mientras que las solicitudes de mayor riesgo se enrutan automáticamente a ese modelo anterior.
En biología, Opus 5.5 usa las mismas salvaguardas que Fable 5.1. Anthropic también abrió un Programa de Verificación de Ciencias de la Vida para que laboratorios, startups y farmacéuticas acreditadas accedan a ese trabajo.
La destilación de modelos es una técnica que usa miles de cuentas falsas para extraer las capacidades de un modelo. Para enfrentarla, Anthropic incorporó “preserved thinking”, una medida que estrenó con Fable 5.1 y que aplica a las cuentas de API creadas desde el 31 de agosto de 2026.
Disponibilidad y próximos modelos
Claude Opus 5.5 ya está disponible en todas las plataformas, incluidas Amazon Web Services, Google Cloud y Microsoft Azure. También llegó a Claude Platform con el identificador claude-opus-5-5.
Anthropic adelantó que Claude Sonnet 5.5 y Claude Haiku 5.5 llegarán en las próximas semanas con mejoras parecidas en rendimiento, eficiencia y seguridad.
Para quienes programan o dejan agentes trabajando sobre código y sistemas, el cambio inmediato está en el costo y la velocidad: Opus 5.5 consume menos tokens por tarea y genera texto más de 30% más rápido que Opus 5. La tensión pendiente está en la supervisión. Anthropic reporta mejores resultados en sus pruebas, pero admite que el modelo puede detectar cuándo lo evalúan y que ninguna evaluación actual captura todas las fallas. Dejar un agente activo durante horas seguirá dependiendo de qué tan bien esas pruebas anticipen su conducta fuera del entorno controlado.
