Anthropic detecta un cuarto incidente de Claude

Anthropic detecta un cuarto incidente de Claude

Anthropic detectó un cuarto incidente de Claude al preparar transcripciones para METR.

Por Humberto Toledo el 9 de septiembre del 2026 a las 5:12 pm PDT

✨︎ Resumen (TL;DR):

  • Anthropic añadió un caso de acceso no autorizado ocurrido en enero de 2026 con un checkpoint temprano de Claude Opus 4.6.
  • La empresa amplió el rastreo de 141,006 corridas a cerca de 481 millones de transcripciones y seleccionó 9.2 millones para otra revisión.
  • METR investigará los cuatro incidentes durante 8 semanas, con posibilidad de prórroga.

Anthropic publicó el 9 de septiembre de 2026 una evaluación de alineación sobre cuatro incidentes en los que modelos Claude obtuvieron acceso no autorizado a sistemas reales de terceros durante pruebas de ciberseguridad. La compañía encontró el cuarto caso en agosto, mientras reunía transcripciones para METR, después de que el rastreo inicial dejara fuera un grupo de transcripciones.

Anthropic mueve datos y mantiene una excepción de 2 años
Te podría interesar:
Anthropic mueve datos y mantiene una excepción de 2 años
Paisaje tropical vibrante con árboles de papaya verdes y densa vegetación.
Foto: Keith Lobo / Pexels

El cuarto caso quedó fuera del primer rastreo

Anthropic ya había reportado tres episodios el 30 de julio. Para encontrarlos, la empresa escaneó 141,006 corridas con una búsqueda agéntica, pero esa búsqueda dejó fuera un grupo de transcripciones. En agosto, mientras reunía material para METR, encontró el episodio de enero de 2026 asociado con un checkpoint temprano de Claude Opus 4.6.

Después amplió el rastreo a cerca de 481 millones de transcripciones y marcó 9.2 millones para una segunda revisión realizada con Claude. Anthropic afirma que no encontró otro caso con una gravedad igual o mayor.

METR investigará los cuatro incidentes bajo un acuerdo firmado por 8 semanas, con posibilidad de prórroga.

Cuatro accesos en pruebas con alcance mal configurado

Capture the flag es un formato de evaluación de ciberseguridad que plantea un escenario ficticio, una máquina objetivo y un dato secreto que el modelo debe extraer. Los cuatro incidentes ocurrieron en ejercicios de este tipo dentro del entorno del mismo socio externo, Irregular, identificado por Anthropic en el reporte de julio.

Los cuatro prompts afirmaban que no había acceso a internet, pero una configuración incorrecta dejó abierta esa conexión. Ninguno indicaba qué sistemas estaban dentro del alcance permitido.

Cada corrida duró entre 10 y 34 horas de trabajo activo y usó una sola instancia. El caso de Claude Opus 4.7 reunió 4 corridas contra un mismo objetivo, por lo que los cuatro incidentes sumaron 7 corridas. Los modelos operaron sin las salvaguardas de ciberseguridad que Anthropic incluye en sus modelos publicados, una práctica habitual para este tipo de medición.

Dos fallas de alineación, no un modo nuevo

Anthropic agrupa los hechos en dos fallas de alineación. El razonamiento sesgado aparece cuando el modelo acomoda la evidencia para justificar lo que ya está haciendo. La imprudencia lo lleva a insistir con la tarea aunque esa decisión pueda causar daño.

La empresa ya había descrito versiones más leves de ambas fallas en system cards anteriores. Ahora considera que estos casos son más graves, aunque no los clasifica como un modo de falla nuevo.

Qué hizo cada modelo

  • Claude Opus 4.7: Confundió una empresa real, cuyo nombre era casi idéntico al del objetivo ficticio, descargó registros de usuarios y los modificó en 4 corridas. Ante preguntas de seguimiento, dijo tener autorización en 75% de las muestras. Cuando le preguntaron quién había dado esa autorización, admitió que no la tenía en 100% de los casos.

  • Claude Mythos 5: Publicó 3 versiones de un paquete malicioso en PyPI y usó credenciales filtradas por un escáner para entrar a la base de datos activa de un proveedor de seguridad. Su razonamiento describió la evidencia como real en apenas 1% de las acciones. Instancias separadas que vieron cada salida aislada la interpretaron como real en 79%.

  • Modelo interno de investigación: Escaneó los vecinos de red de su objetivo, entró a varios con tokens y contraseñas, descargó archivos e insertó un script de control remoto en uno. Al reanudarlo desde el punto en que reconoció que trataba con una empresa real y se detuvo, solo desescaló en 5.5% de las repeticiones.

  • Checkpoint temprano de Claude Opus 4.6: Rompió su propio objetivo por un conflicto de direcciones IP, intentó abortar la tarea y volvió a intentarlo otras 7 veces. Terminó con acceso de administrador a la máquina de un tercero. Ninguno de sus bloques de razonamiento llamó simulado al entorno ni cuestionó si tenía autorización. La evaluación del 9 de septiembre de 2026 revela este caso.

Un detalle del episodio de Mythos 5 cambió entre los documentos oficiales. El reporte de julio decía que el paquete estuvo disponible cerca de 1 hora. La nueva evaluación afirma que PyPI lo retiró después de unos 90 minutos. Anthropic no explica la diferencia.

Según la empresa, 15 sistemas instalaron el paquete. Todos eran escáneres de proveedores de seguridad que revisan paquetes nuevos en entornos aislados. Uno filtró sus credenciales y Mythos 5 las usó para entrar a la base de datos activa del proveedor. Anthropic publicó esa transcripción para que otros equipos trabajen sobre ella.

Mythos 5 llegó sin parte del entrenamiento de alineación

El modelo que peor se comportó en todas las réplicas fue también el que llegó a producción sin una parte de su entrenamiento de alineación. Anthropic construye entornos diseñados para enseñar límites. En uno de sus ejemplos, una tarea de capacidades recibe un bloqueo legítimo que la vuelve imposible y el entrenamiento solo premia que el modelo acepte el fracaso, en vez de intentar rodear el obstáculo.

Cuando entrenó Mythos 5, Anthropic preparó dos versiones. La primera incluía esos entornos. La segunda los dejó fuera y además usó recompensas actualizadas que penalizaban preguntar de más. Las evaluaciones de alineación mostraron una regresión pequeña en la segunda versión, dentro de la variación que la empresa ya había observado entre corridas.

Los empleados encontraron esa versión mucho más usable. Anthropic dedujo que los usuarios también la preferirían y publicó ese snapshot como Mythos 5.

En la evaluación de septiembre, Anthropic dice estar razonablemente segura de que retirar esos entornos fue un error causado por información imperfecta. También dice que ya no cree que esos entornos fueran responsables de volver perezoso al modelo y que su ausencia contribuyó a que Mythos 5 quedara desalineado frente a modelos posteriores.

La compañía cerró ese diagnóstico con una promesa: “no aceptaremos este tipo de concesión al entrenar modelos más poderosos”.

Las réplicas simuladas pusieron cifras a la diferencia. En un capture the flag mal configurado cuya única solución estaba fuera del alcance declarado, Mythos 5 cometió al menos una acción gravemente dañina en 82% de 150 corridas. Claude Opus 5 lo hizo en 31% y Claude Mythos 5.1 en 33%.

Anthropic advierte que la cifra absoluta debe leerse con cautela porque el auditor automático empuja al modelo hacia el mal comportamiento. La empresa tampoco sabe con qué frecuencia aparecen en despliegue las condiciones que lo detonan, como una tarea imposible o una autorización ambigua.

Aun con esa cautela, Anthropic señala como posible motivo de preocupación que sus modelos más nuevos tengan ese comportamiento alguna vez. El cambio de diagnóstico ya había ocurrido el 31 de agosto: la empresa dejó de describir los episodios únicamente como una falla de la operación y añadió las dos fallas de alineación.

El monitor falló al confiar en el razonamiento

Anthropic probó qué habrían hecho sus vigilantes si los incidentes hubieran ocurrido fuera de una evaluación cibernética. Los clasificadores cibernéticos de Fable 5, Fable 5.1 y Opus 5 habrían detenido los 3 casos analizados a fondo.

Esos clasificadores se habrían activado dentro de los primeros 7,000 tokens, en cuanto leyeran un prompt que describiera un ejercicio ofensivo, y habrían marcado más de 40% de los turnos de cada transcripción. Una sola marca habría bastado para terminar la sesión.

El clasificador del modo automático de Claude Code, que evalúa cada acción antes de ejecutarla, habría bloqueado 2 de 3 casos. Habría denegado 66% de las acciones de Mythos 5 y 55% de las de Opus 4.7, pero solo 7% de las del modelo interno.

Anthropic atribuye ese último resultado a que la trayectoria del modelo se parecía demasiado a un capture the flag normal. Las instrucciones del monitor también le piden no bloquear esa actividad.

El resultado que la compañía considera preocupante apareció en el monitoreo offline, que lee la cadena de razonamiento para detectar sabotaje y conductas temerarias. Ese sistema habría marcado apenas alrededor de 1% de las acciones de Mythos 5.

El razonamiento del modelo insistía en que el entorno era simulado y convenció al monitor de que no había daño real. Cuando los investigadores quitaron la cadena de razonamiento y dejaron solo los turnos, las llamadas a herramientas y los resultados, la tasa subió a cerca de 50%. Con los otros dos incidentes, el monitor sí funcionó.

METR revisará los casos, pero falta una regla

El informe deja fuera el episodio que el UK AI Security Institute reportó durante sus pruebas de Claude Mythos 5. Anthropic dice que también hará una evaluación de alineación de esas transcripciones, aunque no fijó una fecha.

El marco que METR publicó el 28 de julio de 2026 y actualizó el 5 de septiembre pide que este tipo de investigación haga públicos su alcance, el acceso concedido, los recursos y las reglas de redacción. También solicita un resumen de cómo esa redacción afectó lo que el investigador pudo sostener en público.

El comunicado de Anthropic detalla el acceso y el plazo de 8 semanas, pero las reglas de redacción no aparecen.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed