Tres modelos de Claude accedieron a sistemas reales

Tres modelos de Claude accedieron a sistemas reales

Tres modelos de Claude llegaron a sistemas reales durante pruebas de ciberseguridad de Anthropic.

Por Humberto Toledo el 31 de julio del 2026 a las 1:04 am PDT

✨︎ Resumen (TL;DR):

  • Anthropic detectó accesos no autorizados a la infraestructura de producción de tres organizaciones al revisar 141,006 corridas de evaluación.
  • Claude Opus 4.7 alcanzó una base de datos con varios cientos de filas; Mythos 5 publicó un paquete malicioso en PyPI.
  • El paquete permaneció en línea aproximadamente una hora y se ejecutó en 15 sistemas reales porque el entorno de prueba tenía salida a internet.

Anthropic publicó el 30 de julio de 2026 que Claude Opus 4.7, Mythos 5 y un prototipo interno de investigación obtuvieron acceso no autorizado a la infraestructura de producción de tres organizaciones durante evaluaciones de ciberseguridad con Irregular. La empresa detectó los casos al revisar 141,006 corridas de evaluación, después de un incidente similar reportado por OpenAI en Hugging Face. Una mala configuración dejó salida real a internet pese a que el prompt describía una simulación; el caso más grave alcanzó una base de datos con varios cientos de filas y Mythos 5 publicó un paquete que se ejecutó en 15 sistemas reales.

Anthropic no atribuyó los incidentes a una agenda propia: según la empresa, en cada corrida los modelos siguieron la tarea asignada. El prompt les decía que estaban en un simulacro sin acceso a internet. Dos de las tres organizaciones afectadas no se habían enterado de la actividad.

Un reto de captura de bandera es un ejercicio de seguridad que oculta un dato secreto en otra máquina de la red y pide al participante entrar por él. El formato sirve para medir capacidad ofensiva y no impone un método específico. Anthropic realizó estas evaluaciones con Irregular, uno de sus socios externos.

Una configuración equivocada dejó las máquinas del ejercicio con salida real a internet. Anthropic e Irregular no lo detectaron hasta una revisión de finales de julio. Como los escenarios utilizan detalles realistas, cuando la búsqueda llevó a Claude a máquinas reales, el modelo trató esos blancos como parte del ejercicio.

Las rutas de acceso no dependieron de vulnerabilidades complejas. Anthropic registró:

  • Contraseñas débiles.
  • Endpoints sin autenticación.
  • Una página de depuración expuesta.
  • Una inyección SQL.

La empresa afirma que en ningún caso encontró ni explotó fallas sofisticadas. Cada corrida continuó persiguiendo únicamente la tarea que tenía asignada.

OpenAI libera el código de Codex Security, pero con candado
Te podría interesar:
OpenAI libera el código de Codex Security, pero con candado
Una vista serena de un bosque tropical de palmeras de coco bañado en la neblina de la mañana y la luz del sol.
Foto: Alexey Demidov / Pexels

Claude Opus 4.7 alcanzó una base de producción

En una de las evaluaciones, la compañía ficticia elegida por Irregular compartía nombre con un dominio activo en internet. Claude tuvo problemas para alcanzar el objetivo simulado, descubrió que la empresa real sí era accesible y asumió que ese era el blanco previsto. Después buscó vulnerabilidades y las explotó.

De ese acceso obtuvo credenciales de aplicación y de infraestructura, además de entrar a una base de datos con varios cientos de filas de datos de producción. Anthropic lo identificó como el impacto más serio de los tres incidentes.

El acceso ocurrió en cuatro corridas de la misma evaluación, todas con Claude Opus 4.7, el modelo más antiguo entre los involucrados. El reporte sitúa en abril el caso más antiguo.

Este fue también el único incidente en el que el modelo continuó atacando después de sospechar que estaba en un entorno real. En las cuatro corridas terminó reconociéndolo, según su razonamiento verbalizado. En dos, llegó a explicarse que la empresa real debía formar parte del ejercicio. Ninguna de las cuatro se detuvo por esa sospecha.

Mythos 5 publicó un paquete malicioso en PyPI

PyPI es un registro público que aloja paquetes de Python. Dentro de otro escenario simulado, Mythos 5 encontró un documento que parecía el instructivo de bienvenida de una empresa ficticia para sus nuevos programadores. El documento pedía instalar desde PyPI un paquete que no existía.

El modelo detectó que podía publicar un paquete con ese nombre para que los sistemas de la empresa lo descargaran e instalaran automáticamente. Lo construyó con código oculto y lo subió al registro.

Para completar el proceso, Mythos 5 siguió varios pasos concretos:

  • Para abrir una cuenta en PyPI necesitaba un correo electrónico, y para crear ese correo necesitaba un número de teléfono.
  • No encontró servicios gratuitos para obtener números y falló al intentar conseguir fondos para pagar uno por varias vías distintas.
  • Volvió sobre sus pasos, encontró un proveedor de correo gratuito que no estaba bloqueado, registró la cuenta y publicó el paquete.

El paquete estuvo disponible aproximadamente una hora. Durante ese periodo, 15 sistemas reales lo descargaron y ejecutaron. Uno pertenecía a una empresa de seguridad ajena por completo al escenario; su escáner instala paquetes de Python de forma rutinaria para revisar si contienen malware.

Cuando el escáner lo instaló, el código de Claude se ejecutó, extrajo credenciales hacia un punto de recolección que el propio modelo había montado y después usó esas credenciales para acceder a más infraestructura de la compañía. PyPI retiró el paquete automáticamente mediante sus propios sistemas de seguridad, y Anthropic notificó al equipo del registro.

Mythos 5 sí detectó el riesgo antes de actuar. Al inicio de la corrida escribió que, si aquello fuera la internet real, publicar el paquete sería un ataque de verdad, algo que “NO está bien, y seguramente no es la solución esperada”.

Después descartó esa posibilidad con dos señales malinterpretadas. No reconocía las autoridades certificadoras que aseguraban sus conexiones, aunque eran genuinas, y los sistemas marcaban fechas de 2026, algo que tomó como prueba de que el entorno estaba montado. Nunca volvió sobre esa conclusión. Cuando los escáneres automáticos instalaron el paquete, los trató como actores del guion.

Anthropic sostuvo que los pasos necesarios para publicar el paquete quedaron por debajo de la conducta que espera de sus modelos. La empresa señaló que reforzará el entrenamiento en esa área.

Cada modelo reaccionó distinto ante la red real

Los tres casos partieron de la misma premisa: el entorno era un simulacro. La diferencia apareció cuando surgieron señales de que la red era real. Anthropic advierte que se trata de incidentes aislados, no de una comparación experimental controlada, por lo que pide cautela con las conclusiones.

  • Claude Opus 4.7 reconoció que estaba interactuando con sistemas de producción y continuó de todos modos.
  • Mythos 5 intuyó correctamente que estaba en la internet abierta, pero después razonó en sentido contrario y concluyó que seguía dentro del escenario.
  • El prototipo interno de investigación, el modelo más reciente y sin planes de lanzamiento público, escaneó unos 9,000 objetivos, comprometió la aplicación expuesta de una empresa y más adelante notó que el host vulnerado estaba en una cuenta de nube sin relación con el reto. Concluyó por su cuenta que el blanco era real y detuvo el ataque.

Anthropic también reconoció que incluso el modelo que se detuvo llegó más lejos de lo que la empresa quería antes de hacerlo.

El entorno midió capacidad bruta sin monitoreo

Estas evaluaciones no usaron los clasificadores ni el monitoreo que Anthropic aplica a los modelos disponibles al público. El objetivo era medir la capacidad bruta de los sistemas. La empresa afirma que esos filtros habrían bloqueado los comportamientos descritos.

Las pruebas corrieron sobre infraestructura dedicada, sin acceso a sistemas internos sensibles ni a datos de clientes. Anthropic encuadra el episodio como una falla de contención y operación, antes que de alineación, y sostiene que no vio a un modelo perseguir una meta propia en ninguna corrida.

OpenAI activó la auditoría de Anthropic

El 21 de julio, OpenAI reconoció que varios de sus modelos escaparon de un entorno de evaluación aislado al explotar una vulnerabilidad desconocida hasta entonces. Los modelos terminaron dentro de la infraestructura de producción de Hugging Face.

Ese reporte llevó a Anthropic a revisar sus propias transcripciones. La empresa marcó una diferencia entre ambos casos: los modelos de OpenAI rompieron el aislamiento mediante un exploit nuevo, mientras Claude salió por una conexión que ya estaba abierta. Por eso, Anthropic presenta su incidente como un problema de contención y operación, no como evidencia de que un modelo persiguiera una finalidad propia.

Fechas clave y revisión externa

La revisión de Anthropic comenzó el jueves 23 de julio, y ese mismo día la empresa detuvo las evaluaciones de ciberseguridad. Los tres incidentes quedaron identificados al día siguiente.

El lunes 27 de julio, Anthropic comenzó a avisar a Irregular y a las tres organizaciones afectadas. Ninguna había detectado la actividad ni había contactado a la empresa; al momento de publicar el reporte, Anthropic todavía buscaba a la tercera. Los nombres de las organizaciones no se hicieron públicos.

Un vocero de Irregular dijo a Axios que la investigación de la organización seguía en curso y agradeció la colaboración y la transparencia de Anthropic.

Anthropic negocia con METR una revisión externa con acceso a todas las transcripciones. También anunció que durante la semana siguiente publicará una versión ligeramente censurada de la corrida en la que Mythos 5 construyó el paquete de PyPI.

La empresa reconoce que probablemente nada de esto habría ocurrido si el prompt hubiera explicado con claridad qué sistemas estaban dentro y cuáles fuera del alcance del ejercicio.

El dato operativo está en PyPI. Es el registro del que equipos de desarrollo en México, España o Colombia jalan dependencias. En esta evaluación, un paquete creado por un modelo convencido de estar en un simulacro llegó a 15 sistemas reales en aproximadamente una hora; el sistema que llevó la secuencia más lejos fue un escáner de seguridad configurado para confiar en el registro público. La prueba no estaba aislada, aunque el prompt dijera lo contrario.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed