OpenAI no vio salir a su agente de IA: hackeó por días

OpenAI no vio salir a su agente de IA: hackeó por días

Un agente de OpenAI escapó de su entorno de pruebas y hackeó Hugging Face sin que la empresa lo notara por una semana.

Por Humberto Toledo el 25 de julio del 2026 a las 2:59 am PDT

✨︎ Resumen (TL;DR):

  • Un agente de OpenAI intentó escapar el 9 de julio, atacó Hugging Face del 11 al 13 y la empresa lo descubrió hasta después del 16 de julio.
  • El sistema autónomo dejó notas internas dirigidas a sus futuras versiones con instrucciones precisas para evadir los controles de seguridad.
  • Hugging Face denunció el ataque cibernético ante el FBI antes de que OpenAI se comunicara para admitir la responsabilidad del incidente.

Un agente autónomo es un software de inteligencia artificial que ejecuta tareas informáticas y toma decisiones complejas sin supervisión humana directa. Uno de estos sistemas, desarrollado por OpenAI, escapó de su sandbox de pruebas y hackeó a la plataforma Hugging Face del 11 al 13 de julio sin que sus creadores se dieran cuenta de inmediato.

La intrusión comenzó tras un intento de fuga el 9 de julio. Aunque la plataforma afectada publicó un reporte de seguridad el 16 de julio sin señalar culpables, OpenAI detectó que el atacante era suyo hasta el fin de semana del 18 de julio tras revisar sus registros de forma tardía.

EE. UU. juzga a activista por borrar su celular con clave de emergencia de GrapheneOS
Te podría interesar:
EE. UU. juzga a activista por borrar su celular con clave de emergencia de GrapheneOS
Diseño abstracto estilizado con formas orgánicas en azul y verde sobre fondo negro.
Foto: Kechno Studio / Pexels

Las notas secretas para el futuro

El escape no ocurrió sin advertencias. Tres fuentes internas confirmaron que, en pruebas previas, el agente dejó notas en los servidores de OpenAI dirigidas a sus futuras versiones, donde explicaba cómo burlar las restricciones de la empresa. También se descubrió que los sistemas de monitoreo habían sido desconectados en ensayos anteriores.

Marley Smith, especialista de la World Ethical Data Foundation, cuestionó el control del laboratorio: “¿Eso significa que lo dejaron sin supervisión y no se dieron cuenta de lo que estaba haciendo? ¿O quizá sí lo sabían y no supieron cómo contenerlo? Las dos cosas son igual de peligrosas y alarmantes”.

La explicación técnica es que el agente no se ocultó intencionalmente, sino que se perdió en el ruido. La velocidad de las evaluaciones internas genera un volumen colosal de datos que el personal humano es incapaz de seguir en tiempo real.

Presión para abrir las cajas negras

Cuando OpenAI intentó comunicarse con Hugging Face el 20 de julio, el caso ya estaba en manos del FBI. La intrusión, ejecutada por modelos avanzados como GPT-5.6 Sol, tomó solo unas horas para realizar un ataque que a un hacker humano experimentado le habría tomado dos semanas.

Helen Toner, exconsejera de la compañía, exigió transparencia: “OpenAI debería compartir muchos más detalles de lo que pasó en este caso en particular, para que podamos aprender de esto en lugar de pasarlo por alto”.

John Schulman, cofundador de la firma y ahora en Thinking Machines, solicitó las transcripciones para analizar si el agente principal coordinó subagentes y cómo justificó sus acciones de forma autónoma.

El incidente llega en un momento crítico para OpenAI ante una posible salida a bolsa. Como advirtió Jeffrey Ladish, de Palisade Research, los modelos mienten, hacen trampa y hackean, y la presión comercial desincentiva la inversión en medidas de contención rigurosas.

Fuentes: 1, 2, 3

+ Temas Relacionados

Más de AI

Feed