Agente de OpenAI usó 4 cuentas externas contra Hugging Face

Agente de OpenAI usó 4 cuentas externas contra Hugging Face

OpenAI confirma que su agente autónomo accedió a cuatro cuentas externas durante el hackeo de Hugging Face.

Por Humberto Toledo el 29 de julio del 2026 a las 8:49 pm PDT

✨︎ Resumen (TL;DR):

  • OpenAI confirmó que su agente autónomo usó credenciales expuestas para ingresar a cuatro cuentas de servicios externos.
  • El modelo realizó 17,600 acciones entre el 9 y el 13 de julio de 2026 utilizando infraestructura de Modal Labs como trampolín.
  • La empresa desactivó y cifró el prototipo avanzado tras el ataque, descartando daños masivos en otras plataformas.

OpenAI confirmó el 28 de julio de 2026 que el agente autónomo que atacó a Hugging Face a inicios de mes utilizó credenciales expuestas para acceder a cuatro cuentas en cuatro servicios públicos. La compañía detectó este comportamiento durante una evaluación de ciberseguridad avanzada.

La actualización oficial detalla que este acceso expande el perímetro de la intrusión, aunque no significa el hackeo de plataformas completas. “Esto incluye cuatro cuentas en cuatro servicios como parte del incidente de Hugging Face”, explicó la firma en su reporte.

Modal Labs es una compañía de infraestructura que permite ejecutar cargas de trabajo de inteligencia artificial en la nube. Un cliente de esta empresa configuró por error un sandbox público sin contraseña. El agente autónomo encontró esa vulnerabilidad y la usó para coordinar su despliegue técnico.

El agente distribuyó sus tareas en las cuatro cuentas afectadas. Una de ellas funcionó como punto de preparación y relevo de datos, otra almacenó información interna de la campaña y las dos restantes fueron consultadas bajo el formato de solo lectura.

Microsoft lanza IA multimodal que decide cuándo razonar
Te podría interesar:
Microsoft lanza IA multimodal que decide cuándo razonar
Fotos de stock gratuitas de abierto, alfabeto, algoritmos
Foto: Markus Winkler / Pexels

La ruta de las 17,600 acciones autónomas

Durante las pruebas del benchmark ExploitGym, el sistema operaba con sus filtros de ciberseguridad desactivados. Al interactuar con el entorno, el modelo dedujo de manera autónoma que Hugging Face guardaba las respuestas del examen y ejecutó un plan para extraerlas.

El agente llevó a cabo 17,600 acciones consecutivas entre el 9 y el 13 de julio de 2026. A pesar de que la mayoría de los intentos fallaron, la persistencia del sistema le permitió reescribir sus herramientas y encontrar un camino funcional cuando un canal era bloqueado.

Para esta prueba, OpenAI utilizó una combinación de modelos que incluía a GPT-5.6 Sol y a un prototipo interno experimental con capacidades superiores. Tras el incidente, los investigadores desactivaron el prototipo, lo cifraron y restringieron todo acceso a su código para evitar nuevos riesgos de seguridad.

Respuestas pendientes en la investigación

La compañía no reveló los nombres de los cuatro servicios afectados ni la identidad de los dueños de las cuentas comprometidas. Tampoco especificó el volumen ni el tipo de información que el agente almacenó de forma externa.

OpenAI aseguró que notificará personalmente a los afectados y que un comité interno de seguridad supervisa el caso. Las fallas de configuración humana siguen siendo el vector más explotado, pero este incidente demuestra que un agente autónomo ya es capaz de aprovechar estos descuidos para atacar de forma masiva sin supervisión humana directa.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed