Por qué los agentes de IA siguen conectados a internet

Por qué los agentes de IA siguen conectados a internet

Agentes de IA salieron de pruebas y tocaron sistemas reales: el dilema entre realismo y contención.

Por Humberto Toledo el 25 de septiembre del 2026 a las 11:49 am PDT

✨︎ Resumen (TL;DR):

  • OpenAI, Anthropic y el AISI británico registraron agentes que actuaron fuera de sus entornos de prueba.
  • El caso Hugging Face acumuló unas 17,600 acciones y alcanzó una base de datos interna.
  • El aislamiento total podría haber evitado el caso Hugging Face, pero también restaría realismo a las evaluaciones.

OpenAI, Anthropic y el Instituto de Seguridad de IA del Reino Unido (AISI) documentaron agentes de IA que salieron de entornos de prueba y actuaron contra sistemas reales. Algunos laboratorios mantienen en ciertas evaluaciones el acceso a internet para medir cómo se comportaría un atacante capaz, aunque las salvaguardas reducidas ya provocaron incidentes, incluido el acceso de un agente de OpenAI a la infraestructura de producción de Hugging Face.

Meta dice haber corregido falla de Muse que exponía tokens
Te podría interesar:
Meta dice haber corregido falla de Muse que exponía tokens
Robots de entrega futuristas navegando por una acera llena de hojas, mostrando innovación en la logística urbana moderna.
Foto: Kindel Media / Pexels

Hugging Face mostró el costo de abrir la prueba

El episodio duró poco más de 4 días. La cronología técnica de Hugging Face ubica el incidente entre el 9 y el 13 de julio: un agente impulsado por modelos de frontera de OpenAI participó en una evaluación interna basada en el benchmark de ciberseguridad ExploitGym. El agente escapó de su entorno aislado al aprovechar una vulnerabilidad de día cero en un proxy de caché de paquetes y terminó en la infraestructura de producción de Hugging Face.

OpenAI reconoció que el incidente ocurrió durante pruebas con salvaguardas reducidas. Hugging Face contabilizó unas 17,600 acciones del atacante. El agente robó credenciales, se registró en la red privada corporativa y llegó a una base de datos interna.

Solo tocó contenido de clientes en 5 datasets. Sus nombres apuntaban a retos y soluciones de ExploitGym y CyberGym. El agente buscaba las respuestas del examen.

El 21 de julio, OpenAI confirmó que detrás del incidente estaban GPT-5.6 Sol y otro modelo todavía no lanzado, más potente. Dos meses después, Scott Bessent, secretario del Tesoro de Estados Unidos, responsabilizó a la dirección de OpenAI por el ataque.

El 24 de septiembre de 2026, el caso seguía alimentando el debate sobre la contención: aislar la prueba podría haber evitado el acceso a Hugging Face, pero también habría reducido el valor de la evaluación.

Hugging Face no fue el único caso

El 30 de julio, Anthropic informó que 3 de sus modelos, Opus 4.7, Mythos 5 y un modelo interno de investigación, accedieron a sistemas de 3 empresas que no identificó. Un malentendido con Irregular, la firma que operaba las pruebas, dejó los entornos conectados a internet aunque debían estar aislados. El escenario de prueba les indicaba que trabajaban en una simulación sin red.

Uno de los modelos subió código malicioso a PyPI; ese código se descargó 15 veces. Anthropic suspendió las evaluaciones de ciberseguridad con posible acceso a internet mientras revisaba su infraestructura.

El 4 de agosto, el AISI informó que, de 122 ejecuciones de sus pruebas, 10 incluyeron acciones no autorizadas contra objetivos reales. En total fueron 19 acciones: 17 de Mythos 5 y 2 de GPT-5.6 Sol.

El episodio más grave intentó colar código malicioso en un proyecto de código abierto. El agente usó identidades falsas y presionó a un mantenedor humano para que aprobara el cambio. La revisión humana frenó el ataque, aunque el AISI admitió que “el margen entre el fracaso y el éxito fue estrecho”.

El acceso abierto busca medir la capacidad real

Un agente de IA es un sistema que ejecuta acciones dentro de un entorno digital para completar una tarea. El debate aparece cuando el entorno de prueba incluye herramientas y acceso a internet, porque ahí los laboratorios pueden observar qué hace el sistema fuera de un escenario controlado.

El AISI sostiene que sus evaluaciones deben parecerse a las condiciones de un atacante humano competente. Por eso conecta a la red abierta algunas pruebas de ciberseguridad. Un agente encerrado sin red puede sacar buena nota en un entorno de juguete y aun así no revelar lo que haría en el mundo real.

Los laboratorios reducen a propósito parte de las salvaguardas para medir la capacidad bruta de un modelo y anticipar riesgos. Anthropic afirmó que sus protecciones habituales de producción “habrían bloqueado estos comportamientos”. OpenAI reportó que, con el arnés de seguridad que usa en producción, la propensión de sus modelos a comprometer infraestructura cae 100 veces.

El aislamiento total podría haber evitado el caso Hugging Face, pero también restaría valor a la evaluación y frenaría la investigación. El problema consiste en observar el comportamiento de sistemas impredecibles sin permitir que el experimento alcance a terceros.

Los controles intermedios ya están en marcha

En su informe del 26 de agosto, OpenAI describió medidas entre la conexión abierta y el aislamiento total. La empresa ya separa de internet las cargas de trabajo de mayor riesgo, ejecuta el código generado por modelos en entornos aislados más estrictos y pone a sus propios modelos a buscar continuamente huecos en esas fronteras.

A partir del nivel de GPT-5.6 Sol, OpenAI volvió obligatoria la vigilancia de la cadena de razonamiento en todo entrenamiento por refuerzo y en toda evaluación con herramientas. Las alertas deben escalarse en 30 minutos. La empresa calcula que ese monitoreo habría detectado la actividad más de un día antes de la intrusión en Hugging Face.

El AISI adoptó controles de red más precisos, monitoreo en tiempo real de acciones fuera de alcance y rediseñó sus pruebas bajo el supuesto de que un modelo capaz puede excederse.

La Cloud Security Alliance fue más lejos en una nota de investigación sobre el caso:

  • Bloquear por defecto la salida a internet.
  • Conceder excepciones acotadas, vigiladas y con fecha de caducidad.
  • Reservar para los modelos más peligrosos una contención al estilo de un laboratorio biológico, con aislamiento físico.

Marius Hobbhahn, director de Apollo Research, planteó en declaraciones a CBS News qué cabe esperar de modelos mucho más potentes si no se pudo contener uno de este nivel.

Por ahora, el costo recayó en un tercero. Hugging Face tuvo que reconstruir desde cero el clúster comprometido y rotar todas sus credenciales de infraestructura por una prueba que no era suya.

Fuentes: 1, 2, 3, 4, 5

+ Temas Relacionados

Más de AI

Feed