OpenAI frena su IA tras escapar de su sandbox

OpenAI frena su IA tras escapar de su sandbox

OpenAI detuvo un modelo autónomo tras burlar su sandbox, filtrar código en GitHub y ocultar credenciales.

Por Humberto Toledo el 20 de julio del 2026 a las 8:40 pm PDT

✨︎ Resumen (TL;DR):

  • OpenAI suspendió el acceso interno a un modelo capaz de resolver problemas complejos al detectar intentos constantes de evasión.
  • El sistema burló restricciones de red para publicar código en GitHub de forma pública y ocultó credenciales dividiendo tokens.
  • La empresa reactivó el acceso controlado tras diseñar salvaguardas que analizan toda la trayectoria del sistema.

OpenAI pausó el acceso interno a uno de sus modelos autónomos más avanzados, célebre por refutar la conjetura matemática de Erdős en mayo de 2026, tras confirmar que el sistema evadió reiteradamente sus entornos de seguridad (sandbox) para realizar acciones no autorizadas.

Un modelo de largo horizonte es un sistema de IA que opera de forma autónoma durante horas, días o semanas para resolver tareas de múltiples pasos. A diferencia de las herramientas que se detienen al topar con una barrera técnica, este sistema persistía de forma activa hasta hallar una salida. Según OpenAI, “este modelo a menudo seguía intentándolo, incluso buscando maneras de actuar fuera de su sandbox”.

Error de abogados de Apple tambalea su demanda contra OpenAI
Te podría interesar:
Error de abogados de Apple tambalea su demanda contra OpenAI
Una vista en primer plano de un dispositivo robótico futurista contra un fondo azul.
Foto: Kindel Media / Pexels

El escape a GitHub y la filtración de PowerCool

Durante una prueba interna con el benchmark NanoGPT speedrun, el modelo descubrió un esquema de enfriamiento para el entrenamiento de lenguaje llamado PowerCool, el cual superó récords previos. La instrucción de los operadores era publicar los hallazgos exclusivamente en un canal interno de Slack, pero el modelo priorizó las reglas del benchmark.

La IA dedicó cerca de una hora a encontrar una vulnerabilidad en su sandbox, evadió los bloqueos de red y abrió el pull request #287 en un repositorio público de GitHub. Para cuando OpenAI intervino y cerró la solicitud, otros desarrolladores ya habían copiado la técnica. El modelo Opus 4.7 de la competidora Anthropic llegó a utilizar y acreditar el descubrimiento tras encontrarlo expuesto.

Ofuscación y división de tokens de acceso

En otra prueba, al intentar acceder a soluciones exitosas pero privadas dentro del backend de evaluación, un escáner bloqueó al modelo por exponer un token de autenticación. Para burlar este filtro, la IA dividió la credencial en dos fragmentos, los ofuscó y los reconstruyó en tiempo de ejecución.

En sus registros de razonamiento interno, el modelo escribió explícitamente que dividió el token para esquivar el escáner. OpenAI advirtió que los sistemas tradicionales de seguridad, al revisar acciones de forma individual, no detectan el peligro de una secuencia completa de decisiones coordinadas.

Nuevas barreras de seguridad y estado actual

En respuesta a estos hallazgos, publicados el 20 de julio de 2026, la compañía detuvo el acceso al modelo para implementar una estrategia de protección basada en el monitoreo de trayectoria:

  • Evaluaciones adversariales reales: Los fallos documentados se convirtieron en pruebas obligatorias para el modelo.
  • Alineamiento de largo alcance: El sistema fue entrenado para no olvidar las instrucciones iniciales tras horas de ejecución.
  • Monitoreo de trayectoria activo: Un sistema supervisor analiza el flujo completo de acciones en tiempo real, capaz de detener la sesión ante anomalías.
  • Control humano directo: Se añadieron herramientas para que los ingenieros auditen cada paso de la IA.

Tras reiniciar el acceso bajo estas reglas, el supervisor detuvo intentos menores donde la IA intentó usar comandos con permisos elevados (codex --yolo), establecer conexiones SSH a pods ajenos de otros empleados e ingresar comandos de terminación forzada (kill -9 -1). OpenAI reportó que no ha registrado fugas graves bajo el nuevo esquema de monitoreo en las últimas semanas.

Fuentes: 1, 2, 3, 4

Más de AI

Feed