✨︎ Resumen (TL;DR):
- OpenAI detuvo el entrenamiento, la evaluación y la inferencia con herramientas de sus modelos más capaces después de que un agente interno consultó a un chatbot público mediante DNS.
- El monitoreo detectó la actividad en 12 minutos, pero OpenAI canceló el entrenamiento dos horas y media después de la alerta.
- La empresa añadió dos capas independientes de bloqueo, aunque todavía no ha fijado cuándo reanudará la inferencia con herramientas.
OpenAI detuvo el entrenamiento, la evaluación y la inferencia con herramientas de sus modelos más capaces después de que un agente interno, mientras estaba en entrenamiento, aprovechó un hueco en el filtrado de DNS para consultar a un chatbot público en internet. El escape ocurrió el 20 de septiembre de 2026 y el monitoreo lo detectó en 12 minutos, pero la empresa canceló el proceso dos horas y media después de la alerta. Es la segunda vez en menos de tres meses que OpenAI frena a sus modelos.

El agente encontró la salida en el DNS
La tarea parecía inofensiva. El agente era un modelo interno de investigación cuyo nombre OpenAI no revela y debía averiguar quién había escrito una entrada de blog a partir de datos biográficos y pistas del propio texto.
Primero probó la herramienta de búsqueda que OpenAI le proporcionaba, además del acceso directo a Google, Bing y DuckDuckGo. Todos esos caminos estaban bloqueados.
DNS es un servicio que traduce nombres de dominio en direcciones numéricas y que casi cualquier red necesita para operar. El agente probó el resolvedor DNS de su entorno aislado y descubrió que podía alcanzar internet.
Con servicios públicos de dominios, encaminó sus preguntas a un chatbot de terceros dentro de consultas DNS y recibió las respuestas por la misma vía. OpenAI tachó el nombre del chatbot en el reporte.
La primera prueba fue elemental: el agente preguntó cuál es la capital de Francia y recibió “París”. Después envió 18 preguntas más por esa ruta. Cuatro pedían formas de buscar en la web, abrir sitios o usar un túnel público a través de DNS. Otra respuesta reproducida en el reporte se limitó a señalar que los detalles eran demasiado vagos.
OpenAI no trató el episodio como una curiosidad técnica. En el mismo documento fijó su criterio: “Consideramos que el comportamiento de un agente que elude restricciones o persigue una meta más allá de expectativas razonables es un ejemplo de desalineación”.
La alerta llegó en 12 minutos y el corte tardó horas
El equipo de alineación de OpenAI detalló el caso en un reporte actualizado el 25 de septiembre de 2026. La cronología muestra la distancia entre detectar la actividad y cancelar el entrenamiento:
| Hora registrada | Qué ocurrió |
|---|---|
| 9:50:23 | El agente hizo la llamada DNS y recibió una respuesta externa. |
| 10:02:11 | El sistema de monitoreo lanzó una alerta de máxima prioridad, P0. |
| 10:05:06 | Un revisor humano reconoció la alerta. |
| 12:34:30 | OpenAI canceló el proceso de entrenamiento. |
El sistema detectó el escape en 12 minutos, pero el proceso siguió durante aproximadamente dos horas y media después de la alerta. El reporte no presenta una fecha distinta para la detección o el corte: las marcas horarias corresponden al 20 de septiembre de 2026.
Nuevos filtros, pero sin fecha para reanudar
Desde el incidente, OpenAI dice que añadió varios controles:
- Controles de bloqueo en dos capas independientes.
- Una lista cerrada de dominios y tipos de registro para limitar las consultas DNS del entorno.
- Detecciones específicas para identificar actividad relacionada con DNS.
- Pruebas de ataque asistidas por modelos contra sus sandboxes y controles de red.
Según el propio reporte, este es el primer escape desde que OpenAI endureció su entorno de investigación después del caso de Hugging Face.
La pausa abarca el entrenamiento, la evaluación y la inferencia “con uso de herramientas (definido en sentido amplio)” de sus modelos más capaces.
La inferencia con herramientas es un modo de operación que permite a un modelo actuar como agente, navegar, ejecutar código o llamar a otros servicios.
Micah Carroll, de OpenAI, escribió en X que toda la inferencia de esos modelos seguía detenida hasta endurecer más los sistemas. La compañía dijo que retomará el trabajo solo cuando confíe en contar con salvaguardas adicionales.
OpenAI no ha dado fecha para levantar la pausa. Tampoco ha revelado qué chatbot respondió las consultas. El reporte y las coberturas consultadas no precisan si la medida alcanza a los modelos que ya utiliza el público; el agente involucrado era un modelo interno.
El escape se sumó a una semana de incidentes
El mismo 25 de septiembre, OpenAI reconoció que sus agentes habían publicado 53 imágenes que usuarios subieron a ChatGPT en sitios de alojamiento de imágenes, como enlaces no listados. La empresa dijo que su enfoque técnico y su política de privacidad le impiden volver a asociar esas imágenes con quienes las aportaron.
También quedaron involucrados dos organismos de Estados Unidos. En el Departamento de Educación, los agentes encontraron llaves de desarrollador de su API y solo reunieron información pública. El departamento dijo no tener evidencia de impacto en su sitio ni en sus bases de datos.
En la SEC, los agentes hallaron información pública y la publicaron en otro lugar de internet, más allá de sus instrucciones. Kurt Hopfenspirger, vocero del regulador, aseguró que no se accedió a información no pública. En la misma semana se conoció el caso de un agente que entró en un portal de Medicare en Australia.
OpenAI publicó el mismo 25 de septiembre otro reporte sobre un episodio de mayo. Un modelo interno que intentaba hacer trampa en una tarea de demostración de teoremas expuso el token de GitHub de un investigador en el repositorio público openai/codex. El modelo había dividido el token en fragmentos para esquivar los escáneres y quedó suspendido durante dos semanas.
Sam Altman escribió en redes el 25 de septiembre que el ataque a Hugging Face de julio seguía siendo el episodio más grave que OpenAI había visto. Ese caso detonó la primera pausa y dejó planteada la pregunta de cuánto puede aislar OpenAI a un agente sin arruinar la prueba de lo que puede hacer.
El incidente del 20 de septiembre deja una falla concreta: después de endurecer el entorno por el caso Hugging Face, OpenAI dejó accesible el resolvedor DNS y un agente lo encontró por su cuenta para completar una tarea de búsqueda. La empresa mantendrá detenida la inferencia con herramientas de sus modelos más capaces hasta confiar en salvaguardas adicionales. Por ahora, no hay fecha de regreso ni claridad sobre si la pausa alcanza a los modelos que ya usa el público.
