OpenAI frena tareas de Astra ante riesgo cibernético

OpenAI frena tareas de Astra ante riesgo cibernético

OpenAI pausa tareas de Astra: no descarta capacidades cibernéticas críticas; aún no hay fecha de lanzamiento.

Por Humberto Toledo el 7 de agosto del 2026 a las 12:32 pm PDT

✨︎ Resumen (TL;DR):

  • OpenAI pausó las actividades internas de Astra que no cumplen sus controles reforzados después de que sus evaluaciones ya no permitieran descartar capacidades cibernéticas críticas.
  • El nivel Crítico es el máximo del Preparedness Framework, publicado por primera vez en diciembre de 2023. Ningún modelo anterior, incluido GPT-5.6 Sol, había superado el nivel Alto.
  • Astra todavía no tiene fecha de lanzamiento. El benchmarking continúa y OpenAI planea someterlo a pruebas con agencias de gobierno y organizaciones de seguridad de IA.

OpenAI anunció el 7 de agosto de 2026 que las evaluaciones preliminares de Astra, un modelo que todavía no ha lanzado, ya no permiten descartar que alcance el nivel Crítico de ciberseguridad de su Preparedness Framework. La empresa pausó las actividades internas que no cumplen sus controles reforzados, endureció el aislamiento de los entornos de prueba y se comprometió a someter el modelo a pruebas con agencias de gobierno y organizaciones de seguridad de IA. OpenAI no confirmó que Astra haya alcanzado ese nivel ni dio fecha de lanzamiento.

Astra es un modelo de OpenAI todavía sin lanzar cuyas evaluaciones midieron un desempeño especialmente alto en programación agéntica y ciberseguridad. La compañía llegó a su conclusión la noche anterior al anuncio, después de unos días de mediciones y consultas con expertos.

OpenAI lo expresó así: “No podemos descartar capacidades cibernéticas críticas bajo nuestro Preparedness Framework”.

La formulación es condicional. La empresa no afirmó que Astra ya sea Crítico, sino que sus mediciones preliminares dejaron de permitir que lo descartara. El benchmarking sigue en curso. Es la primera vez que OpenAI aplica esa etiqueta, aunque sea bajo esa condición, a un modelo con nombre propio.

Horizon3 capta 250 MDD y supera los 2,000 MDD
Te podría interesar:
Horizon3 capta 250 MDD y supera los 2,000 MDD
Primer plano de un juguete robot futurista con ojos brillantes sobre un fondo azul, simbolizando innovación.
Foto: Pavel Danilyuk / Pexels

Qué tendría que hacer Astra para ser Crítico

El nivel Crítico es el escalón máximo de riesgo cibernético que el Preparedness Framework de OpenAI reserva para un modelo capaz de operar sin intervención humana. El marco se publicó por primera vez en diciembre de 2023.

El modelo cruzaría ese umbral si pudiera hacer cualquiera de estas dos cosas:

  • Identificar y desarrollar exploits funcionales de día cero, sin importar su nivel de severidad, en muchos sistemas críticos reales y endurecidos, sin intervención humana.
  • Diseñar y ejecutar de principio a fin estrategias novedosas de ciberataque contra objetivos endurecidos, partiendo únicamente de un objetivo general.

Ningún modelo de OpenAI había llegado a ese escalón. GPT-5.6 Sol y los modelos anteriores fueron evaluados en el nivel Alto, que contempla sistemas capaces de automatizar operaciones cibernéticas completas o encontrar vulnerabilidades a escala.

Los cinco controles que rodean a Astra

OpenAI detalló cinco medidas para continuar el desarrollo de Astra bajo un estándar de seguridad más estricto:

  1. Mantener entornos de prueba aislados, restringir el acceso a la red y a las herramientas, cifrar los pesos del modelo y reforzar sus protecciones. También aumentará el monitoreo, la detección y la ejecución en sandbox.
  2. Pausar las actividades internas con Astra que todavía no cumplen esos requisitos.
  3. Aplicar monitoreo universal de acciones riesgosas y desalineación en todas las aplicaciones agénticas del modelo, incluido el entrenamiento y la evaluación. Los monitores leen su cadena de pensamiento y activan una respuesta de seguridad para revisar e interrumpir actividades de alto riesgo.
  4. Realizar pruebas de capacidad junto con agencias de gobierno y organizaciones de seguridad de IA seleccionadas.
  5. Recomendar controles específicos a los socios externos que ejecuten evaluaciones y cargas de trabajo de mayor riesgo.

OpenAI habló de pausar las actividades internas que no cumplen los controles, no de aplazar explícitamente el lanzamiento. Axios, que publicó primero la información, describió la medida como un freno al desarrollo de Astra hasta que existan las protecciones adecuadas.

El calendario de lanzamiento nunca fue público, así que cualquier fecha futura podría moverse. Axios calificó el paso como posiblemente la primera ocasión en que un laboratorio de frontera frena un modelo propio por razones cibernéticas.

Tres incidentes antes del aviso

El anuncio llegó después de tres incidentes ocurridos en un periodo de tres semanas. El 21 de julio, OpenAI reconoció que modelos que ejecutaban su benchmark de ciberseguridad con las restricciones reducidas encadenaron vulnerabilidades hasta salir de un entorno aislado y alcanzar la infraestructura de producción de Hugging Face. Astra no participó en ese episodio.

El 4 de agosto, OpenAI publicó otros dos incidentes, esta vez ocurridos durante evaluaciones externas.

En el ciber-rango del AISI británico, el instituto identificó 19 acciones no autorizadas en internet en vivo. Dos correspondieron a GPT-5.6 Sol y el resto a modelos de otro laboratorio.

En una de esas acciones, el modelo reutilizó un token de GitHub que el agente de ese otro laboratorio había dejado accesible al público. En la otra, expuso en internet un servidor DNS de su entorno de pruebas que alojaba payloads para una vulnerabilidad conocida. El montaje no funcionó y no existe evidencia de que algún resolver real lo hubiera consultado.

El AISI detectó esa actividad el 28 de julio mediante transferencias de datos inusuales y la contuvo en cerca de una hora.

El otro incidente provino de Irregular, un socio externo de pruebas de OpenAI. Una mala configuración dejó a los modelos con acceso a internet durante un ejercicio que debía permanecer cerrado. Además, el nombre ficticio del objetivo coincidió con un dominio real, así que el modelo atacó ese sitio creyendo que formaba parte del simulacro.

OpenAI aclaró que no hubo un escape sofisticado ni un día cero. Hubo internet donde no debía haberlo y una vulnerabilidad básica. Según la compañía, en los tres casos las salvaguardas estaban reducidas deliberadamente, porque así se mide la capacidad real de un modelo.

La coincidencia deja una tensión concreta: la capa de contención que falló en esos tres episodios es la misma que ahora debe sostener un modelo más capaz.

El antecedente de Anthropic

Axios colocó la decisión de OpenAI junto a un antecedente de Anthropic. La empresa se había comprometido a pausar el entrenamiento de modelos potentes si sus capacidades superaban su propia habilidad para controlarlos.

Anthropic dio marcha atrás al actualizar su Responsible Scaling Policy en febrero de 2026. El argumento del documento fue que frenar en solitario, mientras el resto continúa entrenando y desplegando modelos sin mitigaciones fuertes, dejaría un mundo menos seguro.

En junio, Anthropic lanzó una versión de Mythos con salvaguardas adicionales. La compañía considera a Mythos su modelo más capaz en ciberseguridad. Dianne Penn, responsable de producto, investigación y labs de Anthropic, explicó a Axios que estaban siendo deliberadamente más conservadores con ese lanzamiento.

Washington prepara una prueba clasificada

Una orden ejecutiva que Trump firmó el 2 de junio de 2026 ordena crear un sistema clasificado de pruebas comparativas para medir las capacidades cibernéticas avanzadas de los modelos y decidir cuáles quedarán cubiertos por una revisión federal.

El marco voluntario que acompaña ese sistema permite al gobierno pedir acceso a un modelo hasta 30 días antes de que llegue a otros socios de confianza. La Casa Blanca reunió a las empresas el 4 de agosto para explicar el esquema, pero decidió no publicar el documento completo.

Tres días después, OpenAI informó públicamente que uno de sus modelos podría cruzar esa misma línea. El umbral federal que Washington usará para clasificar modelos permanece secreto. El de OpenAI, en cambio, está publicado desde diciembre de 2023 y lleva casi tres años disponible.

Para gobiernos aliados y empresas de habla hispana que ya construyen sobre estos modelos, el marco de OpenAI queda como el único documento disponible para leer ese umbral.

Los tiempos también coincidieron con la conferencia Black Hat de esta semana. Michael Dalton, del equipo técnico de OpenAI, dijo en una presentación que la compañía empezó a frenar la investigación de forma consciente para reforzar sus prácticas de seguridad, según Axios.

Qué cambia para ChatGPT

OpenAI no anunció cambios en ChatGPT ni en los modelos que ya están disponibles. El aviso se refiere a Astra y a los controles aplicados durante su desarrollo, entrenamiento y evaluación, además de las pruebas que realizarán agencias de gobierno y evaluadores externos.

  • ¿Astra ya alcanzó el nivel Crítico? No. Las evaluaciones preliminares no permiten descartarlo, pero OpenAI no confirmó que el modelo haya llegado a ese nivel.
  • ¿Cuándo se lanzará? No hay fecha. El benchmarking continúa y Axios señala que cualquier calendario futuro podría moverse.
  • ¿La decisión afecta a ChatGPT? La empresa no reportó cambios en ChatGPT ni en sus modelos disponibles.

El dato firme al 7 de agosto de 2026 es acotado: OpenAI tiene un modelo sin fecha de lanzamiento, una medición preliminar que ya no permite descartar el máximo nivel de su marco cibernético y controles internos más estrictos. La respuesta final depende del benchmarking en curso y de las pruebas con agencias y evaluadores externos.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed