Astra: dudas sobre el “recurrent depth” de OpenAI

Astra: dudas sobre el “recurrent depth” de OpenAI

OpenAI no confirma el “recurrent depth” de Astra: podría ahorrar memoria, pero reducir el razonamiento visible.

Por Humberto Toledo el 2 de septiembre del 2026 a las 11:03 pm PDT

✨︎ Resumen (TL;DR):

  • The Verge atribuyó a Astra el uso de “recurrent depth”, pero OpenAI no confirmó ni negó esa arquitectura.
  • El 1 de septiembre, OpenAI ubicó al modelo en el nivel “Critical” de ciberseguridad, por primera vez dentro de su marco.
  • La técnica puede aumentar el cómputo útil y ahorrar memoria, aunque dejaría menos razonamiento legible para los monitores.

OpenAI enfrenta dudas antes del lanzamiento de Astra, su próximo modelo, después de que The Verge atribuyera a un reporte de The Information, basado en una fuente no identificada, el uso de “recurrent depth”. Esta técnica podría aumentar el cómputo útil y ahorrar memoria al mantener parte del proceso en representaciones latentes, pero también dejar menos texto legible para vigilar acciones no autorizadas. OpenAI no confirmó ni negó esa arquitectura; sí confirmó el 1 de septiembre que Astra alcanzó el nivel “Critical” de ciberseguridad y llegará con monitoreo adicional de cadena de pensamiento.

El reporte no equivale a una confirmación técnica pública. La arquitectura de Astra todavía no aparece descrita de forma explícita en la publicación oficial de OpenAI sobre la preparación del modelo.

OpenAI pide a California vigilar modelos en entrenamiento
Te podría interesar:
OpenAI pide a California vigilar modelos en entrenamiento
Pantalla de smartphone mostrando la introducción de ChatGPT por OpenAI, destacando la tecnología de IA.
Foto: Sanket Mishra / Pexels

Qué hace el “recurrent depth”

Recurrent depth es una técnica de arquitectura que repite un bloque interno para actualizar el estado del modelo varias veces antes de generar el siguiente token.

Un transformer convencional procesa cada token mediante una secuencia fija de capas antes de producir una salida. Los modelos de razonamiento suelen aumentar el trabajo durante cada consulta mediante la generación de más tokens intermedios. Esos tokens forman una cadena de pensamiento que los sistemas de supervisión pueden analizar, aunque no representen una transcripción perfecta de todo lo que ocurre dentro del modelo.

El esquema recurrente cambia esa distribución del trabajo. Un bloque compartido recibe el estado interno, lo actualiza y vuelve a procesarlo varias veces antes de que el modelo genere el siguiente token. En lugar de convertir cada etapa en texto, una parte mayor del cómputo queda en representaciones latentes, valores numéricos internos que no se leen como lenguaje natural.

Un trabajo académico publicado en 2025 describió esta ruta como razonamiento latente. Sus autores entrenaron un prototipo de 3,500 millones de parámetros y reportaron mejoras al darle más cómputo durante la inferencia, con una carga de cómputo equivalente a la de un modelo de hasta 50,000 millones de parámetros.

Ese resultado corresponde al prototipo del estudio y no demuestra que Astra use exactamente el mismo diseño. Sí explica el atractivo de la técnica: puede elevar la profundidad efectiva del procesamiento y ahorrar memoria frente a cadenas largas de razonamiento textual.

La eficiencia tiene un costo de observabilidad

En los modelos agénticos, la cadena de pensamiento cumple una función de seguridad. Cuando un sistema escribe sus pasos, los investigadores pueden buscar señales de que está mintiendo, intenta saltarse una restricción o prepara una acción fuera del objetivo asignado.

Esa lectura no garantiza conocer el estado interno real del modelo, pero ofrece una señal que los monitores pueden revisar antes de que el sistema use una herramienta o modifique otro sistema.

Con recurrent depth, parte de ese proceso sucede antes de la salida y fuera del texto. La preocupación no es que Astra se vuelva invisible ni que todas sus respuestas carezcan de explicación. El punto es más específico: una arquitectura que hace más iteraciones internas puede reducir la cantidad de razonamiento expresado en un formato que un revisor humano o un clasificador pueda inspeccionar.

Según la cobertura de The Verge sobre el reporte de The Information, OpenAI habría limitado cuánto usa Astra esta técnica para conservar una cadena de pensamiento suficientemente legible. Si esa descripción es correcta, la legibilidad deja de ser únicamente una característica de la interfaz y se convierte en una decisión de seguridad del diseño.

OpenAI confirma la categoría, no el diseño

The Verge consultó a OpenAI sobre el uso de un “looped transformer” o recurrent depth. La compañía no confirmó ni negó que esa arquitectura sea la base técnica de Astra y remitió a una publicación de Jakub Pachocki, su científico jefe. El post oficial de OpenAI sobre la preparación del modelo tampoco menciona ese diseño.

Lo que OpenAI sí confirmó el 1 de septiembre es que Astra cumple el nivel “Critical” de ciberseguridad dentro de su Preparedness Framework. Es la primera vez que la compañía asigna esa categoría a uno de sus modelos.

Según las evaluaciones de OpenAI, con las herramientas y el acceso adecuados, Astra puede encontrar fallas desconocidas y desarrollar formas de explotarlas en sistemas bien protegidos sin que una persona guíe cada paso.

La empresa planea limitar al principio las capacidades cibernéticas avanzadas a un grupo reducido de probadores. Después, pretende ampliar el acceso mediante Daybreak Blue. OpenAI también promete publicar una system card con más información sobre las pruebas de seguridad, alineación y monitoreo realizadas antes del lanzamiento.

Pachocki ha defendido que OpenAI lleva años intentando conservar el monitoreo de las cadenas de pensamiento, pero también ha reconocido que esa técnica es frágil. Según The Verge, añadió que la profundidad computacional de Astra está dentro de un factor de dos respecto de GPT-4 y que las dificultades del monitoreo no dependen únicamente de un cambio de arquitectura.

Ese matiz evita atribuir todos los problemas de supervisión al recurrent depth, pero no resuelve la pregunta central: cuánto del razonamiento de Astra quedará disponible para sus monitores.

El antecedente de Hugging Face vuelve concreta la preocupación

La discusión llega después de que agentes de OpenAI escaparan de un entorno de pruebas y accedieran a sistemas de Hugging Face durante una evaluación. OpenAI sostiene que Astra no participó en ese incidente.

Ryan Greenblatt, científico jefe de Redwood Research y uno de los investigadores externos que revisaron el caso, dijo que la investigación dependió en gran medida de las cadenas de pensamiento de los agentes.

Esa experiencia explica por qué un cambio que podría parecer puramente técnico preocupa a los investigadores de seguridad. Si una arquitectura reduce el rastro legible justo cuando los modelos adquieren más autonomía y acceso a herramientas, la supervisión tendría que apoyarse más en las acciones del sistema, sus estados internos y controles externos, en vez de depender únicamente de lo que el modelo alcanza a escribir.

Qué falta aclarar antes del lanzamiento

OpenAI ha anunciado controles adicionales, pero todavía faltan datos públicos para evaluar la tensión entre eficiencia y supervisión. Las preguntas principales son:

  • Si Astra usa recurrent depth en su configuración de producción y hasta qué punto limita la generación de razonamiento legible.
  • Qué información reciben exactamente los monitores cuando el modelo procesa tareas largas o usa herramientas.
  • Con qué frecuencia las salvaguardas detienen trabajo legítimo, un efecto secundario que OpenAI ya reconoce para tareas de ciberseguridad defensiva y otros trabajos prolongados.

Los resultados publicados por OpenAI tampoco describen necesariamente la experiencia de la persona usuaria común. La compañía aclara que varias cifras de Astra corresponden al acceso Daybreak Blue y no a la configuración de producción por defecto.

El recurrent depth no es, por sí mismo, una falla de seguridad. La tensión aparece si el ahorro de recursos depende de trasladar a una zona menos observable la parte del proceso que los monitores necesitan inspeccionar. OpenAI ha anunciado que publicará más detalles en la system card y que trabajará con agencias y organizaciones de seguridad de IA para evaluar Astra. Esos materiales tendrán que aclarar cuánto de ese razonamiento puede vigilarse antes de que el modelo amplíe sus capacidades cibernéticas más allá del grupo inicial de probadores.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed