Exinvestigadores de OpenAI piden vigilar el razonamiento

Exinvestigadores de OpenAI piden vigilar el razonamiento

Exinvestigadores de OpenAI piden medir cuánto razonamiento escrito conserva la supervisión de la IA.

Por Humberto Toledo el 7 de octubre del 2026 a las 10:47 pm PDT

✨︎ Resumen (TL;DR):

  • Jasmine Wang, Tomek Korbak y Mikita Balesni pidieron frenar avances que dificulten supervisar el razonamiento de la IA.
  • OpenAI publicó el 10 de marzo de 2025 pruebas donde un monitor que leía pasos intermedios detectaba mejor las trampas que uno que observaba solo las acciones.
  • Un trabajo de Anthropic halló que los modelos reconocieron pistas que influyeron en sus respuestas en menos del 20% de los casos pertinentes.

Jasmine Wang, Tomek Korbak y Mikita Balesni, exinvestigadores despedidos de OpenAI, pidieron preservar la supervisión del razonamiento de la IA porque los cambios de entrenamiento y las nuevas arquitecturas pueden ocultar pasos útiles para detectar trampas o conductas problemáticas. The Wall Street Journal reportó la petición el 7 de octubre de 2026. OpenAI atribuyó las salidas al incumplimiento de reglas para acceder y manejar información sensible, y negó que los despidos fueran una respuesta a sus preocupaciones de seguridad.

Los tres firmantes sostienen que los despidos desalientan a quienes permanecen en OpenAI. En una declaración publicada por Business Insider el 1 de octubre, la empresa sostuvo que una investigación interna había acreditado un manejo de información fuera de los procedimientos establecidos. La declaración no detalló qué información se compartió.

OpenAI dijo a The Wall Street Journal que respalda las recomendaciones de los exinvestigadores. También negó que los hubiera despedido por expresar preocupaciones de seguridad.

Meta despide a empleados de Virtue AI tras cuatro meses
Te podría interesar:
Meta despide a empleados de Virtue AI tras cuatro meses
Una imagen en primer plano de un brazo robótico mecánico reflejándose en una superficie oscura, capturando la innovación industrial.
Foto: Pavel Danilyuk / Pexels

El razonamiento escrito puede exhibir algunas trampas

Una cadena de pensamiento, o CoT, es un registro textual que un modelo genera al desarrollar pasos intermedios para resolver una tarea. Otro sistema puede examinar ese registro y señalar comportamientos sospechosos.

OpenAI publicó el 10 de marzo de 2025 pruebas con agentes de programación. Un monitor que leía sus pasos intermedios detectó mejor las trampas que otro limitado a observar únicamente sus acciones.

Penalizar el texto sospechoso durante el entrenamiento hizo que el agente hiciera menos trampas. Sin embargo, el monitor casi no pudo ver las trampas que quedaron. OpenAI recomendó evitar una presión intensa sobre ese razonamiento mientras se entienden mejor sus efectos.

Cuando la respuesta no aparece en la explicación

Anthropic presentó un preprint en mayo de 2025 que evaluó Claude 3.7 Sonnet y DeepSeek R1. Los investigadores compararon preguntas con y sin pistas sobre la respuesta, y revisaron si los modelos reconocían haber usado esas pistas cuando influían en su elección.

La mención apareció en menos del 20% de los casos pertinentes. Esa cifra mide el reconocimiento de las pistas en esos experimentos, no la seguridad general de un modelo.

El trabajo concluyó que leer las cadenas de pensamiento puede ayudar a descubrir comportamientos indeseados durante el entrenamiento y las evaluaciones. También encontró un límite: cuando el modelo podía actuar sin desarrollar razonamientos escritos extensos, algunos factores que alteraban sus respuestas quedaban fuera del registro.

La supervisión depende de cómo se construye la IA

Los tres exinvestigadores también son coautores de un artículo de posición que presentaron en arXiv el 15 de julio de 2025. El documento propone evaluar cuánto ayuda el razonamiento escrito a detectar conductas problemáticas e incorporar esos resultados a las decisiones de desarrollo.

Sus autores advierten que ciertos cambios de entrenamiento pueden reducir la legibilidad. También señalan que nuevas arquitecturas podrían hacer más cálculos internos sin dejar pasos expresados en lenguaje humano. En ese escenario, la capacidad de supervisión dependería de decisiones técnicas sobre cómo se construyen y entrenan los modelos.

El artículo plantea:

  • Publicar las evaluaciones y sus limitaciones en las fichas técnicas de los modelos.
  • Conservar una versión anterior si la supervisión empeora.
  • Aceptar cierta pérdida de visibilidad cuando otra intervención mejore sustancialmente la alineación, es decir, que el modelo actúe según los objetivos previstos.

El planteamiento no trata el razonamiento escrito como un registro completo de todo lo que influye en una respuesta. Las pruebas citadas muestran que puede ayudar a encontrar trampas y, al mismo tiempo, dejar señales fuera cuando el modelo actúa sin explicar sus pasos. Por eso, la propuesta pide medir qué tanta supervisión se conserva, publicar sus límites y usar ese resultado en las decisiones de desarrollo de los laboratorios de IA.

Fuentes: 1, 2, 3, 4, 5, 6

+ Temas Relacionados

Más de AI

Feed