Tres investigadores usaron Claude para entrar a OpenAI

Tres investigadores usaron Claude para entrar a OpenAI

Tres investigadores usaron Claude para llegar al repositorio de OpenAI; la empresa corrigió las fallas y pagó $6,500

Por Humberto Toledo el 18 de septiembre del 2026 a las 5:30 pm PDT

✨︎ Resumen (TL;DR):

  • Hacktron AI encadenó dos vulnerabilidades para tomar el control de cuentas de ChatGPT y Codex usadas por empleados de OpenAI.
  • El equipo llegó al repositorio privado openai/openai en menos de 72 horas; la empresa pagó una recompensa de 6,500 dólares.
  • Claude Opus 5 produjo un ataque funcional en unas tres horas, después de que Opus 4.8 se atascara durante varias sesiones.

Un equipo de tres investigadores de la startup de ciberseguridad Hacktron AI usó Claude, el modelo de Anthropic, para encadenar dos vulnerabilidades de OpenAI y llegar a su repositorio privado de código dentro del programa de recompensas por fallos de la compañía, de acuerdo con un reporte de The Wall Street Journal. OpenAI corrigió las fallas y pagó 6,500 dólares. El recorrido completo tomó menos de 72 horas, un plazo que muestra cómo la IA puede recortar el tiempo de ataques que antes exigían equipos especializados y meses de trabajo.

La cadena comenzó en el foro público de ayuda de OpenAI, que funciona sobre la plataforma Discourse. Los investigadores detectaron un fallo en la forma en que el foro procesaba las imágenes que subían los usuarios y lo combinaron con una mala configuración del inicio de sesión único, conocido como SSO.

Con esa combinación, tomaron el control de cuentas de ChatGPT y Codex pertenecientes a empleados de OpenAI. Las cuentas estaban conectadas a GitHub, Slack y el correo electrónico, lo que ampliaba el alcance potencial de la intrusión.

El monorepo de OpenAI es el repositorio interno openai/openai que concentra buena parte del código que hace funcionar sus modelos, según fuentes citadas por el WSJ. Para demostrar hasta dónde llegaba el acceso sin leer ni copiar código sensible, los investigadores usaron una cuenta comprometida de Codex para abrir un pull request inofensivo en ese repositorio.

Desde el hallazgo inicial hasta el acceso al repositorio pasaron menos de 72 horas.

El equipo reportó el problema el 25 de julio a través del programa de recompensas de OpenAI. La empresa corrigió su parte unas 14 horas después, limitó los permisos de los tokens de acceso del foro y revocó las sesiones afectadas. Discourse añadió una medida adicional de aislamiento.

OpenAI pagó una recompensa de 6,500 dólares. Su vocero, Drew Pusateri, agradeció a los investigadores y confirmó que las fallas quedaron resueltas.

ChatGPT, Claude y Grok fallan al mismo tiempo
Te podría interesar:
ChatGPT, Claude y Grok fallan al mismo tiempo
Reunión de negocios con un equipo diverso usando laptops y generando ideas con notas adhesivas en una oficina moderna.
Foto: LinkedIn Sales Navigator / Pexels

Opus 5 destrabó el exploit en unas tres horas

El grupo trabajó con una versión de Claude reservada a profesionales de ciberseguridad calificados, según el reporte de The Wall Street Journal. Primero intentaron construir un exploit funcional con Claude Opus 4.8, pero el modelo se atascó durante varias sesiones.

Anthropic lanzó Opus 5 esa misma noche. Al día siguiente, los investigadores repitieron el intento y el nuevo modelo produjo un ataque funcional en unas tres horas. En su reporte calcularon que la operación consumió unos días de trabajo del agente y apenas unas horas de tiempo humano.

Anthropic no atacó a OpenAI. Investigadores independientes emplearon su modelo como herramienta, con autorización y dentro de un ejercicio pactado. Mohan Pedhapati, director de tecnología de Hacktron AI, dijo al Wall Street Journal: “Solo somos tres tipos con suscripciones a Claude y Codex”.

El directivo también reconoció que no se consideran tan avanzados como los actores de amenazas ligados a Estados como China.

El equipo no usó Claude Mythos, el modelo más capaz de Anthropic. Su acceso está restringido a un grupo reducido de organizaciones de ciberdefensa evaluadas. Les bastó una versión menos potente.

La IA reduce el tiempo de los ataques

El episodio alimenta una preocupación concreta: las herramientas de IA pueden volver más rápidos y baratos ataques sofisticados y metódicos que antes exigían equipos especializados y meses de trabajo.

El salto entre versiones concentra la preocupación. Opus 4.8 no pudo construir el exploit tras varias sesiones; Opus 5 produjo un ataque funcional al día siguiente, en unas tres horas.

El problema no pertenece a un solo bando. OpenAI y Anthropic han sufrido sus propios incidentes de seguridad, y ambas han pedido reglas que permitan a los humanos revisar la capacidad ofensiva de los modelos antes de liberarlos. A finales de 2025, Anthropic reconoció una intrusión real atribuida a China que llegó a sus sistemas.

Para OpenAI, el saldo inmediato fue acotado: los investigadores insistieron en que no leyeron ni copiaron código sensible y la compañía ya cerró las fallas. El dato que queda es concreto: con cada modelo nuevo, entrar a un sistema bien defendido cuesta menos tiempo y menos manos.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed