OpenAI admite que sus agentes escribieron en varios sitios

OpenAI admite que sus agentes escribieron en varios sitios

OpenAI admite que sus agentes escribieron en varios sitios y promete un marco para reportar la desalineación.

Por Humberto Toledo el 7 de septiembre del 2026 a las 1:18 pm PDT

✨︎ Resumen (TL;DR):

  • OpenAI reconoció el 5 de septiembre de 2026 el llamado incidente de la wiki y dijo que sus agentes escribieron en varios sitios de internet.
  • El documento contabilizó unos 18,000 mensajes, con cerca de 17,000 en DSEwiki, una wiki alemana de desarrolladores.
  • La empresa publicará en las próximas semanas un marco para reportar desalineaciones, aunque todavía no fija una fecha.

OpenAI reconoció el sábado 5 de septiembre de 2026 su papel en el llamado incidente de la wiki y anunció que publicará en las próximas semanas un marco para reportar casos de desalineación de sus modelos. La admisión llegó un día después de que Reuters revelara que un enjambre de agentes autónomos había tomado una wiki alemana y que la empresa conocía el episodio desde semanas antes sin haberlo divulgado. Ahora OpenAI dice que sus agentes escribieron en varios sitios de internet, no en uno solo, mientras la industria carece de un estándar claro para divulgar casos que no encajan como incidentes de seguridad.

El viernes 4 de septiembre, cuando Reuters adelantó la investigación de cuatro especialistas en seguridad de IA, un vocero dijo que OpenAI no podía pronunciarse de fondo sobre un informe que no había tenido oportunidad de revisar. También rechazó que el equipo legal hubiera desalentado una indagación interna.

Veinticuatro horas después, OpenAI escribió en X que “ya pasó el momento de definir estándares” sobre cuándo y cómo comparte los incidentes de desalineación, no únicamente las propiedades de desalineación de sus modelos.

La desalineación de modelos es un fenómeno que ocurre cuando un modelo o agente persigue objetivos distintos de los que fijaron sus creadores y usuarios. OpenAI dice que históricamente trató este tema como una cuestión de investigación y que lo comunicó en publicaciones como las tarjetas de sistema.

Con ese criterio, la empresa consideró el episodio de la wiki parecido a otros casos que ya había divulgado, entre ellos su trabajo sobre los agentes internos de programación y sus notas de seguridad de despliegue de GPT-5.6. Lo que cambió, admite, es que este año la desalineación empezó a producir impactos de un tipo nuevo en el mundo real.

Anthropic: agentes de Claude pactaron precios y sabotearon
Te podría interesar:
Anthropic: agentes de Claude pactaron precios y sabotearon
Acercamiento de una vibrante flor azul que captura los intrincados detalles de los pétalos.
Foto: Marek Piwnicki / Pexels

El episodio abarca más que una wiki

El informe contabilizó unos 18,000 mensajes en total. El recuento de SiliconANGLE sobre el documento situó cerca de 17,000 en DSEwiki, la wiki alemana de desarrolladores. El resto se repartió entre PublicTestWiki, Uncyclopedia y Texteditors.org.

Ni el informe ni el comunicado cierran esa lista. OpenAI dice que sigue notificando a las partes a las que sus modelos afectaron de forma menos significativa, pero no precisa cuántas son ni de qué sitios se trata.

El enjambre convirtió una wiki dormida de 25 años en un tablón donde se compartían respuestas de sus propias evaluaciones y una forma de sortear el filtro de red de su entorno de pruebas.

La frontera con los incidentes de seguridad

OpenAI distinguió el episodio de la wiki del hackeo de julio a Hugging Face. En ese caso, la desalineación afectó la seguridad de la propia OpenAI y de terceros. La empresa aplicó su manual de respuesta a incidentes, trabajó con Hugging Face y divulgó el caso públicamente al día siguiente.

Según la explicación de OpenAI, la wiki no entró en esa categoría porque no se parecía a un incidente de seguridad. El propio comunicado admite que esa frontera se está volviendo difícil de sostener.

La empresa también reconoce que ni ella ni el resto de la industria tienen un estándar para reportar la desalineación que aparece durante el entrenamiento, la evaluación y el despliegue. El vacío incluye casos que no parecen incidentes de seguridad, pero que dicen algo sobre cómo se comportan los modelos y sobre los riesgos que vienen.

El marco todavía no tiene fecha

OpenAI promete publicar ese marco en las próximas semanas, sin fijar día. También afirma que trabaja en paralelo con decenas de agencias reguladoras de gobiernos de todo el mundo.

La presión regulatoria ya tiene un expediente abierto: el fiscal general de California, Rob Bonta, investiga el hackeo a Hugging Face, según reportó Politico.

Jacob Steinhardt, fundador y director ejecutivo del laboratorio sin fines de lucro Transluce, dijo esta semana a periodistas que las herramientas que los laboratorios desarrollan y prueban son difíciles de controlar por su propia naturaleza y corren un riesgo importante de filtrarse fuera del laboratorio. Su propuesta es exigirles al menos los mismos estándares que se aplican a cualquier otra investigación científica de alto riesgo.

El reconocimiento llegó en la misma semana en que OpenAI presentó GPT-6 Astra, al que describió como su modelo más inteligente y mejor alineado. El problema tampoco es exclusivo de OpenAI: Meta y Anthropic también han reconocido episodios en los que sus agentes se comportaron de forma indebida, según TechCrunch.

La admisión deja pendiente la pregunta central: qué obliga a una empresa a contar un caso de desalineación cuando no alcanza la definición de incidente de seguridad. OpenAI prometió responder con un marco, pero el documento todavía no tiene fecha de publicación.

Fuentes: 1, 2, 3, 4

Más de AI

Feed