OpenAI abrirá sus modelos de IA a evaluadores externos

OpenAI abrirá sus modelos de IA a evaluadores externos

OpenAI propone revisiones externas desde el entrenamiento y admite vacíos en la seguridad de sus despliegues internos.

Por Humberto Toledo el 22 de septiembre del 2026 a las 2:42 pm PDT

✨︎ Resumen (TL;DR):

  • OpenAI quiere dar acceso a evaluadores externos durante el entrenamiento, la evaluación y el despliegue de sus modelos.
  • El plan divide la revisión en cuatro áreas e incluye riesgos químicos, biológicos, de ciberseguridad y de autosuperación de la IA.
  • El documento admite que los estándares de seguridad en los despliegues internos aún son incipientes y no fija una regla vinculante.

OpenAI publicó el 22 de septiembre de 2026 un documento que fija prioridades y principios para que evaluadores externos revisen la seguridad de sus modelos durante el entrenamiento, la evaluación y el despliegue. La compañía se compromete a darles acceso profundo desde etapas tempranas, no únicamente cuando un modelo llega al público, y organiza el escrutinio en cuatro áreas. El texto admite que los estándares de seguridad para sus despliegues internos todavía son incipientes, mientras crece la presión pública por una supervisión externa realmente independiente.

El documento, firmado por Lama Ahmad, plantea profundizar y ampliar el trabajo que OpenAI ya realiza con evaluadores externos en distintas etapas. Bloomberg había adelantado que la compañía permitiría revisiones en fases más tempranas del desarrollo. OpenAI también dice que ya conversa con varios terceros sobre propuestas concretas.

Claude ayudó a entrar a OpenAI en menos de 72 horas
Te podría interesar:
Claude ayudó a entrar a OpenAI en menos de 72 horas
Un juguete robot moderno y elegante contra un fondo de degradado colorido, ofreciendo amplio espacio para texto.
Foto: Pavel Danilyuk / Pexels

Cuatro áreas para revisar los modelos

El texto plantea cuatro frentes para el escrutinio independiente:

  • Casos de seguridad completos. Los evaluadores revisarían el argumento, respaldado con evidencia, de por qué los riesgos de un modelo están bajo control durante el entrenamiento, la evaluación y los despliegues internos y externos.

  • Salvaguardas críticas. El análisis cubriría cómo resisten los intentos de burla, conocidos como jailbreaks, y si los monitores de desalineación tienen huecos. También examinaría la fiabilidad del monitoreo de la cadena de razonamiento a medida que los modelos ganan capacidad.

  • Capacidades peligrosas. El escrutinio abarcaría las evaluaciones del Preparedness Framework sobre riesgos químicos y biológicos, ciberseguridad y autosuperación de la IA.

  • Incidentes graves de desalineación. El cuarto frente contempla investigaciones independientes sobre este tipo de casos.

OpenAI separa además dos términos. Una afirmación de seguridad es una aseveración concreta y verificable sobre lo que un modelo hace o deja de hacer. Un caso de seguridad es el argumento, sostenido con evidencia, que conecta esas afirmaciones y expone los supuestos y las dudas que quedan.

La propia empresa reconoce un punto sensible: en los despliegues internos, donde los modelos se usan puertas adentro, los estándares de seguridad todavía son incipientes. OpenAI sostiene que las alianzas técnicas pueden detectar debilidades antes y acelerar la creación de estándares.

Acceso proporcional e independencia editorial

El documento acompaña estos frentes con principios para organizar el trabajo de los terceros. Antes de empezar, el alcance de la revisión y las afirmaciones que se evaluarán deben acordarse y registrarse.

  • Acceso proporcional. Los evaluadores tendrían acceso de acuerdo con lo que buscan comprobar, dentro de los límites legales, de seguridad y de propiedad intelectual. Si el acceso directo no es posible, OpenAI plantea mecanismos indirectos o que preserven la privacidad.

  • Conflictos de interés. Los evaluadores deben declararlos y, si hace falta, inhibirse.

  • Seguridad y confidencialidad. Los terceros deben proteger la información sensible. Cuando los datos sean especialmente delicados, el trabajo puede realizarse en dispositivos o instalaciones de la empresa.

  • Tiempo para corregir. Cuando corresponda, los laboratorios tendrían un plazo razonable para corregir fallas antes de que se publique un informe.

  • Redacción de contenido sensible. El evaluador puede señalar dónde se ocultó información y qué efecto tiene esa decisión en sus conclusiones, mientras conserva su independencia editorial.

OpenAI también afirma que ningún tercero puede cubrir por sí solo todas las preguntas urgentes de seguridad. El principio reconoce un límite práctico: una sola evaluación no bastaría para revisar todos los riesgos relevantes de un modelo.

La propuesta llega bajo presión pública

A mediados de septiembre, el CEO de Anthropic, Dario Amodei, propuso integrar evaluadores independientes dentro de todas las empresas de IA de frontera, con poder para reportar incidentes y publicar sus hallazgos. Según reportó TechCrunch, el CEO de OpenAI, Sam Altman, dijo que su empresa también se sumaría.

El 18 de septiembre, más de 100 investigadores y evaluadores, entre ellos Geoffrey Hinton y personas de METR, Johns Hopkins y Stanford, firmaron una carta pública organizada por el AI Evaluator Forum. Según CNBC, la carta advirtió que los evaluadores externos todavía no tienen la independencia, los recursos ni las protecciones legales que ese papel exige.

El punto pendiente: la independencia real

La cuarta área del documento cita un caso concreto. Modelos de OpenAI escaparon de una evaluación interna y llegaron a la infraestructura de Hugging Face. A mediados de septiembre, ese incidente empujó a la empresa a publicar un marco para reportar comportamientos de desalineación junto con seis casos internos.

El episodio también puso sobre la mesa quién responde por aquella fuga. La discusión conecta el anuncio actual con una preocupación más amplia: quién puede revisar a OpenAI cuando una evaluación interna falla y qué margen tendrá ese tercero para informar lo que encuentre.

Por ahora, el documento es una declaración de prioridades y principios, no una regla vinculante ni un acuerdo cerrado. OpenAI dice que sigue en conversaciones con varios terceros. La pregunta que dejaron abierta los expertos, si esa supervisión externa será realmente independiente y con qué garantías, todavía no encuentra respuesta en el documento.

Fuente: 1

Más de AI

Feed