✨︎ Resumen (TL;DR):
- Ocho exempleados de OpenAI, Anthropic y Google DeepMind explicaron sus renuncias en una entrevista publicada el 5 de octubre.
- OpenAI publicó el 22 de septiembre sus prioridades para evaluaciones de terceros; Anthropic exige revisiones bajo su Responsible Scaling Policy 3.4, vigente desde el 8 de julio.
- AVERI declara que no acepta donaciones ni compensaciones monetarias de los laboratorios de IA de frontera o de sus ejecutivos, mientras Anthropic separa la evaluación externa de la autorización interna.
Ocho exempleados de OpenAI, Anthropic y Google DeepMind explicaron sus renuncias en una entrevista publicada el 5 de octubre por New York Magazine y Asterisk. La supervisión externa de la IA forma parte del debate, mientras los documentos públicos de OpenAI y Anthropic permiten comparar qué información reciben los evaluadores y quién autoriza un despliegue.
Daniel Kokotajlo, uno de los ocho exempleados, lo planteó así: “Realmente no creo que se pueda confiar en que las empresas se regulen solas”, dijo Kokotajlo a New York Magazine.
Jacob Coxon había anunciado su salida de Anthropic el 8 de septiembre, con críticas a la carrera por construir sistemas capaces de mejorarse a sí mismos. Los documentos públicos permiten comparar el alcance de las revisiones externas: qué información recibe el evaluador, qué objeciones puede publicar y quién autoriza un despliegue.

La independencia también alcanza al auditor
AVERI, dirigida por el exempleado de OpenAI Miles Brundage, realiza auditorías piloto y desarrolla estándares para evaluar la seguridad de los laboratorios. Su objetivo es verificar afirmaciones de las empresas mediante acceso a información que normalmente no es pública. Entre sus pilotos contempla comprobar si las compañías cumplen sus propios marcos de seguridad.
Los vínculos con esas empresas también forman parte de la revisión. AVERI declara que no acepta donaciones ni compensaciones monetarias de los laboratorios de IA de frontera o de sus ejecutivos, aunque sí ha recibido créditos para utilizar servicios de varias compañías. La organización publica posibles conflictos de interés y contempla apartar a personas de determinados proyectos.
Una regla afecta al propio Brundage. Según AVERI, no puede auditar directamente OpenAI hasta que hayan pasado dos años desde su salida, en octubre de 2024. Puede facilitar una auditoría dirigida por otros, siempre que su participación quede documentada.
Qué acceso prometen OpenAI y Anthropic
OpenAI publicó el 22 de septiembre sus prioridades para las evaluaciones de terceros. Propone revisar la evidencia que sostiene sus argumentos de seguridad, probar las salvaguardas y examinar incidentes en los que un sistema actúa sin autorización o elude la supervisión.
El documento pide declarar conflictos de interés y conservar la independencia editorial. A la vez, establece un alcance acordado con el laboratorio y acceso sujeto a límites legales, de seguridad y propiedad intelectual. OpenAI describe este trabajo principalmente como evaluaciones prolongadas, independientes del calendario de lanzamiento, aunque otras revisiones pueden informar decisiones de despliegue.
Anthropic exige revisiones externas completas en su Responsible Scaling Policy 3.4, vigente desde el 8 de julio. La exigencia aplica como mínimo cuando un informe cubre modelos que superan su umbral de investigación automatizada de IA y la versión pública omite datos que impiden valorar el riesgo.
La empresa selecciona revisores con aprobación de su Long-Term Benefit Trust, un órgano de su gobernanza que también puede solicitar revisiones. Las condiciones incluyen experiencia técnica y ausencia de intereses financieros en Anthropic. Los revisores pueden publicar desacuerdos, sujetos a obligaciones de confidencialidad.
La aprobación de decisiones relevantes de desarrollo o despliegue corresponde a un cargo interno, el Responsible Scaling Officer. La evaluación externa y la autorización empresarial tienen responsables distintos.
Los informes y las respuestas a sus hallazgos permiten examinar qué se evaluó, qué objeciones quedaron registradas y qué medidas adoptó el laboratorio. Esos resultados permiten valorar el efecto de la supervisión más allá de la existencia de una revisión externa. El alcance queda en esos documentos: ahí se ve qué pudo conocer el evaluador y qué hizo el laboratorio con los hallazgos.
