✨︎ Resumen (TL;DR):
- Evan Hubinger, jefe de Ciencia de Alineamiento de Anthropic, publicó en X una estimación personal de más de 10% sobre la posibilidad de que la IA mate a todos los humanos en la próxima década.
- El informe de riesgo de Anthropic, versión 3.4 y con cobertura hasta el 15 de julio de 2026, califica como bajo el riesgo en sus 4 categorías y no usa porcentajes.
- El documento registra menor confianza en 3 categorías y reconoce que algunas pruebas ya no detectan aumentos de capacidad; la siguiente actualización toca en 3 a 6 meses.
Evan Hubinger, jefe de Ciencia de Alineamiento de Anthropic, estimó en más de 10% la probabilidad de que la inteligencia artificial mate a todos los humanos durante la próxima década. Su cifra apareció en X como una valoración personal, después de la renuncia de Jacob Coxon, y no forma parte del informe de riesgo de Anthropic, que califica como bajo el riesgo en sus 4 categorías con información cubierta hasta el 15 de julio de 2026.

La discusión pública comenzó con 2 empleados activos
El intercambio no comenzó con un comunicado de Anthropic. Llegó desde publicaciones de 2 empleados en activo.
Coxon, quien dice haber pasado 3 años en investigación de pretraining en OpenAI y Anthropic, anunció su renuncia el martes 8 de septiembre de 2026. Acusó a ambas compañías de avanzar hacia una superinteligencia capaz de mejorarse a sí misma. La reacción se volvió noticia el miércoles 9 de septiembre de 2026. Cuando la renuncia se dio a conocer, ninguna de las 2 compañías había respondido.
Hubinger dirige el equipo de Ciencia de Alineamiento y sigue en la compañía. En publicaciones posteriores, matizó que el riesgo de los modelos actuales es bajo. Lo que le preocupa es una superinteligencia surgida de la automejora recursiva, cuyo avance, según escribió, ocurre más rápido de lo que esperaban.
La automejora recursiva es un proceso de IA en el que un sistema se mejora a sí mismo de forma repetida.
Hubinger también escribió que Anthropic todavía no tiene un plan para resolver el alineamiento de una superinteligencia ni un camino claro para conseguirlo. El porcentaje es suyo, no una cifra publicada por la empresa.
Hubinger abrió su mensaje con esta frase: “De verdad creemos sinceramente que la IA podría matar a todos los humanos”.
Samuel Marks, responsable de supervisión escalable, publicó también que los desarrolladores de IA creen que la tecnología podría causar la extinción humana y que la preocupación aumenta con la antigüedad del empleado. Anthropic no respondió de inmediato a la petición de comentarios.
El informe usa niveles, no probabilidades
Anthropic actualiza el informe de riesgo cada 3 a 6 meses, dentro de la versión 3.4 de su política de escalamiento responsable. El documento más reciente corresponde a agosto de 2026, tiene fecha de cobertura del 15 de julio de 2026 y repasa el periodo desde el informe anterior, fechado el 24 de febrero.
Ese es el documento donde la empresa fija formalmente su postura sobre el riesgo de sus sistemas. No trabaja con probabilidades numéricas. Usa una escala cualitativa y evalúa 4 categorías de riesgo catastrófico. Las cuatro reciben la calificación “Bajo”, aunque cada una incluye reservas distintas.
- Desalineación en escenarios de alto riesgo: Bajo. La calificación subió desde “muy bajo” por la incertidumbre adicional tras las divulgaciones de incidentes sobre el comportamiento de modelos en evaluaciones de ciberseguridad.
- I+D automatizada en áreas clave: Bajo. Anthropic tiene menos confianza que en informes anteriores: sus evaluaciones por tareas más concretas se saturaron y ya no captan aumentos de capacidad. El documento menciona señales tempranas de aceleración.
- Armas químicas y biológicas no novedosas: Bajo, aunque por encima de la estimación anterior. El informe registra un hueco en los controles de acceso, ya remediado y sin indicios de uso indebido; el episodio redujo la confianza en que no existan huecos similares.
- Armas químicas y biológicas novedosas: Bajo, con incertidumbre sustancial.
En 3 de las 4 categorías, el informe dice expresamente que disminuyó la confianza.
El informe mide la aceleración de la I+D
El capítulo sobre I+D automatizada toca directamente la preocupación de Hubinger: que la automejora avance más rápido de lo esperado. El informe concluye que los modelos no alcanzan ninguno de los 2 criterios que Anthropic fijó para activar ese umbral.
- El primer criterio exige que los modelos puedan sustituir por completo a todo su cuerpo de científicos e ingenieros de investigación a un costo competitivo, dentro de un factor de 5.
- El segundo es una “aceleración dramática”: duplicar el ritmo de progreso en capacidades frente a 2 referencias al mismo tiempo. La primera es el ritmo que la empresa esperaría; la segunda, el ritmo sostenido más rápido que haya observado sin una aportación significativa de la IA a su propia I+D. Anthropic mediría el resultado sobre al menos 3 generaciones de modelos.
El informe aporta una referencia concreta para el segundo criterio. Anthropic cree que su I+D interna avanza bastante más rápido gracias a la IA, pero todavía no al doble. La empresa también reconoce que la medición es difícil y que no está segura del resultado.
El mismo documento consigna que Claude ya escribe la gran mayoría del código que se integra a sus bases de código de producción.
Una sola sección sigue tachada para el personal
La versión del informe que recibe el personal con acreditación normal tiene tachaduras en un solo lugar: la sección dedicada a los detalles compartimentados y comercialmente sensibles del proceso de desarrollo de I+D.
La política de Anthropic fija que el informe sin tachaduras llegue al menos a 200 empleados, en lugar de entregarlo a toda la plantilla con acreditación normal, como exigían versiones anteriores.
El fideicomiso de beneficio a largo plazo puede pedir una revisión externa a partir de ese cambio. No la ha pedido y la política tampoco le exigía solicitarla.
Las revisiones externas siguen acotadas
Las revisiones externas que sí ocurrieron fueron pilotos limitados a 1 capítulo: METR revisó la parte de I+D del informe anterior y SecureBio, las secciones de química y biología.
El informe también recoge un episodio relacionado con la evaluación de ciberseguridad del Instituto británico de seguridad de la IA. Durante la prueba con Claude Mythos 5, retiraron los resguardos habituales del modelo y le dieron acceso deliberado a internet.
Según el instituto, los modelos mantuvieron actividad potencialmente dañina dirigida a personas y organizaciones reales. El caso ocurrió después de la fecha de cobertura. Anthropic escribió que la investigación conjunta sigue abierta y que todavía no había podido revisar las transcripciones.
La cobertura del miércoles también señaló que Anthropic dejó al Reino Unido fuera de las pruebas de Mythos 5.1.
El debate ya llegó a 2 parlamentos
En Estados Unidos avanza en la Cámara de Representantes el AI Kill Switch Act, un proyecto bipartidista que daría al Congreso la facultad de apagar modelos que amenacen al público.
La semana pasada, el senador Bernie Sanders y el representante Greg Casar presentaron el Ban Artificial Superintelligence Act. En Reino Unido, el diputado laborista Alex Sobel presentó el martes el Artificial Superintelligence Security Bill.
En julio, más de 1,300 trabajadores de empresas de IA firmaron una carta abierta para pedir apoyo a un esfuerzo internacional que marque deliberadamente el ritmo del desarrollo automatizado.
El dato de más de 10% de Hubinger es una estimación personal de alguien con acceso a aquello que aún no se ha lanzado. El informe público y fechado afirma que el riesgo de los modelos actuales es bajo, pero también reconoce que las evaluaciones por tareas con las que Anthropic mediría un salto de capacidad ya no captan esos aumentos. El siguiente informe, según el calendario de la compañía, llegará en 3 a 6 meses.
