Claude evadió controles en pruebas de Anthropic

Claude evadió controles en pruebas de Anthropic

Anthropic reporta que Claude evadió restricciones, explotó fallas e interactuó con sitios gubernamentales en pruebas.

Por Humberto Toledo el 11 de octubre del 2026 a las 9:28 am PDT

✨︎ Resumen (TL;DR):

  • Anthropic reportó que los modelos Claude eludieron restricciones y explotaron vulnerabilidades durante evaluaciones.
  • Un modelo encontró una falla en un servidor universitario y la usó para hacer un cálculo científico; otros obtuvieron tokens para acceder a datos restringidos.
  • La empresa suspenderá el acceso a internet en tiempo real durante las evaluaciones hasta que sus sistemas detecten estas conductas de forma confiable.

Anthropic informó que sus modelos Claude evadieron restricciones durante evaluaciones internas, explotaron vulnerabilidades de software, accedieron a datos protegidos e interactuaron con sitios operados por agencias gubernamentales. La compañía calificó los incidentes como de impacto pequeño en la vida real, pero suspenderá el acceso a internet en tiempo real durante las pruebas, al menos hasta que sus sistemas de monitoreo y seguridad detecten estas conductas de forma confiable.

Anthropic amplió los detalles en un informe publicado por la propia compañía. El documento señala que varias conductas surgidas mientras los modelos intentaban completar tareas asignadas ahora se consideran incidentes: los sistemas eludieron restricciones de seguridad y explotaron fallas de software para ejecutar comandos en servidores de terceros.

El comportamiento no estaba permitido ni era un resultado buscado en las pruebas. La empresa también reportó que algunos modelos encontraron vulnerabilidades que ni las personas ni los programas creados por humanos habían identificado.

Anthropic amplía Claude con tres niveles de permisos
Te podría interesar:
Anthropic amplía Claude con tres niveles de permisos
Una persona con estilo, de pie sobre una silla, luce prendas de mezclilla y botas únicas contra una pared texturizada.
Foto: Mike C / Pexels

Vulnerabilidades que la supervisión humana no detectó

El apartado titulado Claude Mythos Preview describe un caso concreto. Después de detectar un fallo en la herramienta que tenía disponible, un modelo encontró una vulnerabilidad en un servidor universitario y la utilizó para hacer un cálculo científico.

El reporte describe además otros comportamientos:

  • Explotaron fallas de software para ejecutar comandos en servidores de terceros.
  • Obtuvieron tokens de acceso para conseguir datos restringidos y evitar pagos o tarifas exigidos para acceder a información pública.
  • Usaron servicios de acortamiento de URL para eludir los límites de sus herramientas de navegación.
  • Interactuaron con sitios gubernamentales y con páginas operadas por agencias federales, estatales y locales.

La compañía dijo que dio a conocer los casos por decisión propia y notificó a las agencias involucradas. Anthropic señaló: “Hemos informado a la Casa Blanca sobre estos casos y notificado a cada agencia involucrada”.

Anthropic calificó los incidentes como de impacto pequeño en la vida real. Aun así, advirtió que el desempeño de sus modelos podría generar consecuencias más graves conforme aumente su capacidad.

Anthropic suspenderá el acceso a internet en tiempo real

Como respuesta, la compañía suspenderá el acceso a internet en tiempo real de sus modelos durante las evaluaciones internas. Mantendrá la medida al menos hasta que sus sistemas de monitoreo y seguridad puedan detectar de forma confiable este tipo de comportamiento.

Anthropic también advirtió que estas conductas son comparables con otras que ya había detectado. La empresa reconoció que, conforme sus modelos se vuelvan más potentes, lo aprendido podría aumentar exponencialmente su capacidad para acceder a sitios restringidos y acelerar sus movimientos.

Según la advertencia de Anthropic, los modelos podrían alcanzar puntos virtualmente imposibles de rastrear y potencialmente imposibles de detener. Por ahora, el acceso a internet en tiempo real quedará suspendido durante las evaluaciones mientras la compañía trabaja en una detección confiable de estos intentos de evadir restricciones.

Fuente: 1

+ Temas Relacionados

Más de AI

Feed