Claude ya “lidera” el 26% de la I+D de Anthropic

Claude ya “lidera” el 26% de la I+D de Anthropic

Anthropic reporta que Claude “lidera” el 26% de su I+D, con 30,000 agentes y 6% del cómputo para seguridad.

Por Humberto Toledo el 17 de septiembre del 2026 a las 9:49 pm PDT

✨︎ Resumen (TL;DR):

  • Anthropic reporta que Claude “lidera” el 26% del trabajo de I+D medido, frente a menos del 1% en febrero de 2026; ningún subconjunto medido opera de forma totalmente autónoma.
  • El índice usa cerca de 15,000 tareas, una muestra del 20% del personal de cada área y un árbol de 542 nodos.
  • En agosto de 2026 había alrededor de 30,000 agentes; del 13 al 20 de julio, cerca de 6% del cómputo de I+D en IA se destinó a seguridad.

Anthropic publicó tres métricas para que el público vigile desde afuera el avance de la IA dentro de los laboratorios de frontera. La compañía reportó que Claude ya “lidera” el 26% del trabajo de I+D con el que construye sus próximos sistemas, frente a menos del 1% en febrero de 2026.

Más del 90% de la I+D revisada ya estaba en “colabora” o por encima. En agosto de 2026, unos 30,000 agentes trabajaban en la plataforma interna más usada de Anthropic.

En la semana del 13 al 20 de julio de 2026, cerca de 6% del cómputo de I+D en IA se destinó a seguridad.

Anthropic lanza Claude para asesores financieros
Te podría interesar:
Anthropic lanza Claude para asesores financieros
Una figura solitaria de pie en un campo rural brumoso con la luz del amanecer proyectando tonos cálidos.
Foto: icecloudxx / Pexels

Qué significa “liderar” para Anthropic

Para Anthropic, “liderar” significa completar la mayor parte de una tarea de principio a fin a partir de una instrucción general, con un humano que supervisa. La etiqueta describe el grado de automatización de la tarea, no una operación completamente independiente.

En agosto de 2026, Claude no operaba de forma totalmente autónoma en ningún subconjunto medido. Más del 90% de la I+D revisada se ubicaba en “colabora” o por encima.

La gráfica de Anthropic sitúa el nivel “lidera” por debajo de 1% en febrero de 2026 y proyecta que podría llegar a 80% para el fin de año si la tendencia continúa. Esa cifra es una proyección, no un resultado ya observado.

Cómo calcula Anthropic la automatización

Anthropic R&D Automation Index es un prototipo de medición que cataloga cada tipo de tarea de I+D, califica su nivel de automatización y suma esas calificaciones en un solo número.

Epoch AI propone una escala de “nivel de automatización” que va de AL0 a AL5:

  • AL0: la IA no participa.
  • AL3, “colabora”: la IA realiza grandes porciones del trabajo bajo una dirección humana cercana.
  • AL4, “lidera”: la IA completa casi toda la tarea a partir de una instrucción de alto nivel, mientras el humano supervisa.
  • AL5: la IA opera de forma totalmente autónoma, sin una persona en el circuito.

Para armar el índice, un agente de Claude revisó semana a semana, durante julio de 2026, el trabajo de una muestra del 20% del personal de cada área. El agente usó Slack y documentación interna, reunió unas 15,000 tareas y después las ordenó en un árbol de 542 nodos.

Anthropic dejó esa canasta de trabajo congelada para comparar las mediciones futuras contra la misma base. Así puede seguir el nivel de automatización del trabajo que ya estaba incluido en julio de 2026.

Claude también funciona como juez

La primera limitación está en la evaluación. Claude juzga cuánto trabajo hace Claude, lo que deja abierta la posibilidad de que el modelo cometa errores parecidos a los del sistema que está evaluando.

Para contrastar el resultado, Anthropic pidió a su personal calificar la automatización de sus áreas sin mostrarle la evidencia que habían reunido los modelos. El modelo y una persona coincidieron exactamente 59% de las veces. Las personas coincidieron entre sí 35% de las veces.

Además, el modelo y el humano quedaron dentro de un nivel de diferencia en 97% de los casos. El margen real de desacuerdo aparece justo en la frontera entre “colabora” y “lidera”, donde se clasifica el 26% reportado por la compañía.

La segunda limitación es la canasta congelada. Si el porcentaje sube sobre la base de julio de 2026, eso indica que la IA está automatizando trabajo que entonces hacían las personas. Por sí solo, el dato no muestra si aparecieron tareas nuevas a las que el personal se cambió.

Anthropic comparó una versión de enero con otra de julio y no encontró un aumento de tareas “novedosas”. Aun así, planea reconstruir la canasta cada cierto tiempo. Sin una metodología común, la compañía reconoce que hoy no puede comparar directamente su cifra con la de otro laboratorio.

30,000 agentes bajo dos tipos de monitor

La segunda medición observa la supervisión. Anthropic reportó que en agosto de 2026 había alrededor de 30,000 agentes haciendo trabajo de investigación e ingeniería al mismo tiempo en su plataforma interna más usada. La empresa aclara que esas cifras cubren únicamente esa plataforma.

Los agentes pasan por dos tipos de monitores:

  • Monitores en línea: revisan cada acción en tiempo real y bloquean o corrigen las peligrosas antes de que ocurran. El 100% de las acciones pasa por este monitor antes de ejecutarse, casi siempre en segundos. La revisión ocurre automáticamente antes de actuar y una persona revisa las acciones bloqueadas en menos de una semana. La tasa de bloqueo o marcado fue de 0.002%, cerca de 1 de cada 47,000 decisiones.
  • Monitores fuera de línea: leen la actividad después de que ocurre para detectar conductas que se desarrollan lentamente, como señales de desalineación. También ingieren el 100% de las acciones después de que se toman. Marcan unas 100,000 transcripciones por semana; un humano revisa las de mayor prioridad, cerca de 50. Entre 1 y 2 de cada 1,000 transcripciones se marcan para una revisión adicional.

Anthropic obtuvo esas cifras tras analizar más de 1,000 millones de decisiones de sus agentes durante agosto de 2026. La empresa advierte que, cuando operan millones o miles de millones de agentes, un evento raro puede volverse frecuente. Por eso sostiene que la supervisión debe crecer al mismo ritmo que el papel de la IA en la I+D.

Sólo 6% del cómputo fue a seguridad

La tercera medición sigue el cómputo. En la fotografía de la semana del 13 al 20 de julio de 2026, cerca de 6% del cómputo destinado a I+D en IA se asignó a trabajo de seguridad. Entre el cómputo de la I+D impulsada por IA, la proporción subió a alrededor de 12%.

Anthropic describe estas cifras como estimaciones deliberadamente conservadoras:

  • Si un token servía por igual para avanzar capacidades y seguridad, la empresa no lo contó como cómputo de seguridad.
  • Los clasificadores de salvaguardas quedaron fuera. Anthropic dice que consumen una cantidad de cómputo comparable por separado.

El cómputo es un termómetro imperfecto del peso de la seguridad. Ese tipo de investigación usa por naturaleza menos cómputo que un entrenamiento de frontera, y una parte importante del tiempo se va en que una persona diseñe el experimento, no en ejecutarlo.

Por eso, Anthropic plantea que una semana basta para mostrar que la medición se puede realizar, pero no para trazar una tendencia.

La apuesta por mediciones comparables

Anthropic vinculó la publicación con el llamado de su director ejecutivo, Dario Amodei, a moderar el ritmo de la frontera. Días antes, Amodei había publicado el ensayo We Must Pace the Frontier. La empresa sostiene que, si el mundo considera frenar el desarrollo, primero necesita ver qué ocurre dentro de los laboratorios.

La compañía planea integrar evaluadores externos independientes de varias organizaciones. Tendrían un acceso a procesos, sistemas y datos internos parecido al de sus equipos de riesgo para verificar prácticas, reportar incidentes y vigilar métricas como estas.

Anthropic afirma que cualquier laboratorio de frontera podría publicar las mismas mediciones con una metodología abierta. También sugiere que, más adelante, podrían servir para activar reglas más estrictas, como una ventana fija de pruebas antes de usar un modelo nuevo en más I+D o compromisos sobre cuánto cómputo se asigna a seguridad.

Por ahora, Anthropic produce y revisa sus propios números. La comparación externa sigue pendiente: no hay una metodología común y la empresa todavía no puede contrastar directamente el 26% con otro laboratorio. El valor de estas métricas dependerá de que otros laboratorios y evaluadores externos publiquen datos comparables.

Fuente: 1

+ Temas Relacionados

Más de AI

Feed