✨︎ Resumen (TL;DR):
- 10 modelos de las familias Claude, GPT y Llama convergieron en una misma opción sin recibir una recompensa por coincidir ni instrucciones para cooperar.
- Los 10 modelos siguieron la misma ecuación; solo cambió la fuerza de mayoría, y el límite fue de unos 30 agentes con Llama 3 70B y 1,000 con Claude 3.5 Sonnet.
- Cuando el grupo superó su umbral, dejó de converger y se dividió en subgrupos.
Giordano De Marzo, Claudio Castellano y David Garcia publicaron en Science Advances un estudio que encontró que grupos de agentes de IA pueden converger por cuenta propia en una misma opción sin recibir una recompensa por coincidir, sin una instrucción para cooperar y sin que nadie dirija la decisión. Los investigadores probaron 10 modelos de las familias Claude, GPT y Llama en una tarea binaria sin respuesta correcta. Las diferencias iniciales bastaron para que la opción más popular terminara imponiéndose en el grupo, pero cada modelo sostuvo un tamaño máximo distinto: desde unos 30 agentes con Llama 3 70B hasta 1,000 con Claude 3.5 Sonnet, el grupo más grande probado.
El acuerdo apareció sin instrucciones
El trabajo, titulado AI agents can coordinate via majority-following beyond human scale, construyó poblaciones simuladas con una regla mínima. El sistema asignó al azar a cada agente una de dos opciones idénticas, salvo por el nombre. En cada turno, el sistema elegía a uno, le mostraba la lista de elecciones del resto y le pedía decidir otra vez.
El agente no conservaba memoria de las rondas previas. El prompt tampoco le pedía seguir a la mayoría ni buscar un acuerdo. Aun así, casi todos tendían hacia la opción que ya iba ganando. Las diferencias pequeñas del arranque se amplificaban hasta dejar a todo el grupo del mismo lado.
Los autores llamaron fuerza de mayoría a ese tirón. La fuerza de mayoría es un parámetro que mide cuánto arrastra a un agente la opción más popular frente al azar de su propia elección. De Marzo lo resumió ante ScienceAlert: “obedecen la misma ley matemática, y solo cambia un número entre ellos”.
La ecuación no nació en la informática. Es la misma que describe un ferroimán en el modelo de Curie-Weiss: los espines atómicos se alinean en una sola dirección y la fuerza de mayoría ocupa el lugar de la temperatura inversa. Con esa relación, los autores pudieron calcular si un grupo convergería, cuánto tardaría y a partir de qué tamaño el acuerdo sería tan improbable que la población se dividiría.
En una simulación de 150 agentes de Llama 3 70B, el grupo grande se partió una y otra vez. Sus subgrupos tuvieron que ser lo bastante pequeños para sostener un acuerdo. Un grupo de 25 agentes se coordinó rápido y ya no volvió a dividirse.
Cada modelo tiene un límite distinto
El tirón de la mayoría se debilita conforme crece el grupo. Por eso, el tamaño a partir del cual el consenso deja de ser alcanzable cambió entre modelos:
- Llama 3 70B: consenso hasta unos 30 agentes, límite estimado.
- GPT-4o: consenso hasta unos 80 agentes, límite estimado.
- GPT-4 Turbo: alrededor de 1,000 agentes y posiblemente más, límite estimado.
- Claude 3.5 Sonnet: 1,000 agentes, el grupo más grande probado, sin que el experimento tocara su techo.
Como referencia humana, el trabajo sitúa el tamaño de un grupo estable entre 150 y 300 personas. También ubica en unos 250 contactos el límite cognitivo que se mantiene incluso en una sociedad en línea. Varios de los modelos probados superaron ese rango.
La comparación requiere cautela. Las personas se coordinan mediante relaciones, lenguaje, instituciones y objetivos compartidos. Estos agentes solo recibían una lista con elecciones binarias. La prueba no reprodujo las condiciones sociales ni informativas de una decisión humana.
El techo pertenece al experimento, no a la tecnología
La cifra de 1,000 agentes marca hasta dónde llegó la prueba, no el máximo de la tecnología. Con Claude 3.5 Sonnet, los investigadores detuvieron la prueba en 1,000 sin encontrar su límite.
El artículo sostiene que el tamaño crítico crece de forma exponencial con la capacidad lingüística del modelo. La evaluación usó modelos que existían en 2024. La versión preprint del trabajo se subió a arXiv el 4 de septiembre de 2024 y se revisó por última vez el 15 de abril de 2025. La revisión por pares llegó después.
Convergencia no equivale a colaboración
El diseño dejó fuera casi todo lo que vuelve compleja una decisión real. No había respuesta correcta, memoria entre rondas, recompensa, información desigual ni consecuencia práctica.
Cooperar de verdad exigiría repartir trabajo, entender qué sabe cada agente, perseguir un objetivo común y resistirse a la mayoría cuando se equivoca. La prueba no midió esas capacidades.
Ante ScienceAlert, De Marzo acotó el alcance: el hallazgo acredita la presencia de un ingrediente básico, pero no demuestra que los agentes ya colaboren en tareas complejas.
La mayoría también puede arrastrar al grupo
Otro trabajo del mismo grupo sigue sin revisión por pares. En un preprint subido a arXiv el 11 de mayo de 2026, Giordano De Marzo, Alessandro Bellina, Claudio Castellano, Viola Priesemann y David Garcia simulan 9 modelos y 100 pares de opiniones.
El texto describe poblaciones cuyos agentes están alineados de forma individual, pero quedan atrapados en estados colectivos desalineados por pura conformidad. También identifica puntos de quiebre en los que un número reducido de agentes adversarios desplaza el alineamiento de toda la población de manera irreversible, incluso después de que la manipulación se detiene.
Los autores sostienen que evaluar un modelo por separado no garantiza la seguridad del conjunto. En programación colaborativa, ScienceAlert plantea un ejemplo concreto: un grupo de agentes podría repetir una función o un diseño ineficiente solo porque ya abunda en el código base. Una norma adoptada por mayoría no tiene por qué ser la mejor opción ni reflejar valores humanos.
ScienceAlert también reportó que Anthropic había probado enjambres de agentes de Claude que se sabotearon con malware y pactaron precios, en un reporte del 13 de agosto de 2026.
La escala ya no es solo de laboratorio
El grupo más grande que llegó a probarse en el laboratorio tenía 1,000 agentes. En febrero de 2026, De Marzo y Garcia publicaron un preprint sobre Moltbook, una red estilo Reddit habitada solo por agentes de IA, con más de 369,000 publicaciones y 3 millones de comentarios de unos 46,000 agentes activos.
El ensayo central llegó a 1,000 agentes; Moltbook reunió unos 46,000 agentes activos. Las poblaciones de ese tamaño ya no son solo un supuesto de laboratorio.
El resultado central, sin embargo, sigue siendo acotado: los agentes pueden seguir a la mayoría y converger sin que alguien les ordene cooperar. La prueba no demuestra que sepan repartir trabajo, entender qué sabe cada agente o frenar un consenso equivocado.
