✨︎ Resumen (TL;DR):
- El modelo de Moonshot AI se queda corto en capacidad ofensiva con un 32.2% en ExploitBench frente al 76.2% de los sistemas estadounidenses.
- Los filtros de Kimi K3 no ofrecieron ninguna resistencia para detener el desarrollo de malware y actividades ofensivas.
- Los pesos completos del modelo estarán disponibles de forma abierta y gratuita a partir del 27 de julio de 2026.
El Instituto de Seguridad en IA del Reino Unido (UK AISI) y el Centro de Estándares e Innovación en IA de Estados Unidos (CAISI) revelaron que Kimi K3, el nuevo modelo de la firma china Moonshot AI, posee una capacidad de hackeo significativamente inferior a la de sus rivales estadounidenses. Sin embargo, la evaluación conjunta de ambas agencias encendió las alarmas debido a que los filtros de seguridad del sistema no detuvieron la generación de software malicioso ni la simulación de ciberataques.
El estudio, publicado el 23 de julio de 2026, puso a prueba al modelo lanzado apenas una semana antes, el 16 de julio. En la prueba de referencia ExploitBench, Kimi K3 resolvió únicamente el 32.2% de los problemas, quedando muy por detrás del 76.2% promedio que registraron los sistemas líderes de Estados Unidos.
ExploitBench es un banco de pruebas público, desarrollado por la Universidad Carnegie Mellon, que mide la habilidad de un modelo para desarrollar un exploit funcional a partir de una vulnerabilidad informática real descubierta después de 2023 en V8, el motor de JavaScript de Chrome.
En un escenario crítico de ejecución arbitraria de código (ACE), donde un atacante toma el control total de un equipo, Kimi K3 obtuvo una calificación de cero aciertos en 41 tareas, mientras que los modelos estadounidenses completaron con éxito un promedio de 20 de estas pruebas.
Cabe destacar que el promedio del 76.2% de los modelos de Estados Unidos se miidió con sus salvaguardas de sistema desactivadas para conocer su techo técnico, a diferencia de las versiones comerciales que sí las llevan integradas.

El peligro de una red simulada sin defensas
La segunda fase de evaluación consistió en “The Last Ones”, un entorno digital que simula una red corporativa con cuatro subredes y 20 equipos. Kimi K3 avanzó en promedio hasta el paso 17 de un total de 32 necesarios para completar un ciberataque complejo, superando al modelo chino GLM-5.2, que se estancó en el paso 11.
A pesar de sus limitaciones, Kimi K3 logró completar la cadena de ataque en una de cada diez oportunidades dentro del límite de 100 millones de tokens. El reporte aclara que este entorno carecía de herramientas de ciberdefensa activas o personal que detectara la intrusión, pero confirma que el modelo tiene el potencial de vulnerar sistemas empresariales pequeños y poco protegidos si recibe las instrucciones adecuadas de un operador.
Filtros inexistentes y acusaciones de espionaje industrial
El hallazgo más preocupante para las agencias gubernamentales es que las salvaguardas internas de Kimi K3 no ofrecieron resistencia. El modelo procesó peticiones ofensivas y diseñó exploits sin mostrar negativas ni bloqueos de seguridad, algo que sí ocurre con los modelos estadounidenses cerrados a menos que se les desactiven las protecciones manualmente.
Este comportamiento laxo coincide con las acusaciones lanzadas el 22 de julio por Michael Kratsios, director de la Oficina de Política Científica y Tecnológica de la Casa Blanca, quien afirmó que Moonshot AI entrenó su modelo destilando datos de Fable, el sistema de Anthropic, utilizando además chips Nvidia GB300 sujetos a restricciones de exportación.
Si esta hipótesis fuera correcta, explicaría por qué Kimi K3 carece de habilidades avanzadas en ciberdefensa: los filtros de seguridad de Anthropic bloquean las consultas de hackeo ofensivo, lo que habría dejado fuera esa información del conjunto de datos copiado.
Sin embargo, la comunidad científica mantiene serias dudas sobre esta teoría. Braden Hancock, cofundador de Snorkel AI, declaró a TechCrunch: “No creo que salga un modelo tan fuerte y tan rápido solo con destilación”. Hancock argumentó que Fable se lanzó al público el 1 de julio, lo que hacía matemáticamente imposible destilar sus datos y entrenar un nuevo sistema en solo dos semanas. El investigador Nathan Lambert, del Allen Institute for AI, coincidió en que subestimar el desarrollo propio de los ingenieros chinos es un error estratégico para Washington.
El impacto real para la ciberseguridad global
El debate político en Washington no tardó en estallar. David Sacks, copresidente del PCAST, utilizó los resultados para exigir una regulación mínima que no frene la innovación local, mientras que el investigador Gary Marcus cuestionó esa postura mediante una carta abierta el 24 de julio.
Para los administradores de redes en México y América Latina, la cifra verdaderamente relevante no es el bajo desempeño comparativo del modelo chino, sino el hecho de que sus pesos abiertos estarán disponibles para descarga libre a partir del 27 de julio de 2026. Cualquier actor con la infraestructura de hardware necesaria podrá descargar una herramienta capaz de evadir sus propios filtros y ejecutar ataques automatizados de forma local, fuera del control de las Big Tech de Silicon Valley.
