✨︎ Resumen (TL;DR):
- La alianza técnica entre AMD y Cerebras Systems separa el prefill del decode para optimizar la velocidad y la eficiencia de la inferencia de IA.
- Un modelado teórico de julio de 2026 promete multiplicar por cinco la eficiencia de procesamiento, aunque no existen bancos de pruebas externos.
- La arquitectura conjunta llegará primero a la plataforma en la nube Cerebras Cloud durante el segundo semestre de 2026.
AMD y Cerebras Systems presentaron una alianza técnica para dividir el trabajo de inferencia de inteligencia artificial entre los racks AMD Helios y el chip gigante Wafer-Scale Engine. Esta arquitectura busca optimizar el procesamiento de los modelos de lenguaje y llegará primero a Cerebras Cloud durante el segundo semestre de 2026.
Inferencia desagregada es una técnica de cómputo que separa el procesamiento del prompt de la generación de tokens para ejecutarlos en diferentes chips especializados.

El reparto técnico entre Helios y la oblea
Durante el evento Advancing AI 2026 en San Francisco, ambas firmas detallaron el funcionamiento de la propuesta. El sistema de rack AMD Helios, que integra procesadores EPYC y aceleradores Instinct de la serie MI400, se encargará de procesar el prompt y las ventanas de contexto largas, una fase conocida como prefill.
Por su parte, el procesador Wafer-Scale Engine (WSE) de Cerebras, famoso por ocupar una oblea de silicio completa, tomará el control en la etapa de decode. En este punto, donde el ancho de banda de la memoria es crucial, el hardware de Cerebras se dedicará a generar los tokens de la respuesta de manera directa.
“La inferencia de IA se está convirtiendo en una de las mayores oportunidades de infraestructura dentro de la IA, y su creciente diversidad exige un enfoque más flexible”, declaró Lisa Su, presidenta y directora ejecutiva de AMD. “Junto con Cerebras, estamos extendiendo ese liderazgo hacia las aplicaciones más sensibles a la latencia y creando una plataforma potente para la IA agéntica en tiempo real”.
Andrew Feldman, CEO y cofundador de Cerebras, señaló que la demanda por esta tecnología avanza con rapidez. “La demanda de inferencia ultrarrápida está creciendo a un ritmo sin precedentes”, afirmó Feldman. “Asociarnos con AMD nos da una oportunidad increíble de llevar ese rendimiento a muchos más clientes”.
Un cálculo de laboratorio bajo la lupa
Las empresas proyectan una eficiencia de hasta 5 veces más tokens por segundo por vatio con este sistema conjunto. Sin embargo, las notas técnicas de la presentación revelan que esta cifra proviene de un modelado teórico realizado en julio de 2026 por AMD Performance Labs y Cerebras.
El cálculo utilizó como referencia el modelo Kimi 2.6 1T y comparó el rack Helios con el chip de oblea frente a una infraestructura compuesta únicamente por hardware de Cerebras. Esto significa que la ganancia aún no se mide contra procesadores de Nvidia o arquitecturas independientes de AMD en un entorno de producción real.
Movimientos estratégicos y reacción de Wall Street
Este anuncio se suma a una semana de alta actividad para AMD, que recientemente concretó una inversión de hasta 5,000 millones de dólares en Anthropic. Dicho acuerdo garantiza el suministro de hasta 2 gigavatios de capacidad de cómputo para la desarrolladora de Claude a partir del primer semestre de 2027.
“Creo que vamos a ver más desagregación de cargas de trabajo”, comentó Su en un encuentro con medios de comunicación. La ejecutiva calcula que el auge de la inteligencia artificial puede llevar el mercado global de cómputo a un valor de 2 billones de dólares para el año 2030, abarcando servidores de centros de datos, computadoras y dispositivos de borde.
Tras la presentación, las acciones de Cerebras (CBRS) registraron un repunte cercano al 5%, colocándose alrededor de los 220 dólares en la bolsa de valores. La compañía debutó en el mercado accionario en mayo con un precio de 185 dólares y ha vivido un periodo de volatilidad con picos de 386.34 dólares y caídas por debajo de los 161 dólares.
El despliegue físico de esta infraestructura comenzará en los centros de datos de Cerebras en el segundo semestre de 2026. Para los desarrolladores de América Latina y otras regiones que requieran estos servicios, la tecnología estará disponible a través de Cerebras Cloud, aunque de momento las compañías no han especificado tarifas ni esquemas de disponibilidad regionalizada.
