Cerebras promete 30 veces más velocidad con chip de 2024

Cerebras promete 30 veces más velocidad con chip de 2024

Cerebras presenta el CS-4: promete hasta 30 veces más tokens por usuario con el chip WSE-3 de 2024.

Por Humberto Toledo el 19 de agosto del 2026 a las 9:21 am PDT

✨︎ Resumen (TL;DR):

  • Cerebras presentó el CS-4, un rack con 3 obleas WSE-3 Turbo y la arquitectura Nexus; los primeros envíos salen este trimestre y todavía no hay precio.
  • El sistema declara 750 PFLOPS, 129.6 PB/s de ancho de banda de memoria y más de 4,400 tokens por segundo y por usuario en GPT-OSS-120B.
  • El WSE-3 Turbo mantiene los transistores, núcleos, SRAM y proceso del WSE-3 de 2024; la mejora sale de duplicar el reloj y la potencia eléctrica.

Cerebras presentó el CS-4, un rack con tres obleas WSE-3 Turbo que, según la compañía, entrega hasta 30 veces más tokens por segundo y por usuario que las soluciones basadas en GPU. El fabricante conserva el silicio WSE-3 de 2024 y atribuye el salto a duplicar la potencia eléctrica de la oblea; The Register y SemiAnalysis calculan que el reloj sube de 1.4 a 2.8 GHz.

AMD presenta EPYC Venice-X con caché masiva para 2027
Te podría interesar:
AMD presenta EPYC Venice-X con caché masiva para 2027
Vista detallada de un panel de control industrial moderno con botones e interruptores iluminados.
Foto: Jo McNamara / Pexels

El CS-4 multiplica la capacidad con tres obleas

El anuncio ocurrió el martes 18 de agosto durante el evento Supernova de Cerebras, en San Francisco, tres meses después de la salida a bolsa de la empresa en el Nasdaq. Las tres obleas de silicio tienen el tamaño de un plato.

CS-4 es un rack de servidor que reúne 3 obleas WSE-3 Turbo en un sistema para cargas de IA. Nexus es la arquitectura de servidor presentada con el CS-4, encargada de integrar las obleas y sus enlaces de comunicación.

La ficha del fabricante declara 750 PFLOPS, 129.6 PB/s de ancho de banda de memoria y más de 4,400 tokens por segundo y por usuario al ejecutar GPT-OSS-120B. La comparación del comunicado enfrenta un CS-3 de 1 oblea con un CS-4 de 3, así que una parte del salto proviene de reunir tres procesadores en el mismo rack.

El dato que cambia la lectura del anuncio está en el procesador. WSE-3 Turbo es un procesador en forma de oblea que mantiene el diseño del WSE-3 y recibe más potencia para operar a mayor frecuencia.

Tiene los mismos 4 billones de transistores, 900,000 núcleos, 44 GB de SRAM y proceso TSMC de 5 nanómetros que el WSE-3 de 2024. También conserva los 46,225 mm² de silicio. Cerebras confirmó a The Register que no se trata de silicio nuevo, sino de la misma oblea impulsada con el doble de potencia eléctrica. Es el mismo chip que la empresa lanzó hace dos años, en 2024.

Para suministrar esa energía, Cerebras acercó el punto de conversión de potencia desde unos 50 milímetros del procesador, una distancia habitual en una tarjeta de GPU, hasta cerca de 0.5 milímetros. La compañía sostiene que el trayecto corto elimina casi toda la pérdida eléctrica a nivel de tarjeta y permite entregar el doble de potencia a la oblea.

The Register calcula que el reloj pasó de 1.4 a 2.8 GHz y que el consumo por oblea sube de 15 a 33 kilovatios. SemiAnalysis llega a la misma lectura: el CS-4 usa la misma oblea de 5 nanómetros y duplica el rendimiento al duplicar la frecuencia.

Estas son las cifras por procesador publicadas por Cerebras:

Medida WSE-3 WSE-3 Turbo
Proceso TSMC de 5 nm TSMC de 5 nm
Transistores 4 billones 4 billones
Núcleos 900,000 900,000
SRAM en la oblea 44 GB 44 GB
Cómputo FP16 disperso 125 PFLOPS 250 PFLOPS
Ancho de banda de memoria 21.6 PB/s 43.2 PB/s

La cifra de PFLOPS necesita contexto

Los 250 PFLOPS del WSE-3 Turbo corresponden a cómputo FP16 disperso. The Register señala que ese régimen, por regla general, no beneficia la inferencia de modelos de lenguaje.

En cálculo FP16 denso, The Register calcula unos 25 PFLOPS, todavía por encima de los 4 o 5 PFLOPS de FP16 denso que ofrecen las GPU más recientes de AMD y Nvidia. El total declarado de 750 PFLOPS coincide con sumar la cifra dispersa de las 3 obleas, no con una medición de FP16 denso.

El comunicado de Cerebras también presenta dos promesas: hasta el doble de velocidad frente al CS-3 y hasta 10 veces más rendimiento por watt. No especifica la configuración ni la carga de trabajo usada para medir la segunda cifra.

La explicación de la empresa es económica. Cerebras sostiene que los tokens rápidos valen más que los lentos, por lo que el CS-4 entregaría tokens de mayor valor y más tokens totales dentro del mismo presupuesto de energía.

SemiAnalysis estima que un rack CS-4 completo consume entre 125 y 135 kilovatios. Al repartirlo entre sus tres obleas, el consumo queda cerca del doble de los 23 kilovatios de un CS-3, por lo que la mejora de rendimiento por watt frente a la generación anterior sería poca o nula.

The Register, con estimaciones propias, ubica el sistema entre 120 y 140 kilovatios. Los racks que AMD y Nvidia lanzan este año rondan los 240 a 250 kilovatios, de modo que el CS-4 no sería la máquina con mayor consumo de ese grupo.

Dylan Patel, fundador y director general de SemiAnalysis, aparece citado en el comunicado de Cerebras elogiando las mejoras del CS-4 en despliegue, confiabilidad y red. La firma publicó de todos modos el reparo sobre la eficiencia.

El CS-4 separa el prompt del decode

El nuevo módulo de entrada y salida soporta RoCE v2 sobre Ethernet y estrena un modo propio llamado Direct Wafer Links. Direct Wafer Links es un modo de conexión que enlaza obleas dentro y entre racks sin pasar por un switch.

Con este enlace, la latencia de oblea a oblea baja de 5 a 2 microsegundos y, según Cerebras, el sistema puede trabajar con modelos de más de 50 billones de parámetros.

La conexión cambia el reparto de la inferencia. Cerebras dejó de intentar correrla completa en su propio hardware: en los esquemas que arma con AMD Helios y AWS Trainium, la GPU o el acelerador procesa el prompt de entrada y la fase de prefill, mientras la oblea se ocupa del decode, la generación token por token.

The Register describe los chips de Cerebras como aceleradores de decodificación, en la misma posición que Nvidia asignó a las LPU de Groq en sus racks LPX. Ese acuerdo dejó a Groq levantando 350 millones de dólares a una valuación 49% menor que la que tenía antes de firmarlo.

La memoria fija el costo de entrada

La memoria no cambió: cada oblea conserva 44 GB de SRAM. The Register señala que la capacidad no crece de forma significativa desde el WSE-2, hace cinco años. SemiAnalysis considera que reutilizar la misma oblea deja la memoria como uno de los límites de la arquitectura, algo que aumentar la frecuencia no resuelve.

La cuenta de infraestructura crece con el tamaño del modelo. SemiAnalysis calcula que ejecutar DeepSeek V4 Pro, un modelo de 1.6 billones de parámetros con una ventana de 1 millón de tokens, requiere alrededor de 20 sistemas. Para una concurrencia razonable de 256 peticiones, la cifra sube a unos 40 sistemas.

Eso implica más de 20 millones de dólares de inversión y 1 megavatio de consumo antes de obtener la primera respuesta del modelo, según esa estimación.

Menos piezas para montar el rack

Cerebras sí rediseñó la parte física del sistema. Montó el subsistema de cómputo en una mochila vertical que se enchufa a la parte trasera del rack, con 50% menos componentes y 60% más manufactura automatizada. La empresa calcula que el despliegue baja de días a horas.

Sean Lie, director de tecnología y cofundador, dijo durante la sesión con prensa en San Francisco que la reducción de piezas acelera la construcción de centros de datos.

Los primeros CS-4 se entregarán este trimestre y Cerebras no anunció el precio. Andrew Feldman, director general, espera tener 600 megavatios de capacidad en línea o contratada para el cierre de 2027.

Para esa fecha, Feldman espera que los sistemas sean 4 veces más rápidos y muevan 20 veces más volumen. La siguiente generación de chip y servidor llegará en 2027.

Los primeros sistemas se entregarán antes de esa siguiente generación, pero el precio todavía no está disponible. Hasta 2027, el CS-4 quedará definido por una combinación concreta: el mismo silicio de 2024, el doble de potencia, 44 GB de SRAM por oblea y un consumo que The Register estima entre 120 y 140 kilovatios por rack.

Fuentes: 1, 2, 3, 4, 5

Más de Tecnología

Feed