Vera Rubin logra 7.2 veces más tokens por MW que GB300

Vera Rubin logra 7.2 veces más tokens por MW que GB300

Vera Rubin NVL72 alcanzó hasta 7.2 veces más tokens por MW que GB300 con DeepSeek V4 Pro en AgentX.

Por Humberto Toledo el 14 de septiembre del 2026 a las 7:40 pm PDT

✨︎ Resumen (TL;DR):

  • NVIDIA Vera Rubin NVL72 alcanzó hasta 7.2 veces más tokens por segundo por MW que GB300 con SGLang.
  • La brecha máxima apareció a 150 TPS con DeepSeek V4 Pro de 1.6T parámetros; a 100 TPS fue de 2.09 veces.
  • AgentX mide el rendimiento del serving agéntico, no la calidad del modelo, y el resultado cambia con el motor, la meta de velocidad y el sistema completo.

Las primeras pruebas públicas de NVIDIA Vera Rubin NVL72 muestran hasta 7.2 veces más tokens por segundo por megavatio que GB300 NVL72 en inferencia agéntica con DeepSeek V4 Pro de 1.6T parámetros. SemiAnalysis publicó el análisis el 14 de septiembre de 2026 y ubicó la brecha máxima a 150 TPS, frente a GB300 con SGLang. La cifra importa para una fábrica de IA con potencia limitada, porque indica cuántos tokens puede servir un operador usando la misma capacidad eléctrica.

DeepSeek V4-Pro: el caché subirá hasta 12 veces
Te podría interesar:
DeepSeek V4-Pro: el caché subirá hasta 12 veces
Acercamiento a una pantalla de computadora que muestra la interfaz de ChatGPT en un entorno oscuro.
Foto: Matheus Bertelli / Pexels

La brecha cambia con la meta de TPS

SemiAnalysis compara curvas de throughput por MW para distintas metas de interactividad. El análisis usa DeepSeek V4 Pro 0813, un modelo de 1.6T parámetros que la publicación toma como referencia para modelos de entre 1T y 3T.

La diferencia entre Vera Rubin y GB300 varía según la velocidad objetivo:

  • 100 TPS: Rubin entrega aproximadamente 59.4 millones de tokens por segundo por MW. GB300 con Dynamo SGLang llega a 28.5 millones, una diferencia de 2.09 veces.
  • 150 TPS: Rubin conserva casi 37 millones de tokens por segundo por MW y aventaja aproximadamente 7.2 veces a GB300 con SGLang.
  • 170 TPS: la ventaja frente a SGLang es de 5.56 veces. Frente a GB300 con TensorRT-LLM sube a 62.9 veces, porque esa curva se acerca a su extremo medido.
  • 200 TPS: la diferencia baja a 2.72 veces frente a la configuración GB300 más fuerte en ese punto.

SemiAnalysis interpola las cifras entre puntos medidos para colocar los motores en la misma meta de velocidad. Por eso, el 7.2x no representa una proporción universal entre Rubin y todo Blackwell. El rival específico de esta comparación es GB300, la plataforma Blackwell Ultra, no una categoría genérica llamada Blackwell.

AgentX mide la capacidad del serving

AgentX es un benchmark de inferencia que reproduce tráfico de aplicaciones agénticas con conversaciones de muchos turnos y contextos largos; también incorpora reutilización de prefijos y ráfagas de subagentes.

Su metodología parte de sesiones de Claude Code aportadas de forma voluntaria. El sistema elimina prompts, código y argumentos de herramientas, pero conserva la longitud de las solicitudes, la reutilización de prefijos, las ramas de subagentes y los tiempos. Después reconstruye las sesiones con tokens sintéticos y deterministas.

La versión 1.0 del conjunto de datos reúne 393 sesiones. La mediana es de 142,000 tokens de entrada y 444 tokens de salida por solicitud; 44% de las sesiones incluyen subagentes. InferenceX advierte que las cargas sintéticas miden el rendimiento del sistema de serving, pero no permiten evaluar la calidad de las respuestas del modelo.

La cifra de 7.2 veces más tokens por MW describe la capacidad de una configuración completa para atender un patrón agéntico concreto. No significa que DeepSeek genere respuestas 7.2 veces más rápido en cualquier aplicación, ni que Rubin tenga la misma ventaja durante el entrenamiento o en operaciones de inferencia por lotes.

Tampoco equivale a la latencia completa de una solicitud. SemiAnalysis define la interactividad P90 como el inverso de la latencia entre tokens de una respuesta completa en el percentil 90. SemiAnalysis evalúa por separado el tiempo hasta el primer token y la latencia de extremo a extremo.

En esta comparación, Rubin alcanza un máximo P90 de 276.24 TPS, frente a 171.53 TPS de GB300 con TensorRT-LLM. GB300 con SGLang obtiene una interactividad similar. El motor de serving cambia de forma material el resultado.

El resultado depende del sistema completo

Vera Rubin integra la GPU Rubin con la CPU Vera, el switch NVLink 6, ConnectX-9, BlueField-4 y Spectrum-6. El diseño suma la capa de serving y mecanismos para gestionar la potencia.

NVIDIA describe el NVL72 como un sistema de 72 GPUs Rubin y 36 CPUs Vera, conectados por una red NVLink 6 dentro del rack.

La métrica incorpora más que el silicio de la GPU. La memoria disponible para la KV cache, el paralelismo, la comunicación entre expertos de un modelo MoE, la red y el perfil de potencia entran en la cifra final. Presentarla como una medición aislada de Rubin escondería parte de la explicación.

La página del producto de NVIDIA también publica cifras más altas, pero en condiciones distintas. Anuncia hasta 10 veces más tokens por MW que GB200 con Kimi-K2 Thinking y una configuración 32K/8K. También anuncia hasta 35 veces más throughput por MW para modelos de 1T parámetros cuando Vera Rubin se combina con racks Groq 3 LPX.

La página separa mediciones de proyecciones y advierte que el rendimiento de inferencia puede cambiar. Esas cifras no validan directamente el 7.2x de SemiAnalysis, porque cambian el modelo, el contexto, el rival, el rack y el objetivo de prueba.

El modelo económico da 42% más ganancia

El resumen de SemiAnalysis habla de más de dos veces la ganancia por gigavatio, pero el escenario económico detallado muestra una brecha menor.

El escenario fija una meta de 75 TPS, una utilización de 60% y ningún costo de licencia del modelo. También considera el costo total de 1 GW de capacidad eléctrica. Con esos supuestos, SemiAnalysis estima para Vera Rubin 159,500 millones de dólares de ingresos anuales y 149,900 millones de dólares de ganancia modelada.

La configuración GB300 Dynamo SGLang más fuerte del mismo ejemplo alcanza 114,900 millones de dólares de ingresos y 105,300 millones de dólares de ganancia modelada. La diferencia es de 39% en ingresos y 42% en ganancia, aproximadamente 1.42 veces, no 2 veces.

El análisis calcula una brecha de 44,600 millones de dólares anuales por GW. Si se escala linealmente, equivale a unos 446 millones de dólares en una instalación de 10 MW.

El resumen usa la fórmula de más de dos veces, mientras que el ejemplo con cifras completas muestra 42% más ganancia. Sin otro conjunto de supuestos que explique la primera cifra, no se pueden presentar ambas como si describieran el mismo escenario.

La ganancia final dependerá del precio de los tokens, la utilización, el costo de energía, el financiamiento, la renta o propiedad del hardware y la demanda.

La lectura más sólida queda acotada al benchmark: Vera Rubin NVL72 alcanzó hasta 7.2 veces más throughput por MW que GB300 con SGLang en AgentX y DeepSeek V4 Pro de 1.6T parámetros, a 150 TPS. A 200 TPS, la brecha bajó a 2.72 veces y el motor de serving modificó de forma drástica la comparación. El resultado señala el peso del co-diseño y de la energía disponible, pero no ofrece una cifra transferible a cualquier modelo o despliegue.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed