✨︎ Resumen (TL;DR):
- Nvidia lanzó Nemotron 3.5 Lightning y NeMo Switchyard para repartir tareas de agentes entre distintos modelos.
- Lightning activa 3,000 millones de sus 30,000 millones de parámetros y promete hasta 4 veces más velocidad de salida y 30% menos tiempo por tarea.
- El modelo ya tiene rutas de descarga y despliegue; Switchyard sigue como software pre-alpha, experimental y no apto para producción.
El 11 de agosto de 2026, Nvidia lanzó Nemotron 3.5 Lightning, un modelo de pesos abiertos que activa 3,000 millones de sus 30,000 millones de parámetros por token, junto con NeMo Switchyard, una biblioteca de código abierto para distribuir tareas de agentes entre distintas IA. Nvidia promete hasta 4 veces más velocidad de salida y 30% menos tiempo por tarea, pero el repositorio de Switchyard todavía lo clasifica como software pre-alpha y no apto para producción.

Nemotron 3.5 Lightning activa una décima parte de sus parámetros
Nemotron 3.5 Lightning es un modelo de pesos abiertos que procesa texto activando solo 3,000 millones de sus 30,000 millones de parámetros por token. Nvidia combinó capas Mamba-2, una mezcla de expertos, conocida como MoE, y capas de atención.
En vez de activar toda la red para producir cada token, el modelo selecciona unos 3,000 millones de parámetros. Esa arquitectura reduce el cómputo de cada paso sin renunciar a una reserva mayor de conocimiento distribuida entre sus expertos.
El modelo también incorpora predicción de múltiples tokens y admite dos sistemas auxiliares de decodificación especulativa: DFlash y DSpark. Estas técnicas preparan varios tokens candidatos para que el modelo principal los verifique en bloque, en lugar de generarlos estrictamente uno por uno.
La ficha oficial presenta un modelo de entrada y salida de texto, con razonamiento activable o desactivable y una ventana máxima de 1,000,000 de tokens. Esa capacidad depende del despliegue: el ejemplo para una sola H100 usa 256,000 tokens, mientras que la configuración de 1,000,000 de tokens aparece para ocho H100 o una GB200.
Nvidia incluye el español entre los 6 idiomas admitidos. La tabla principal de evaluación, sin embargo, no ofrece una medición general dedicada al rendimiento en español.
BF16 y NVFP4 llegan desde el lanzamiento
Las versiones BF16 y NVFP4 están disponibles desde el lanzamiento. Los pesos BF16 pueden ejecutarse en una H100 o en una A100 de 80 GB; Nvidia recomienda NVFP4 para la inferencia optimizada.
La ficha del modelo señala que la licencia OpenMDW 1.1 permite el uso comercial.
La velocidad de salida no recorta igual el tiempo total
Nvidia afirma que Nemotron 3.5 Lightning alcanza hasta 4 veces más velocidad de salida frente a modelos de su clase. Para tareas completas de agente, la promesa es una reducción de 30% en el tiempo necesario.
La diferencia importa porque una tarea de agente no consiste únicamente en generar tokens. También incluye planificación, llamadas a herramientas, lectura de resultados y coordinación con otros modelos. La generación rápida es solo una parte del tiempo total.
La propia tabla de Nvidia muestra el intercambio entre velocidad y capacidad:
- En SWE-bench Verified, Lightning obtuvo 51.56 puntos, frente a 70.12 de Qwen 3.6 35B A3B.
- En Terminal-Bench 2.1, registró 24.58 puntos, mientras que Qwen 3.6 35B A3B alcanzó 44.38.
- En PinchBench, Lightning consiguió 85.37 puntos, frente a 88.07 de Qwen 3.6 35B A3B, y superó los 74.70 de Gemma 4 26B A4B.
Nvidia midió todos esos resultados con su propio entorno de evaluación. Las cifras pueden diferir de las que publiquen otros proveedores.
El lanzamiento ocurrió un día después de que Meta liberara Muse Glimmer, otro modelo de 30,000 millones de parámetros pensado para agentes que pueden ejecutarse en una computadora personal. Nvidia acompaña su modelo con una segunda pieza: un sistema que decide qué IA atiende cada paso.
Switchyard decide cuándo escalar a otra IA
NeMo Switchyard es una biblioteca de código abierto que reparte las solicitudes de un agente entre modelos abiertos y propietarios. El router se coloca entre la aplicación y las IA, recibe solicitudes en los formatos OpenAI Chat Completions, OpenAI Responses o Anthropic Messages, y devuelve la respuesta en el formato que espera la aplicación.
Switchyard puede enviar el trabajo a vLLM, Nvidia NIM, Ollama o cualquier endpoint compatible con OpenAI sin obligar a reescribir el agente.
El proyecto contempla varias estrategias de decisión:
- Un modelo clasificador decide si una solicitud necesita un modelo débil o uno fuerte.
- Un router por etapas reacciona a los resultados de las herramientas y a los errores.
- Un modo prueba primero la opción barata y escala si un juez considera insuficiente la respuesta.
- Para pruebas A/B, Switchyard puede dividir el tráfico al azar y registrar latencia, tokens, errores y sobrecarga mediante Prometheus.
El ahorro depende de no llamar siempre al modelo de frontera
Nvidia sostiene que, en una prueba interna, Switchyard redujo el costo de completar tareas a casi un tercio del gasto de usar únicamente Opus 4.8. La compañía también reporta una precisión comparable a la de un modelo de frontera.
Los resultados de socios muestran la concesión que puede acompañar ese ahorro. LangChain reportó 74% menos costo en 145 tareas de varias interacciones al enviar solo 7% de las llamadas a un modelo de frontera, pero registró una caída de 6% en precisión.
Lightning está disponible; Switchyard sigue en pre-alpha
Nemotron 3.5 Lightning puede descargarse en Hugging Face y ModelScope, utilizarse mediante OpenRouter o ejecutarse como un microservicio Nvidia NIM en build.nvidia.com.
Switchyard está disponible en GitHub y Nvidia dice que llegará más adelante a plataformas asociadas. Su repositorio ya incluye rutas para probarlo con Claude Code, Codex CLI y OpenClaw.
La disponibilidad del código no significa que el router esté listo para operaciones reales. El README de GitHub lo clasifica como software pre-alpha y experimental, advierte que su API y sus algoritmos pueden cambiar antes de la versión 1.0, y señala que todavía no debe desplegarse en producción. Su licencia es Apache 2.0.
La propuesta de Nvidia divide el trabajo de un agente en dos capas: Lightning concentra las tareas especializadas con solo 3,000 millones de parámetros activos por token, mientras Switchyard intenta reservar los modelos más costosos para los pasos difíciles. La primera pieza ya cuenta con pesos, licencia y rutas de despliegue; la segunda todavía funciona como una herramienta experimental que debe madurar antes de sostener operaciones reales.
