✨︎ Resumen (TL;DR):
- NVIDIA lanzó el 3 de septiembre de 2026 la beta gratuita y de código abierto de PAIR, un router que descubre equipos compatibles en una misma red.
- La herramienta distribuye solicitudes entre Windows, Linux y macOS mediante Ollama o LM Studio, pero no suma la VRAM de varias computadoras.
- En una demostración con agentes, el tiempo promedio bajó de 18 minutos a 8 minutos y 48 segundos al usar tres nodos; el beneficio depende del paralelismo.
NVIDIA lanzó el 3 de septiembre de 2026 la beta de Personal AI Router (PAIR), un software gratuito y de código abierto que detecta computadoras compatibles en una misma red local y reparte entre ellas solicitudes independientes de IA. La herramienta busca reducir esperas cuando un agente divide un trabajo en tareas paralelas, pero no combina la VRAM de varios equipos ni acelera por sí sola una respuesta individual.
PAIR es un router de inferencia que decide en qué computadora se ejecuta cada solicitud de un modelo. Ollama o LM Studio siguen encargándose de ejecutar la solicitud en el equipo elegido.
NVIDIA diseñó PAIR como un proxy con un punto de conexión local. Así, las aplicaciones y los agentes no necesitan configurarse por separado para comunicarse con cada máquina participante.

Cómo decide PAIR dónde ejecutar cada solicitud
Después de instalar PAIR en los equipos participantes, el sistema puede descubrirlos mediante mDNS o una dirección IP. El emparejamiento requiere autorización con un código de seis dígitos.
NVIDIA señala que la comunicación entre nodos utiliza mTLS, una forma de cifrado autenticado en ambas direcciones. Para cada solicitud, el programador revisa estas condiciones:
- Si el nodo está conectado y listo.
- Si Ollama o LM Studio está habilitado.
- Si el modelo exacto que pide la aplicación está disponible.
- Qué carga tienen el motor y la GPU en ese momento.
Cada solicitud se asigna a un solo equipo y permanece allí hasta terminar. Si la computadora principal está ocupada, incluso porque alguien empezó a jugar o a crear contenido, PAIR puede elegir otro nodo disponible que tenga el motor y el modelo adecuados.
Ese diseño marca el límite central de la beta. Conectar dos computadoras con 16 GB de memoria gráfica no crea un conjunto de 32 GB para cargar un modelo más grande. PAIR tampoco vuelve más rápida una respuesta individual por sí mismo. Su ventaja aparece cuando varias solicitudes independientes pueden ejecutarse al mismo tiempo.
Compatibilidad: RTX, Mac y DGX Spark
La beta ofrece interfaces gráfica y de terminal. Funciona en Windows, Linux y macOS con las siguientes configuraciones compatibles que publica NVIDIA:
- GeForce RTX de la serie 20 o posterior.
- GPUs profesionales RTX PRO basadas en la arquitectura Turing o posterior.
- Sistemas NVIDIA DGX Spark.
- Equipos Mac con Apple M4 o un chip más reciente.
PAIR es compatible con Ollama y LM Studio. Cada nodo debe tener uno de esos motores habilitado y contar con el modelo solicitado. Si solo una computadora tiene ese modelo, el grupo elegible para esa tarea queda limitado a ese equipo; instalarlo en más nodos amplía las opciones del programador.
NVIDIA también lista 8 GB de RAM o más y recomienda al menos 20 GB de almacenamiento. La conexión a internet no hace falta para operar PAIR, aunque sí se necesita para descargar modelos.
La herramienta tampoco exige cables especiales, racks ni una instalación de clúster dedicada. Aun así, cada computadora debe contar con memoria y recursos suficientes para ejecutar el motor y la tarea que reciba.
La ventaja depende del trabajo paralelo
Los agentes pueden dividir una tarea amplia en solicitudes más pequeñas e independientes. Un asistente que revisa documentos, clasifica mensajes o prepara un plan puede lanzar varios trabajos y reunir los resultados después.
Sin un router, esas solicitudes pueden esperar turnos en la misma GPU. Con PAIR, algunas pasan a otros equipos disponibles de la red, siempre que tengan el modelo requerido.
NVIDIA mostró este funcionamiento con Hermes Desktop, Ollama y el modelo Qwen 3.6 35B A3B. En la demostración, cinco subagentes analizaron una bandeja de entrada sintética para preparar un plan de organización.
El trabajo tardó 18 minutos en promedio cuando se ejecutó en una laptop RTX Spark. Al repartirlo entre esa laptop, un sistema DGX Spark y una RTX 5090, el tiempo promedio bajó a 8 minutos y 48 segundos.
NVIDIA califica esa comparación como una demostración no oficial y específica de esa configuración. El resultado depende del grado de paralelismo, el modelo, los ajustes del motor, el hardware, la red y la disponibilidad de cada nodo. Añadir computadoras no garantiza una mejora proporcional en cualquier carga.
El escenario más realista: una laptop y una PC
NVIDIA plantea un uso con una laptop Mac o Windows junto a una PC de escritorio para gaming. La computadora principal puede seguir disponible para jugar, editar contenido o trabajar mientras el otro equipo ejecuta solicitudes locales, siempre que cuente con el motor y el modelo adecuados.
La aplicación es gratuita y su código está abierto, pero eso no elimina los costos del hardware, la electricidad ni el almacenamiento de los modelos. Tampoco convierte una computadora vieja en un equipo capaz de ejecutar cualquier modelo.
NVIDIA afirma que los prompts, archivos y el contexto de los agentes permanecen dentro de la red local. Esa condición aplica a los flujos que realmente se ejecutan de forma local. Si una aplicación, un modelo o una función adicional envía información a la nube, PAIR no cambia ese comportamiento por sí solo.
PAIR tiene un alcance concreto: reducir colas y liberar una computadora cuando ya existe otro equipo listo para atender solicitudes independientes. Para una sola consulta pesada o para aumentar la memoria disponible para un modelo, la beta no sustituye una GPU con más VRAM.
