✨︎ Resumen (TL;DR):
- Nvidia publicó el 3 de septiembre de 2026, durante IFA 2026, la beta gratuita y de código abierto de Personal AI Router (PAIR), con licencia Apache 2.0.
- PAIR envía cada solicitud completa de inferencia a una sola computadora compatible. No fusiona GPUs, no suma memoria de video ni divide un modelo entre equipos.
- El repositorio oficial reconoce que el planificador mira el trabajo en cola y el uso de GPU, por lo que funciona mejor con máquinas parecidas que con un clúster muy mixto.
Nvidia publicó el 3 de septiembre de 2026, durante IFA 2026, la beta de Personal AI Router (PAIR) para Windows, macOS y Linux. PAIR es un software de enrutamiento de inferencia que distribuye solicitudes de IA entre computadoras compatibles de una misma red doméstica. Su objetivo es aprovechar una computadora ociosa en casa en vez de pagar tokens en la nube.

Un solo punto de conexión para la red local
El programa es gratuito y de código abierto bajo licencia Apache 2.0. Su límite central es que cada solicitud completa se ejecuta en una sola máquina: PAIR no combina GPUs, no suma memoria de video ni divide un modelo entre equipos.
PAIR no es un motor de inferencia nuevo. Ollama y LM Studio siguen ejecutando el modelo en la computadora que toque. PAIR toma el puerto que esos servicios usan por defecto, recibe la solicitud, revisa qué motor y qué modelo pide, elige un nodo y devuelve la respuesta por el mismo canal.
Para la aplicación, existe una sola conexión durante todo el proceso. Si un agente trabaja en otro puerto, el proxy se reconfigura desde los ajustes del motor. La aplicación no necesita saber en qué computadora terminó cada solicitud.
El emparejamiento entre equipos ocurre mediante descubrimiento de red local con mDNS. La computadora que invita muestra un PIN de seis dígitos y el segundo equipo debe ingresarlo para entrar al clúster. También es posible agregar una máquina mediante su dirección IP.
Antes de completar esa conexión, PAIR bloquea la comunicación entre nodos. Después, cifra esa comunicación con mTLS y certificados generados para el clúster. Nvidia recomienda revisar su política de seguridad antes de instalar el programa en una red compartida o no confiable, porque la beta expone endpoints HTTP locales, usa descubrimiento en la LAN y habilita la red del clúster.
Reparte solicitudes, no potencia acumulada
PAIR asigna cada solicitud completa a un nodo y la mantiene ahí hasta que termina. No junta varias GPUs para convertirlas en una sola más grande, no agrupa la memoria de video y no divide el mismo modelo entre máquinas.
El ejemplo de memoria deja clara la limitación: dos Mac de 16 GB no se convierten en una bolsa de 32 GB para cargar un modelo más grande. Agregar computadoras tampoco acelera por sí mismo una respuesta individual.
La ventaja aparece cuando varias solicitudes independientes compiten por la misma GPU. Un agente puede dividir una tarea entre subagentes o puede haber varias sesiones abiertas al mismo tiempo. En cambio, Nvidia advierte que las tareas muy secuenciales, las dominadas por una sola llamada larga y las configuraciones donde solo una computadora tiene el modelo solicitado ganan poco o nada.
Los nodos pueden entrar y salir sobre la marcha. Una laptop que se suspende deja de recibir trabajo, al igual que una GPU cuyo dueño la reclama para jugar.
La demostración baja de 18 minutos a 8:48
Nvidia mostró una demostración con Hermes Desktop, que repartió una tarea entre cinco subagentes, mientras Ollama ejecutaba el modelo Qwen 3.6 35B A3B.
En una sola laptop RTX Spark, la carga tardó 18 minutos en promedio. En un clúster de tres equipos, formado por esa misma laptop, una DGX Spark y una RTX 5090, el promedio bajó a 8 minutos y 48 segundos.
Nvidia describe el resultado como una demostración no oficial y específica de esa configuración, no como un benchmark general ni como una promesa de escalamiento lineal. El resultado depende del paralelismo de la carga, el modelo, los ajustes del motor, el hardware, la red y los nodos disponibles.
En esa comparación no participó ninguna Mac.
El planificador favorece equipos parecidos
La página del producto plantea juntar Mac, sistemas RTX y DGX Spark en un clúster casero. El repositorio oficial de GitHub introduce un límite: hoy PAIR utiliza una sola política de planificación.
El planificador combina el trabajo en cola con una señal aproximada y suavizada del uso de GPU. No toma en cuenta el modelo de GPU, la memoria disponible, si el modelo ya está cargado en caliente ni qué tan costosa parece la solicitud. Por eso, el propio documento considera que PAIR encaja mejor con máquinas parecidas que con un clúster muy mixto.
Nvidia quiere hacer más inteligente ese componente y quizá permitir elegir la política de planificación, pero no ha dado fechas para esos cambios.
Que PAIR funcione en una computadora no significa que un motor de inferencia también sea compatible con ella. Cada motor fija sus propios requisitos de sistema operativo, GPU y controladores, mientras que cada modelo necesita memoria suficiente para cargarse.
PAIR solo incorpora un nodo a la lista de candidatos cuando ese equipo ya ejecuta un motor compatible y tiene el modelo exacto solicitado. Los modelos no tienen que ser idénticos en todas las computadoras.
Requisitos de la beta dejan fuera al M3 Ultra
Nvidia publicó estos mínimos el mismo 3 de septiembre de 2026. Para participar en el clúster, la beta pide:
- GPU o chip: GeForce RTX serie 20 o posterior, RTX PRO con arquitectura Turing o posterior, DGX Spark con GB10, o una Mac con chip M4 o posterior.
- Sistema operativo: Windows 11, Linux con DGX OS o Ubuntu, y macOS Tahoe.
- Arquitectura: x64 y arm64 en los tres sistemas. Windows en ARM es experimental.
- Motor de inferencia: Ollama o LM Studio instalado en cada nodo que vaya a servir solicitudes.
- Memoria del sistema: 8 GB o más.
- Espacio en disco: 20 GB o más, como requisito recomendado.
- Conexión a internet: no hace falta para operar PAIR, pero sí para descargar los modelos.
El corte en M4 tiene una consecuencia concreta. La lista publicada deja fuera al Mac Studio con M3 Ultra, que Apple presentó en marzo de 2025 con configuraciones de hasta 512 GB de memoria unificada y promocionó para correr modelos de lenguaje grandes en local.
Nvidia no explica ese corte en su página de requisitos. La lista tampoco aclara si PAIR funcionaría en una Mac anterior.
Para quien ya ejecuta modelos en su propia computadora, PAIR resuelve una tarea específica: evita configurar cada aplicación para apuntarla a cada equipo por separado. El programa centraliza el acceso y puede aprovechar nodos disponibles cuando hay solicitudes independientes.
El techo del hardware no cambia. El modelo que no cabía en una GPU seguirá sin caber, y el tiempo de respuesta solo baja cuando hay varias solicitudes esperando turno.
