NVIDIA PAIR: convierte tu casa en un clúster de IA local

  • NVIDIA PAIR es un software gratuito y de código abierto que distribuye tareas de inferencia de IA entre varios equipos de una misma red doméstica.
  • Se apoya en motores como Ollama y LM Studio, y no fusiona GPUs ni suma memorias; cada petición se procesa completa en un solo nodo.
  • La beta ya está disponible para Windows, Linux y macOS, y es compatible con tarjetas GeForce RTX 20 en adelante, RTX PRO, DGX Spark y Apple M4 o superior.
  • Una demostración con cinco subagentes redujo el tiempo de ejecución de 18 minutos a 8:48 al usar tres equipos en lugar de uno.

NVIDIA PAIR

En plena IFA 2026, NVIDIA ha presentado una de esas propuestas que cambian la forma de entender la inteligencia artificial local. Se llama Personal AI Router, o PAIR para los amigos, y su objetivo es aprovechar los ordenadores que ya tenemos por casa para ejecutar tareas de IA de forma conjunta. No se trata de un router físico ni de un nuevo motor de inferencia, sino de una herramienta que actúa como intermediario entre las aplicaciones de IA y los distintos equipos de una red local.

La idea es sencilla: si tienes un PC gaming, una estación de trabajo o incluso un MacBook con un chip moderno, es muy probable que buena parte de su capacidad de cómputo esté desaprovechada muchas horas al día. PAIR lo que hace es detectar esos equipos, conectarlos de forma segura y repartir entre ellos las peticiones de inferencia que generan los agentes de IA, de manera que el trabajo no se atasque en una sola tarjeta gráfica.

Hardware en el edge
Artículo relacionado:
Hardware en el edge: la nueva frontera de la IA generativa

¿Qué es exactamente NVIDIA PAIR?

Herramienta PAIR de NVIDIA

PAIR es un software gratuito y de código abierto que funciona como un proxy entre las aplicaciones de IA y los motores de inferencia instalados en cada equipo. Cuando un agente lanza varias subtareas a la vez, PAIR decide qué máquina de la red puede encargarse de cada una, teniendo en cuenta si tiene cargado el modelo solicitado, la carga actual de la GPU y si el equipo está disponible. Para el usuario, la experiencia es transparente: solo ve una conexión única, mientras que por detrás el tráfico se distribuye entre los nodos participantes.

Una de las claves es que no sustituye a Ollama ni a LM Studio, sino que se apoya en ellos. De hecho, PAIR toma el control de los puertos que usan estos motores por defecto para recibir las peticiones y reenviarlas al nodo más adecuado. Esto significa que las aplicaciones existentes pueden seguir funcionando sin cambios, lo que reduce muchísimo la barrera de entrada para quien ya tiene montado su entorno de IA local.

agentes de ia local en esp32
Artículo relacionado:
Agentes de IA local en ESP32: frameworks, proyectos y límites

Cómo funciona el reparto de tareas

Funcionamiento de PAIR

El descubrimiento de equipos se hace mediante mDNS, el mismo protocolo que usa una impresora para aparecer en la red. Tras la instalación, cada máquina anuncia su disponibilidad y las demás la detectan automáticamente. Para añadir un nodo también se puede usar su dirección IP directamente, pero el proceso habitual es que la máquina principal muestre un PIN de seis dígitos que el otro equipo debe introducir para establecer el emparejamiento.

Una vez conectados, la comunicación entre nodos viaja cifrada con mTLS, es decir, con certificados mutuos que garantizan que el tráfico no salga de la red privada. Esto es importante para quienes manejan información sensible, ya que las indicaciones y los datos de los agentes se quedan en casa, sin pasar por ningún servidor externo. Eso sí, los responsables del proyecto advierten que hay que revisar la seguridad de redes LAN antes de usarlo en redes compartidas o no confiables, porque abre endpoints HTTP locales y permite descubrimiento en la LAN.

Rendimiento y demostraciones

Rendimiento de PAIR

La pregunta del millón es si realmente mejora los tiempos. NVIDIA compartió una demostración no oficial con el agente Hermes Desktop y Ollama ejecutando el modelo Qwen 3.6 35B A3B. Una tarea de cinco subagentes que tardaba una media de 18 minutos en una sola laptop RTX Spark se completó en 8 minutos y 48 segundos usando un clúster de tres equipos: la laptop, una DGX Spark y una RTX 5090. Esta mejora de poco más de 2x se explica porque las subtareas pueden ejecutarse en paralelo en varias GPU, en lugar de hacer cola en una sola.

La compañía insiste en que no se trata de un benchmark general ni de una promesa de escalado lineal. El resultado depende mucho del tipo de carga, del modelo usado, de la configuración de la red y de qué nodos estén disponibles. Las tareas muy secuenciales, o aquellas donde solo un equipo tiene el modelo solicitado, obtendrán pocos beneficios. Además, PAIR no agrupa la memoria de las distintas tarjetas gráficas, así que no es la solución para cargar un modelo que no cabe en una sola GPU.

memoria HBM4E para IA
Artículo relacionado:
La Revolución de la Memoria HBM4E en la Inteligencia Artificial

Compatibilidad y requisitos

Compatibilidad de PAIR

La beta de PAIR está disponible para Windows 11, Linux y macOS, con soporte para arquitecturas x64 y arm64 (aunque Windows en ARM se considera experimental). En cuanto al hardware, se requieren GPUs GeForce RTX Serie 20 o posteriores, RTX PRO basadas en Turing o superiores, DGX Spark o chips Apple M4 o más nuevos. También se necesitan al menos 8 GB de RAM y 20 GB de espacio en disco, y no hace falta conexión a Internet para funcionar, solo para descargar los modelos.

Un detalle interesante es que PAIR no se limita a productos NVIDIA; cualquier equipo que pueda ejecutar Ollama o LM Studio puede participar, incluyendo sistemas con Apple Silicon. De hecho, se ha probado con éxito en redes de hasta 18 GPUs. La flexibilidad para que los nodos entren y salgan cuando quieran —por ejemplo, si una laptop se suspende o un PC comienza a jugar— es otra de sus señas de identidad, ya que el planificador va adaptando el reparto en tiempo real.

RTX Spark y otras novedades

RTX Spark y PAIR

PAIR llega en un momento en el que NVIDIA también ultima el lanzamiento de los primeros PC con RTX Spark, previsto para octubre. Estos equipos combinan una GPU Blackwell con una CPU Grace de 20 núcleos y hasta 128 GB de memoria unificada, y están pensados para ejecutar agentes de IA de forma local. En la IFA se han visto propuestas de Lenovo (Yoga Pro 9n y Yoga 9n), Acer (concepto de sobremesa compacto) y se espera que tanto Dell como HP, ASUS, MSI y Microsoft saquen sus modelos.

Junto con PAIR, NVIDIA ha anunciado simplificaciones para otros proyectos de agentes. Perplexity Portable Computer llegará a GPUs RTX con al menos 24 GB de VRAM tanto en Windows como en Linux, permitiendo ejecutar flujos completos sin gastar créditos y con permiso previo para enviar datos a la nube. Hermes Agent incorporará una configuración con un clic que detecta la GPU automáticamente, y OpenClaw también tendrá una opción similar en Windows.

En cuanto a rendimiento, las optimizaciones en llama.cpp permiten hasta 1,9 veces más throughput en una GeForce RTX 5090, mientras que vLLM mejora 1,2x en una RTX PRO 6000 Blackwell y hasta 1,4x en clústeres de dos DGX Spark. Estas mejoras ya están disponibles a través de LM Studio, Ollama y los propios motores.

Todo esto apunta a una tendencia clara: mover el grueso del trabajo de IA fuera de la nube y aprovechar el hardware que ya tenemos en casa. PAIR es una pieza más de ese puzle, y aunque está en fase beta, merece la pena probarlo si tienes más de un equipo con cierta potencia. La versión final aún no tiene fecha, pero la comunidad ya puede descargarlo y contribuir con mejoras desde GitHub.

Vista macro de un procesador de computadora, representando el núcleo tecnológico de las plataformas de computación.
Artículo relacionado:
Duelo de Titanes: Comparativa entre Intel, AMD, Qualcomm y NVIDIA en el Mundo PC

Añadir como fuente preferida en Google