Nvidia regala PAIR, que une los ordenadores de tu oficina para IA

Nvidia regala PAIR, que une los ordenadores de tu oficina para IA
Fuente: blogs.nvidia.com

Nvidia ha publicado PAIR, un router de IA personal gratuito y de código abierto que encuentra los ordenadores compatibles de tu red local y reparte entre ellos las peticiones de inferencia. Está en beta para Windows, macOS y Linux, y funciona con Ollama y LM Studio, o sea con lo que ya usa cualquiera que corra modelos en local.

Puntos clave

  • PAIR son las siglas de Personal AI Router. Es gratuito, abierto y viene con interfaz gráfica y de terminal.
  • Descubre solo los equipos compatibles que estén encendidos en la red y va enviando cada petición al que tenga capacidad libre.
  • Se adapta cuando un equipo entra o sale de la red, así que el portátil que alguien cierra a las siete deja de recibir trabajo sin que haya que tocar nada.
  • Hardware admitido: GeForce RTX de la serie 20 en adelante, RTX PRO con arquitectura Turing o posterior, DGX Spark y Macs con chip M4 o más nuevo.

Qué resuelve y qué no

El problema que ataca PAIR es tonto de enunciar y caro de arreglar a mano. En una oficina pequeña hay cuatro o cinco máquinas con GPU decente, y cuando alguien lanza un trabajo con IA local se ejecuta entero en la suya mientras las otras cuatro miran. PAIR pone un repartidor delante.

Conviene entender bien el alcance, porque es donde la gente se hace ilusiones. Lo que reparte son peticiones de inferencia independientes entre sí. No parte un modelo grande en trozos para que corra a través de varias máquinas. Si tu problema es que un modelo de 70.000 millones de parámetros no cabe en tu GPU, PAIR no lo arregla.

Donde sí cambia las cosas es en el trabajo por lotes y en los agentes con subtareas paralelas. El propio ejemplo de Nvidia va por ahí: un agente que planifica y va soltando subagentes, cada uno con su tarea, y PAIR mandando cada subagente a una máquina distinta. Clasificar 2.000 correos, extraer campos de 500 facturas, resumir un archivo de transcripciones: eso son peticiones independientes y ahí el reparto multiplica.

Que hable Ollama y LM Studio importa más de lo que parece. Son las dos formas en que la mayoría de la gente ya corre modelos en su portátil, así que no hay que migrar nada ni aprender un runtime nuevo. Instalas, señalas y reparte.

Que admita Macs con M4 en el mismo pool que las RTX es la parte menos esperada del anuncio. En una oficina real el parque es mixto, y hasta ahora juntar un MacBook y un PC con GeForce en la misma cola de inferencia era un proyecto de fin de semana.

El resto de lo que enseñó Nvidia en IFA

El anuncio de PAIR va dentro de una tanda de mejoras de rendimiento en local que Nvidia presentó en IFA 2026 y que se resumen en números:

  • Hasta 1,9 veces más rendimiento en llama.cpp sobre una GeForce RTX 5090.
  • 1,2 veces en vLLM sobre una RTX PRO 6000, y hasta 1,4 veces sobre dos clústeres DGX Spark.
  • 7 veces de mejora en FastH3.
  • El RTX Spark, con 1 petaflop de GPU Blackwell, hasta 128 GB de memoria unificada y 20 núcleos de CPU Grace.

Las cifras de rendimiento son de Nvidia y no hay medición independiente todavía, así que valen como orden de magnitud y no como promesa.

Lo que hay que mirar antes de montarlo

PAIR está en beta, y eso se nota en dos sitios concretos.

El primero es que cada máquina del pool tiene que tener ya cargado el modelo que vas a usar. El router manda la petición, no los pesos, así que si el portátil de la sala de reuniones no tiene ese modelo en Ollama, ahí no se ejecuta nada. Homogeneizar el modelo en todos los equipos es el paso previo que nadie cuenta en el anuncio.

El segundo es la red. Repartir peticiones por wifi de oficina funciona para texto corto y se atraganta en cuanto metes documentos largos o imágenes. Si vas a mover lotes serios, la diferencia entre cable y wifi deja de ser un detalle.

Y luego está lo obvio, que en una empresa nunca es tan obvio: los equipos del pool son los ordenadores de tus compañeros. Un trabajo pesado en horario de oficina se lo va a comer alguien que estaba editando un vídeo. Lo razonable es empezar con lotes nocturnos y con las máquinas que sabes que están libres.

Por qué importa

Para una empresa española de 20 o 200 personas, la parte accionable son los ordenadores que ya has pagado, no el DGX Spark de la foto.

Casi cualquier oficina tiene hoy un puñado de máquinas con GPU comprada para diseño, para vídeo o simplemente porque tocaba renovar. Esas máquinas están al 5% de uso ocho horas al día y luego apagadas dieciséis. PAIR convierte ese parque en una cola de inferencia sin comprar nada.

Y hay tareas que no necesitan un modelo frontera. Clasificar tickets de soporte por categoría, sacar el importe y el proveedor de un PDF, marcar qué correos de una bandeja piden respuesta, resumir llamadas de ventas para meterlas en el CRM. Todo eso lo hace bien un modelo de 8.000 o 12.000 millones de parámetros corriendo en local, y cada una de esas tareas hecha con una API de pago tiene un coste por documento que se nota a fin de mes.

El otro argumento es el que ha quedado claro hoy mismo, con ChatGPT, Claude y Grok cayéndose a la vez. Un proceso que corre en tu red no se entera de que ha habido incidente en tres proveedores a la vez.

Empezar cuesta poco: instala Ollama en dos máquinas, pon PAIR delante y pásale una tarea repetitiva que hoy haces con la API. Si el resultado te sirve para esa tarea, tienes un proceso menos en la factura y uno menos expuesto a la caída de un tercero.

Fuente original: NVIDIA


Relacionado