La IA local ha sido la gran protagonista del paso de NVIDIA por IFA 2026, donde la compañía ha desplegado un abanico de novedades pensadas para que ejecutar modelos de inteligencia artificial en el propio equipo deje de ser algo reservado a unos pocos. La apuesta cubre casi todo el camino: agentes más sencillos de instalar, mejoras notables en el rendimiento de inferencia, modelos optimizados para funcionar en local, aplicaciones capaces de sacarles partido y una herramienta nueva llamada NVIDIA PAIR que reparte el trabajo entre varios equipos de una misma red. Y a todo eso hay que sumar la llegada en ottobre de los primeros PC Windows con RTX Spark.
Uno de los objetivos principales pasa por reducir la complicación que todavía supone poner en marcha un agente en local. Perplexity Portable Computer llegará este mes a GPUs RTX con al menos 24 GB de VRAM sobre Windows y Linux, y deja ejecutar flujos completos sin gastar créditos, tirando de forma selectiva de más de 15 modelos en la nube cuando una tarea lo pide. Antes de mandar cualquier dato fuera del equipo, la aplicación pide permiso. Hermes Agent incorporará una configuración de un solo clic que detecta la GPU, elige modelo y parámetros y aprovecha llama.cpp con las optimizaciones de NVIDIA. OpenClaw hace lo propio en sistemas Windows con una RTX de al menos 24 GB.
Más velocidad y modelos preparados para funcionar en casa
En el apartado de rendimiento hay avances concretos. Las nuevas optimizaciones para llama.cpp permiten alcanzar hasta 1,9 veces más throughput en una GeForce RTX 5090 gracias a mejoras en kernels, técnicas más avanzadas de speculative decoding y un prefill más rápido. vLLM mejora 1,2 veces el rendimiento en una RTX PRO 6000 Blackwell Workstation Edition y hasta 1,4 veces con dos DGX Spark. Todo esto ya está disponible a través de LM Studio, Ollama, llama.cpp y vLLM, aunque conviene tomarlo con calma: las cifras corresponden a configuraciones y cargas concretas, no a una mejora universal para cualquier equipo.
La estrella conceptual es NVIDIA Personal AI Router, o PAIR. Una herramienta gratuita y de código abierto que descubre los equipos compatibles dentro de una red local y reparte entre ellos solicitudes independientes de inferencia. No sustituye a Ollama ni a LM Studio, tampoco añade un motor nuevo. Funciona como un router virtual que vigila qué sistemas están libres, qué modelos tienen cargados y cuánta capacidad ofrecen, para decidir dónde ejecuta cada trabajo. Desde el punto de vista del agente sigue habiendo una sola conexión, y PAIR se encarga por detrás de toda la distribución.
Conviene aclarar qué no hace. PAIR no fusiona varias GPUs, no suma su VRAM y no divide una única inferencia entre máquinas. Cada solicitud se ejecuta entera en un solo nodo, y la ventaja aparece cuando hay varias peticiones que pueden ir en paralelo. Así se puede dejar libre la GPU principal para jugar o crear contenido mientras otros equipos asumen parte de la carga. La beta es compatible con Windows, macOS y Linux, con GeForce RTX 20 Series y posteriores, RTX PRO basadas en Turing o más recientes, DGX Spark y sistemas Apple con chips M4 o superiores. Las conexiones se establecen mediante emparejamiento seguro, mTLS y certificados generados para mantener las comunicaciones dentro de la red privada.
Un ecosistema entre agentes, creación y gaming
NVIDIA enseñó una demostración bastante clara. Con Hermes y Qwen3.6 35B A3B, una tarea repartida entre cinco subagentes tardó una media de 6 minutos y 18 segundos usando una sola RTX 5090. Al repetir el trabajo con un clúster PAIR de dos RTX 5090, el tiempo bajó a 3 minutos y 48 segundos. La propia compañía avisa de que es una demostración concreta y no un benchmark general ni una promesa de escalado lineal.
El catálogo de modelos que corren en hardware NVIDIA está creciendo rápido: Nemotron 3.5 Lightning, de 30.000 millones de parámetros para RTX, RTX PRO, DGX Spark y Jetson; GLM-5.3-Flash de Z.ai; Qwen3.8-Flash-Next y Qwen3.8-27B; LTX 2.5 para vídeo; MiniMax-H3, capaz de generar vídeo con audio sincronizado; Muse Glimmer de Meta, orientado a programación y agentes; y DeepSeek v4 Flash, un enorme MoE de 284.000 millones de parámetros que puede ejecutarse en DGX Station. La IA local empieza a abarcar programación, agentes, generación multimodal, imagen y vídeo, y no solo chatbots.
También aparecen aplicaciones que acercan todo esto a usuarios creativos. CyberLink PhotoDirector AI PC Mode será una de las primeras en integrar modelos de difusión dentro de un editor convencional, con edición generativa, mejora de imagen, eliminación de objetos, sustitución de fondos, retoque de retratos y creación de imágenes nuevas. Se podrá elegir entre procesamiento local o en la nube, y en GPUs NVIDIA usará TensorRT-RTX y FP8 para acelerar el trabajo. Llegará a PhotoDirector 365 coincidiendo con el estreno de RTX Spark en ottobre.
Ese hardware es otra pieza clave. RTX Spark llegará en ottobre con equipos de fabricantes como ASUS, Acer y Lenovo. Acer ha mostrado un concepto de sobremesa compacto, mientras Lenovo prepara los Yoga Pro 9n y Yoga 9n 2-in-1. La plataforma combina una GPU RTX Blackwell capaz de alcanzar 1 petaflop, hasta 128 GB de memoria unificada y una CPU Grace de 20 núcleos, con la idea de meter agentes locales funcionando de forma persistente en portátiles finos y sobremesas compactos. Electronic Arts, Embark y Ubisoft se han sumado a KRAFTON, NetEase, Riot Games y Xbox entre las compañías que preparan soporte para RTX Spark en sus juegos.
Fuente
Imagen: muycomputer.com
