Nvidia ha publicado Nemotron 3.5 Lightning, un modelo abierto de mezcla de expertos de 30.000 millones de parámetros, y NeMo Switchyard, la pieza que decide qué modelo atiende cada paso de un agente. Con las dos juntas, dice, la precisión se mantiene y el coste baja a alrededor de un tercio del de tirar solo de Opus 4.8.
Puntos clave
- Nemotron 3.5 Lightning: 30.000 millones de parámetros, arquitectura de mezcla de expertos, abierto y personalizable, orientado a tareas agénticas especializadas.
- Hasta 4 veces más velocidad de salida y un 30% menos de tiempo en completar tareas agénticas frente a modelos comparables.
- NeMo Switchyard enruta entre modelos y deja el coste sobre un tercio del de usar únicamente Opus 4.8, sin perder precisión de frontera.
- Boomi reporta 100% de acierto en el enrutado por dominio. Cognition, un 28% menos de coste medio. Ramp, un 58% menos de coste y un 33% menos de tiempo de ejecución.
- Corre en RTX PC, DGX Spark, DGX Station, Jetson, estaciones RTX PRO, centro de datos y nube. Está en Hugging Face, ModelScope, OpenRouter y build.nvidia.com. Switchyard va por GitHub.
Qué es realmente Switchyard
La frase que Nvidia usa para justificarlo es la que define el año: "los agentes que están siempre encendidos funcionan cada vez más como sistemas de modelos, con modelos distintos especializados en tareas distintas".
Traducido: un agente que se pasa el día trabajando no necesita el modelo más caro en cada paso. Necesita el caro para razonar sobre la arquitectura y uno rápido para reformatear un JSON, resumir un log o decidir a qué herramienta llamar. Switchyard es la capa que toma esa decisión sola, sin que tú escribas la lógica de cuándo llamar a quién.
Ahí está el número interesante. Un tercio del coste no sale de que el modelo sea más barato, sale de dejar de pagar precio de frontera por trabajo que no es de frontera.
Los números de los socios son los que valen
Los benchmarks propios de un fabricante siempre hay que cogerlos con pinzas. Los de sus clientes, menos.
Ramp dice un 58% menos de coste y un 33% menos de tiempo de ejecución. Cognition, un 28% de coste medio menos. Boomi, 100% de acierto enrutando por dominio, que es la métrica que de verdad importa en un enrutador: si se equivoca de modelo, el ahorro se lo come el reintento.
Son tres empresas que ya operan agentes en producción con volumen real, no pruebas de concepto. Que sus cifras sean de la misma familia (entre el 28% y el 58% de ahorro) le da bastante más credibilidad al reclamo que si viniera solo de Nvidia.
Correr en un portátil vuelve a ser el argumento
Que Lightning quepa en una RTX y en un Jetson no es un detalle de marketing. Es la misma dirección que marcó Meta con Muse Glimmer, su modelo de 30.000 millones que corre en local esta misma semana, y sigue el rastro que Nvidia ya dejó en julio con Nemotron 3 Embed.
El patrón es evidente cuando pones las tres piezas juntas: modelos abiertos de tamaño medio, que corren donde tú quieras, orquestados por una capa que reparte el trabajo. Nvidia vende el hardware en los dos extremos, así que le da igual dónde acabe corriendo mientras corra sobre lo suyo.
Por qué importa
Si tienes agentes en producción y la factura de tokens ha empezado a doler, esto es la palanca concreta. No hace falta cambiar de proveedor: hace falta dejar de mandarlo todo al modelo caro.
La forma barata de comprobarlo en tu casa es mirar una semana de llamadas y clasificar cuántas necesitaban razonamiento de verdad. En la mayoría de flujos que hemos medido, la respuesta está muy por debajo de la mitad. Ese porcentaje es tu ahorro potencial, y ahora hay una pieza abierta que lo automatiza en vez de obligarte a escribir el enrutado a mano.
Relacionado


