Un modelo de unos 30.000 millones de parámetros ha superado a GPT-5.6 Sol, a Grok 4.5 y a Claude Opus 5 en una tarea concreta de ventas: identificar qué clientes potenciales van a comprar de verdad. Y lo hizo entre 24 y 1.700 veces más barato.
El modelo se llama Savant 3.5, lo ha construido NextLM sobre Nemotron de Nvidia, y el estudio es investigación propia de la compañía. Conviene leerlo con esa advertencia delante.
Puntos clave
- Savant 3.5: unos 30.000 millones de parámetros totales, con solo 3.000 millones activos por entrada.
- En el decil superior de predicciones, acertó un 24,6% de compradores reales.
- GPT-5.6 Sol se quedó en 22,8% y Grok 4.5 en 22,3%. Claude Opus 5 fue el último, con 14,6%.
- Coste por mil prospectos: entre 0,003 y 0,011 dólares en Savant, frente a un rango de 0,26 a 5,11 en los modelos de frontera.
- Compararon también contra modelos de Google y de Moonshot.
Qué mide exactamente el número
La tarea era ordenar una lista de clientes potenciales por probabilidad de compra. La métrica es cuántos compradores reales caen en el 10% mejor de la lista.
Un 24,6% frente a un 22,8% no es una brecha enorme. En una lista de diez mil prospectos son unos 18 compradores más en el grupo prioritario, lo cual para un equipo comercial sí se nota, pero no es el titular.
El titular está en la otra columna. Entre 0,003 y 5,11 dólares por mil prospectos hay tres órdenes de magnitud. A escala de una base de datos comercial mediana, con pasadas frecuentes, esa diferencia decide si el proceso se corre una vez al trimestre o todos los días.
Por qué un modelo pequeño puede ganar aquí
La arquitectura da una pista: 30.000 millones de parámetros de los que solo 3.000 se activan en cada entrada. Es un diseño de expertos, pensado para que cada consulta encienda solo la parte que hace falta.
Pero la razón de fondo es otra, y es la que importa. Puntuar prospectos es una tarea de clasificación con señales acotadas, no un problema abierto que requiera razonamiento general. Un modelo entrenado específicamente sobre datos de comportamiento de compra tiene ventaja estructural sobre un modelo de frontera que sabe de todo.
Que Opus 5 quede último con 14,6% refuerza esa lectura. No es que sea peor modelo, es que ni él ni los otros grandes están optimizados para esto.
La advertencia del que publica
Hay que decirlo claro: el estudio lo hizo NextLM, que es la empresa que vende Savant. Nat Rubio-Licht lo reportó en The Deep View, pero los datos son de parte.
Eso no lo invalida. Las métricas son concretas, la tarea está definida y los competidores son reconocibles. Pero un benchmark diseñado por quien vende el producto tiende a medir aquello en lo que el producto es bueno, y el resultado hay que tratarlo como una hipótesis que verificar con tus propios datos, no como una conclusión.
Por qué importa
Esto es lo que en la práctica se llama enrutado por modelo, y es probablemente la palanca de coste más rentable que hay hoy en cualquier empresa que use IA en volumen.
La idea es simple: mandar cada tarea al modelo más pequeño que la resuelva bien, y reservar el caro para lo que de verdad lo necesita. Puntuar leads, clasificar tickets, extraer campos de una factura, etiquetar productos. Todas esas tareas se comen mucho volumen y casi ninguna necesita un modelo de frontera.
Un test concreto que puedes montar esta semana: coge la tarea de IA que más volumen te consume, corre una muestra de mil casos contra tu modelo actual y contra uno pequeño, y compara acierto y coste. Si el pequeño se queda a un punto del grande a la centésima parte de precio, ya sabes qué hacer.
Y si se queda a diez puntos, también lo sabes. Eso es lo que hace útil el test.
Relacionado

