Snowflake manda cada tarea al modelo más barato que la resuelva y dice ganar 3 veces en eficiencia por token

Snowflake manda cada tarea al modelo más barato que la resuelva y dice ganar 3 veces en eficiencia por token
Imagen: Scott Rodgerson / Unsplash

Snowflake ha añadido enrutado dinámico de modelos a su Cortex AI Gateway y a sus productos principales. La idea cabe en una frase: que cada tarea la atienda el modelo más barato capaz de resolverla.

Los números internos que da la compañía son los que dan la medida del desperdicio actual.

Los dos tests

En sus evaluaciones, los agentes que construían una tubería de datos con dbt usando enrutado dinámico consiguieron hasta 3 veces más eficiencia por token que la ruta de solo modelo frontera. Sin pérdida de calidad.

En el segundo test, ingenieros completaron el mismo número de cambios de código con un 25% más de eficiencia por token.

Tres veces y 25% son cifras muy distintas, y esa diferencia es la información útil. El ahorro no es un porcentaje fijo: depende de qué proporción de las tareas de tu flujo son realmente difíciles. Una tubería de datos tiene muchísimo trabajo mecánico. Escribir código para un pull request, bastante menos.

Baris Gultekin, vicepresidente de IA de Snowflake, lo enmarca así: "La IA empresarial va hacia un mundo donde las compañías pueden recurrir a la mejor inteligencia disponible para cada tarea sin tener que gestionar ellas el panorama de modelos".

La ventaja que no sale en los titulares

Hay un segundo beneficio, menos vistoso y probablemente más valioso a un año vista: no tener que reconstruir tus agentes y aplicaciones cada vez que quieres cambiar de modelo.

Cualquiera que tenga algo en producción desde 2024 sabe de qué va esto. Cada salida de modelo nuevo abre la misma pregunta: ¿migro? Y migrar significa volver a probar prompts, volver a ajustar formatos de salida, volver a medir. Cuando el ecosistema saca modelos cada mes, ese trabajo se come el tiempo del equipo.

Una capa de enrutado convierte esa migración en un cambio de configuración. Es la misma razón por la que Stripe ha pagado miles de millones por OpenRouter, como se ve en [su carta a inversores de esta semana](/stripe-carta-inversores-singularidad-enero/).

Todo el mundo a la vez

Snowflake no está sola. NVIDIA sacó la semana pasada NeMo Switchyard, una librería de código abierto para enrutado inteligente dentro de las herramientas de agentes más usadas. Replit acaba de poner [un modelo barato por defecto en sus planes de pago](/replit-free-mode-gpt-5-6-luna/).

Tres movimientos en siete días, desde tres posiciones distintas del mercado, atacando lo mismo. Cuando eso pasa no es casualidad: es que el problema ha llegado a la factura de suficiente gente.

Lo que un operador puede hacer sin comprar nada

El enrutado como producto es útil si ya vives dentro de Snowflake o de una plataforma que lo ofrezca. Si no, la palanca sigue estando disponible y es más aburrida de lo que parece.

Coge los logs de tus llamadas a modelos del último mes y responde a tres preguntas:

1. Qué porcentaje de llamadas son clasificación, extracción o resumen corto. Esas casi nunca necesitan modelo frontera. 2. Cuánto cuesta cada uno de esos grupos. No en tokens, en euros. El número en euros es el que mueve conversaciones. 3. Qué pasa si mueves el grupo barato a un modelo pequeño. Se prueba con 200 casos y se compara la salida. Media tarde.

En los montajes que he revisado este año, el reparto suele ser parecido: entre el 60% y el 75% de las llamadas son trabajo rutinario apuntando al modelo caro porque un día se configuró así.

Nadie lo cambia porque no duele lo suficiente para ser prioridad y porque hay que medir antes. Medir es la parte que se salta todo el mundo, y es la única que convierte una intuición en una decisión.


Relacionado