Portal, de Spotify, recorta un 90% el gasto de tokens en Claude Code

Portal, de Spotify, recorta un 90% el gasto de tokens en Claude Code
Fuente: engineering.atspotify.com

Spotify ha publicado Portal, un sistema que reparte el trabajo de Claude Code entre modelos de distinto precio y que, según su equipo de ingeniería, recorta un 90% el consumo de tokens. El código está abierto en GitHub y se instala desde el marketplace de plugins de Claude Code.

Puntos clave

  • Portal ejecuta AiKA Modes, agentes declarativos que corren en infraestructura efímera, al estilo de una función Lambda.
  • Dos modos de partida: bulk-reader, que se lleva las lecturas de ficheros por encima de 350 líneas (umbral configurable), y code-writer, que genera boilerplate, tests y configuración siguiendo los patrones del repositorio.
  • En los ejemplos el modelo de trabajo es Gemini 2.5 Flash, pero acepta cualquiera que configures.
  • Se integra con Claude Code a través de hooks PreToolUse y admite herramientas MCP asociadas a cada modo.
  • Spotify cifra el gasto actual en tokens entre 200 y 500 dólares al mes por desarrollador, con casos que pasan de 2.000.

La idea, en una frase

El modelo caro decide y el modelo barato ejecuta.

Cuando Claude Code va a leer un fichero de 800 líneas, ese trabajo no requiere el mejor modelo del mercado: requiere leer. Portal intercepta la llamada con un hook, se la pasa a un modelo rápido y barato, y devuelve el resultado al agente principal.

Lo mismo con la generación repetitiva. Escribir el enésimo test siguiendo el patrón que ya existe en el repositorio es una tarea mecánica. El modelo caro se reserva para la arquitectura, el diseño y el razonamiento sobre el problema.

Instalación

Son tres comandos y un setup:

claude plugin marketplace add spotify/portal-ai-plugins
claude plugin install portal@portal
claude plugin install shunt@portal

Después se lanza `/portal:setup` dentro de Claude Code. Los plugins están en el repositorio público `spotify/portal-ai-plugins`.

El número que hay que mirar con cabeza

El 90% es un dato de un ingeniero de Spotify sobre su propio flujo de trabajo. No es un benchmark independiente ni una media de equipo.

Y tiene sentido que sea alto en ese contexto concreto: si buena parte de tu consumo se va en leer ficheros grandes de un monorepo enorme (y Spotify tiene uno de los monorepos más grandes que existen), delegar esas lecturas se lleva la mayor parte del gasto por delante.

En un repositorio pequeño el ahorro será mucho menor, porque las lecturas pesan poco en el total. La forma honesta de saberlo es medir antes y después en tu propio proyecto.

Por qué esto sale ahora

El coste de las herramientas de código con IA se ha convertido en una línea real de presupuesto. Spotify proyecta que para 2028 el gasto en IA para programar supere el salario medio de un desarrollador.

Los proveedores llevan meses apretando por el otro lado. A finales de agosto contamos que Claude Code baja un 17% los límites semanales desde el 14 de septiembre, y en agosto que añadió una casilla para continuar solo en cuanto se reinicia el límite.

Cuando los límites se estrechan, la optimización deja de ser un ejercicio de elegancia y pasa a ser la diferencia entre llegar al viernes con presupuesto o no.

Por qué importa

Si tu equipo usa Claude Code, Cursor o cualquier agente de código, este es el patrón que conviene copiar aunque no uses Portal.

La idea general es el enrutamiento por tipo de tarea: identifica qué llamadas son mecánicas (leer, resumir, generar repetitivo) y mándalas a un modelo barato. Guarda el modelo caro para razonar. Con eso solo, sin plugin ninguno, ya se recorta bastante.

La segunda lectura es de gestión. Entre 200 y 500 dólares al mes por desarrollador, con picos de 2.000, es una cifra que a partir de diez personas se nota en la cuenta de resultados. Si nadie en tu empresa está mirando ese consumo desglosado por persona y por tarea, empieza por ahí antes de tocar nada técnico.

Fuente original: engineering.atspotify.com


Relacionado