DeepSeek-V4-Flash rinde al nivel de Claude Opus 4.8 y cobra 0,28 dólares por millón de tokens de salida frente a los 25 dólares del modelo de Anthropic. Son casi noventa veces menos por un rendimiento comparable, y esa brecha es la que está tirando de los precios de todo el sector hacia abajo, según recoge Axios. La condición para que siga bajando es una sola.
Puntos clave
- 0,28 dólares por millón de tokens de salida en DeepSeek-V4-Flash frente a 25 dólares en Claude Opus 4.8.
- Zack Kass, exresponsable de expansión comercial de OpenAI, llama a esto rendimientos decrecientes del modelo.
- OpenAI bajó precios de GPT-5.6 Luna y Terra la semana pasada. Google sacó una familia de modelos más eficientes este mes.
- Brian Armstrong, consejero delegado de Coinbase, contó en junio que su empresa mantuvo plano el gasto en IA mientras subía el uso, gracias al enrutado de modelos. Citó GLM 5.2 y Kimi 2.7 como los que le ahorran.
- Microsoft estudia añadir DeepSeek V4 a Copilot Cowork como opción barata.
Qué significa rendimientos decrecientes aquí
El argumento de Kass es que cualquier modelo puntero de hoy redacta un correo o monta una presentación igual de bien. Si tu tarea es esa, pagar prima por rendimiento de frontera dejó de tener sentido.
La prima sigue justificada arriba, en problemas genuinamente complejos: razonamiento largo, código que toca sistemas de verdad, análisis con muchos pasos encadenados. Pero ese es un porcentaje pequeño del volumen real de una empresa.
Ahí es donde muerde el precio chino. No hace falta que DeepSeek gane en los benchmarks difíciles. Le basta con empatar en los fáciles, que son el 80% de las llamadas.
Quién ya lo está aplicando
Coinbase es el caso más útil porque tiene número. Armstrong contó en junio que el gasto en IA se mantuvo plano mientras el uso subía, y la técnica fue el enrutado de modelos: mandar cada tarea al modelo más barato que la resuelva.
Es la misma idea que están metiendo los productos por dentro. Cursor lleva semanas afinando enjambres donde un modelo caro planifica y los baratos ejecutan, y acaba de anunciar un recorte del 30% en consumo de tokens.
Que Microsoft se plantee meter DeepSeek en Copilot es la señal más fuerte. Una empresa que ha invertido decenas de miles de millones en OpenAI valorando añadir un modelo chino como opción barata dice bastante sobre dónde está la presión.
La condición que lo sostiene todo
La commoditización asume que los modelos baratos siguen el ritmo. Si un laboratorio de frontera se despega de verdad en capacidad, la prima vuelve al día siguiente.
Y con la cadencia actual de lanzamientos, ese despegue puede pasar cualquier semana. OpenAI acaba de enseñar diez resultados matemáticos con Astra, un modelo que aún no se puede contratar, aunque un matemático de Anthropic dice haber reproducido la mitad con Claude público en 24 horas.
Esa discusión es exactamente el tema. Si la ventaja del modelo caro es real y persistente, los precios se estabilizan. Si cada avance se replica en un día con un modelo más barato, la caída sigue.
Por qué importa
Para una empresa española que ya tiene procesos corriendo sobre IA, esto es dinero contante.
La acción concreta es auditar en qué modelo corre cada tarea. Casi todo el mundo que empezó hace un año lo dejó todo en el modelo bueno porque era lo simple, y ahí sigue. Clasificar correos, extraer datos de una factura, resumir una llamada o etiquetar productos no necesita el modelo de frontera.
El ejercicio útil: coge las cinco tareas de más volumen, mira cuánto te cuesta cada una al mes y prueba la más repetitiva con un modelo diez veces más barato. Si la calidad aguanta, ya has recortado. Si no aguanta, lo sabes en una tarde y no has perdido nada.
Y no firmes contratos anuales de IA a precio fijo ahora mismo. En un mercado que cae así, el precio de dentro de seis meses va a ser mejor que el de hoy.
Relacionado


