> ## Content Index
> Fetch the complete content index at: https://www.digitalbrain.news/llms.txt
> Use this file to discover other available public pages before exploring further.

# DeepSeek lanza V4.1 Flash con 1M de contexto y una caché de 890 bytes por token
- URL: https://www.digitalbrain.news/noticias/deepseek-v4-1-flash-1m-contexto-890-bytes-kv-cache/
- Published: 2026-09-10T08:21:47.000Z
- Updated: 2026-09-10T10:36:56.000Z
- Description: DeepSeek ha lanzado V4.1 Flash, un modelo de pesos abiertos con 1 millón de tokens de contexto que reduce la caché de memoria a 890 bytes por token…
- Author: Ramón Pérez Coronado
- Tags: #noticias, deepseek, modelos-abiertos, china, modelos

[DeepSeek](https://www.digitalbrain.news/guias/que-es-deepseek/) ha lanzado V4.1 Flash, un modelo de [pesos abiertos](https://www.digitalbrain.news/glosario/#pesos) con 1 millón de [tokens](https://www.digitalbrain.news/guias/que-es-un-token-en-ia/) de contexto que reduce la caché de memoria a 890 bytes por token, [según el desglose técnico publicado hoy](https://www.marktechpost.com/2026/09/10/deepseek-ai-released-deepseek-v4-1-flash-with-1m-context-fp4-kv-cache-and-cross-layer-attention-reuse/?ref=digitalbrain.news). Es la cuarta parte de lo que consumía V4-Flash, y ahí está el titular real: no en el tamaño del modelo, sino en lo que cuesta mantenerlo pensando.

## Puntos clave

- 552.000 millones de [parámetros](https://www.digitalbrain.news/glosario/#parametros) de backbone más 196.000 millones de Engram. Solo se activan 8.000 millones por token en prefill y 16.000 millones en decode.
- Contexto de 1 millón de tokens, con caché KV global de 890 bytes por token. Frente a la primera generación de DeepSeek, es 437 veces más pequeña.
- Licencia MIT. Los pesos se descargan y se corren donde quieras.
- Terminal-Bench 2.1 en 90,6 y GPQA Diamond en 90,9\. En Codeforces marca un rating de 3.471.
- Los precios nuevos de la serie Flash arrancan hoy a las 12:00 hora de Pekín.

## Qué cambia técnicamente

El truco está en la caché. Cuando un modelo procesa una conversación larga guarda en memoria las claves y valores de cada token para no recalcularlos. Esa caché es la que revienta el coste del contexto largo: cuanto más hablas con el modelo, más RAM de [GPU](https://www.digitalbrain.news/glosario/#gpu) ocupa cada usuario.

DeepSeek ataca eso por tres vías a la vez. Guarda la caché principal en FP4 (formato E2M1, cuatro bits por número). Usa una atención de ventana deslizante de 128 tokens que ya no persiste a SSD. Y reutiliza atención entre capas con un mecanismo llamado Compressed Sparse Attention 2, con tres modos: Full, Reindex y Reuse.

La arquitectura es un encoder-decoder causal de 20 capas cada uno, con un indexador jerárquico que baraja hasta 16.384 posiciones candidatas. El [entrenamiento](https://www.digitalbrain.news/glosario/#entrenamiento) comió 45 billones de tokens multimodales en proporción 7:1 de texto frente a resto, con secuencias iniciales de 64K y otros 34 billones dedicados solo a estirar el contexto.

## Cómo se ha llegado aquí

En agosto cubrimos [el lanzamiento de V4 Pro con un millón de contexto a 0,435 dólares por millón de tokens](https://www.digitalbrain.news/noticias/deepseek-v4-pro-0813-millon-contexto-precio/). Aquel modelo era la punta de gama. Ahora DeepSeek dice que Flash lo supera en rendimiento, coste, velocidad y tiempo total tras pruebas internas y externas, y ha decidido enrutar las peticiones de V4 Pro a V4.1 Flash hasta que exista un V4.1 Pro.

Ese detalle es más importante de lo que parece. Si tienes integraciones apuntando a V4 Pro, desde hoy te responde otro modelo y se te factura a la tarifa de Flash. Nadie tiene que tocar nada, pero conviene saberlo antes de que un resultado raro te haga perder una mañana.

No hay informe técnico oficial con la suite completa de [benchmarks](https://www.digitalbrain.news/glosario/#benchmark). Las cifras que circulan vienen de la documentación de lanzamiento y de pruebas independientes tempranas, así que conviene tratarlas con la reserva habitual hasta que salgan evaluaciones de terceros.

## Por qué importa

Si estás moviendo procesos internos con IA, el contexto largo es lo que te permite meter un ERP entero, un año de correos o cincuenta contratos en una sola conversación sin trocear. El problema nunca ha sido el máximo teórico, sino lo que cuesta llegar ahí.

890 bytes por token cambia esa cuenta. Un contexto de 1 millón de tokens ocupa unos 890 MB de caché por sesión, frente a los varios gigas que exigían generaciones anteriores. En una máquina con 80 GB de VRAM eso es la diferencia entre atender a unos pocos usuarios simultáneos o a decenas.

Y viene con licencia MIT. Para una empresa española que no quiere mandar sus datos a una API americana, un modelo de este nivel corriendo on-premise deja de ser un experimento de laboratorio. Sigue haciendo falta hardware serio, pero ya no hace falta un centro de datos.

Fuente original: [marktechpost.com](https://www.marktechpost.com/2026/09/10/deepseek-ai-released-deepseek-v4-1-flash-with-1m-context-fp4-kv-cache-and-cross-layer-attention-reuse/?ref=digitalbrain.news)

---

**Relacionado**

[![Los grupos de hackers chinos doblan su volumen de ataques desde que usan DeepSeek](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/08/hackers-chinos-deepseek-doble-ataques-teamt5.jpg)Los grupos de hackers chinos doblan su volumen de ataques desde que usan DeepSeek](https://www.digitalbrain.news/noticias/hackers-chinos-deepseek-doble-ataques-teamt5/)[![Qwen3.8-27B corre en Cerebras a unos 1.500 tokens por segundo](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/09/qwen-3-8-27b-cerebras-1500-tokens-segundo.png)Qwen3.8-27B corre en Cerebras a unos 1.500 tokens por segundo](https://www.digitalbrain.news/noticias/qwen-3-8-27b-cerebras-1500-tokens-segundo/)[![Nvidia cae del 87% al 75% del mercado de chips de IA en dos años](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/09/nvidia-87-a-75-por-ciento-mercado-chips-ia.png)Nvidia cae del 87% al 75% del mercado de chips de IA en dos años](https://www.digitalbrain.news/noticias/nvidia-87-a-75-por-ciento-mercado-chips-ia/)