DeepSeek ha puesto en beta pública la API de V4-Flash con la build 0731, y el resultado incomoda a su propio catálogo: el modelo pequeño supera al grande en las nueve pruebas de agente y código que la compañía ha publicado. Todo eso con 13.000 millones de parámetros activos por token, frente a los 284.000 millones totales, y licencia MIT.
Puntos clave
- Beta pública de la API el 31 de julio de 2026, build V4-Flash-0731.
- 284.000 millones de parámetros totales, 13.000 millones activos por token, ventana de un millón de tokens, licencia MIT.
- El cambio es post-entrenamiento, no arquitectura: la estructura es la misma de la preview.
- Terminal Bench 2.1: 82,7 frente a los 72,1 de V4-Pro-Preview.
- DeepSWE: 54,4 frente a 7,3 de la preview, la mayor subida de todas.
Qué significa que el cambio sea post-entrenamiento
Este es el dato que hay que entender para no leer mal la noticia. DeepSeek no ha entrenado un modelo nuevo. Ha cogido el mismo modelo base y le ha dado otra vuelta de post-entrenamiento, la fase en la que se ajusta el comportamiento con ejemplos y refuerzo.
Y el salto es brutal precisamente donde más se nota: tareas largas con herramientas. DeepSWE pasa de 7,3 a 54,4. Un modelo que antes se perdía a los pocos pasos de una tarea de programación real ahora la termina en más de la mitad de los casos.
Ese patrón dice algo incómodo sobre cómo leemos los benchmarks. Un modelo con la misma arquitectura y los mismos pesos base puede pasar de inutilizable a competente en tareas de agente solo con mejor post-entrenamiento. La capacidad estaba ahí; lo que faltaba era enseñarle a usarla sin descarrilar.
Por qué el pequeño gana al grande
V4-Pro-Preview es el modelo grande de la casa y sigue perdiendo en las nueve pruebas publicadas. La explicación más probable es de calendario: la Pro sigue en preview, con el post-entrenamiento antiguo, mientras que la Flash acaba de recibir el nuevo. Cuando DeepSeek actualice la Pro con la misma receta, lo lógico es que vuelva a adelantar.
Mientras tanto, para quien esté decidiendo qué poner en producción hoy, el resultado es el que es: el modelo barato hace mejor el trabajo agéntico que el caro. Con 13.000 millones de parámetros activos, el coste por petición y la latencia juegan en otra liga.
Dónde encaja DeepSeek ahora
La compañía viene de un semestre movido. En julio negociaba 1.500 millones a una valoración de 71.000 y apuntaba a salida a bolsa. Y el 31 de julio contamos que construye un centro de datos de un gigavatio en Mongolia Interior.
La licencia MIT es la constante en todo esto. DeepSeek sigue publicando pesos con la licencia más permisiva que existe mientras los laboratorios estadounidenses cierran los suyos. Para una empresa europea que quiera correr el modelo en su propia infraestructura, ese detalle vale más que tres puntos de benchmark.
Por qué importa
Si estás montando agentes que hacen tareas largas (revisar 200 facturas, cruzar un catálogo, reescribir código en varios ficheros), lo que te frena no suele ser la inteligencia del modelo. Es que a los veinte pasos se despista, se inventa un dato o repite lo que ya hizo.
Una subida de 7,3 a 54,4 en DeepSWE es exactamente una mejora en eso. Y viene con licencia MIT y con precios de modelo pequeño.
El consejo práctico: antes de cambiar tu stack por esto, monta una prueba con tus propias tareas. Los benchmarks de agente miden tareas de laboratorio; tu proceso tiene casuísticas que ninguna prueba pública contempla. En una empresa de cierto tamaño, validar una skill nueva no es cuestión de días. Son semanas de ejecución real hasta que aparecen los casos raros. Ahí es donde se ve si un modelo aguanta o no.
Relacionado


