Mistral Large 4: 1,05 billones de parámetros y pesos abiertos

Mistral Large 4
Imagen: Mistral AI

Mistral ha lanzado hoy Mistral Large 4, su modelo más grande hasta la fecha: 1,05 billones de parámetros, de los que trabajan 49.000 millones en cada respuesta, y pesos abiertos que llegarán a finales de octubre. Desde este 6 de octubre se puede probar en preview por API, según el anuncio oficial de Mistral.

La empresa francesa lo vende como el mejor modelo de pesos abiertos hecho fuera de China. Y lo apoya en cifras de ciberseguridad, programación y trabajo de oficina que, si se confirman cuando se publiquen los pesos, ponen a Europa otra vez en la conversación de los modelos grandes.

Puntos clave de Mistral Large 4

  • Tamaño: 1,05 billones de parámetros totales y 49.000 millones activos, con un codificador de visión de 1.600 millones. Ventana de contexto de 1 millón de tokens (ficha técnica).
  • Disponibilidad: preview pública por API desde hoy en Mistral Studio. Los pesos, "a finales de mes".
  • Precio de lista: 1,36 dólares por millón de tokens de entrada, 0,14 en caché y 4,18 de salida.
  • Dónde se entrenó: desde cero, en 3.800 GPU Nvidia Grace Blackwell de los centros de datos propios de Mistral en Europa.

¿Mistral Large 4 es de código abierto?

Será de pesos abiertos, que no es exactamente lo mismo. Podrás descargar el modelo y ejecutarlo en tus servidores cuando Mistral lo publique a finales de octubre, pero hoy solo existe la versión por API.

Mistral explica el retraso: durante estas semanas está sometiendo el modelo a pruebas de ataque (lo que en el sector se llama red-teaming) con responsables de ciberseguridad, socios verificados y autoridades estatales. Esos grupos usan el mismo modelo con menos moderación y capacidades de ciberseguridad ampliadas. El anuncio no detalla todavía bajo qué licencia saldrán los pesos.

Qué hay dentro del modelo

Large 4 es un modelo de mezcla de expertos (MoE, por sus siglas en inglés): en lugar de activar todo el cerebro para cada palabra, enruta cada parte de la tarea a un subconjunto de "expertos". Por eso tiene más de un billón de parámetros, pero cada respuesta mueve solo 49.000 millones. Eso abarata la inferencia frente a un modelo denso del mismo tamaño.

Es multimodal de origen, así que entiende imágenes, gráficos y documentos además de texto. Junta en un solo modelo la parte de instrucciones, la de razonamiento y la de agentes que usan herramientas. Y habla más de 160 idiomas, incluidas todas las lenguas oficiales de la Unión Europea, que para una empresa española con clientes en varios países es un detalle práctico.

Mistral dice que lo entrenó con el mismo entorno de entrenamiento y aprendizaje por refuerzo que ofrece a sus clientes en Mistral Forge. También cuenta que la fase de refuerzo sigue en marcha, a unos 33.000 millones de tokens generados al día, y que el modelo "no muestra signos de saturación". Traducido: la versión que pruebas hoy no es la final.

Las cifras que publica Mistral

Todas estas cifras salen del propio anuncio. Algunas las midieron terceros (Artificial Analysis, vals.ai, Surge AI, Lakera), pero ninguna está replicada todavía de forma independiente con el modelo abierto.

Ciberseguridad. Es donde Mistral más presume. En el Cyber Index de Artificial Analysis, Large 4 queda entre los cinco mejores modelos del mundo. En la prueba de reproducir una vulnerabilidad real de software libre y luego parchearla saca un 82%, la nota más alta de todos los modelos. Mistral añade un dato incómodo para la competencia: Claude Opus 5.5 y GPT-6 Astra sacan casi cero en esa prueba porque se niegan a hacerla. En Cybench, 40 retos de competiciones de seguridad, resuelve el 93%.

Programación. 61,7% en DeepSWE v1.1, 59,4% en SWE-Atlas-QnA y 28,3% en Terminal-Bench 4. En una evaluación ciega con programadores profesionales, quedó segundo de cinco modelos (3,74 sobre 5), por delante de Kimi K3 y GLM-5.3, y por detrás de Claude Opus 5 (4,22).

Trabajo de oficina. En AutomationBench, 657 flujos de trabajo con Gmail, Google Sheets, Slack y Salesforce, saca un 59,9%. Según las evaluaciones de vals.ai, supera a GPT-6 Astra en tareas legales y financieras. En el benchmark legal de Harvey supera a todos los modelos abiertos.

Visión. En localizar objetos en imágenes densas (Dense 200) supera por la mínima a GPT-6 Astra: 42% frente a 41%.

Ojo con leer esto como "Mistral ya está al nivel de Claude u OpenAI". En la evaluación ciega de código, el propio dato de Mistral le deja casi medio punto por debajo de Claude Opus 5. Su terreno es el de los modelos abiertos, donde compite con DeepSeek, Qwen, Kimi y GLM, todos chinos.

Cómo probar Mistral Large 4

Hoy solo se puede usar por API. Los pasos, según la documentación oficial:

1. Entra en Mistral Studio, la consola de desarrolladores de Mistral, y crea una cuenta o inicia sesión. 2. Abre el playground desde la ficha del modelo ("Try in playground") y elige `mistral-large-4`. 3. Si quieres integrarlo en tus herramientas, genera una clave de API y llama a `/v1/chat/completions` con el modelo `mistral-large-4`. Admite salidas estructuradas, llamadas a funciones, preguntas sobre documentos y procesamiento por lotes.

La parte europea

Mistral insiste en el ángulo de soberanía. El modelo se ha entrenado y se sirve en su propia infraestructura en Europa, y habrá un despliegue europeo que Mistral opera de principio a fin, "bajo la ley europea" e independiente de otros proveedores digitales.

Large 4 es además el primer resultado de la ronda Serie D de 3.000 millones de euros que Mistral cerró en septiembre, liderada por Samsung. La empresa dice que ese dinero ya está ampliando su capacidad de cómputo y que el modelo servirá de base para una nueva generación de modelos especializados por sector.

Por qué importa

Para una empresa española que usa Claude o ChatGPT en sus procesos, Large 4 no es un sustituto directo. Es una alternativa seria en tres casos concretos.

El primero, datos que no pueden salir de casa: con pesos abiertos, lo montas en tu nube privada o en tus servidores y nadie más ve lo que procesas. El segundo, equipos de seguridad que hoy chocan con las negativas de los modelos cerrados cuando analizan malware o prueban vulnerabilidades propias. El tercero, quien necesite que el proveedor esté sujeto a la ley europea.

Yo lo probaría ya por API con una tarea real (un análisis de documentos, una hoja de cálculo complicada) y compararía coste y resultado con lo que uses hoy. Y esperaría a finales de mes, con los pesos y la licencia publicados, antes de plantear cualquier despliegue propio.

Fuente original: mistral.ai


Relacionado