Mistral libera Shieldstral, un moderador multimodal de 3.000 millones de parámetros

Mistral libera Shieldstral, un moderador multimodal de 3.000 millones de parámetros
Fuente: mistral.ai

Mistral ha publicado Shieldstral, un clasificador de seguridad multimodal de 3.000 millones de parámetros con pesos abiertos y licencia Apache 2.0. La idea que lo diferencia: la política de moderación se escribe en lenguaje natural en el momento de la consulta, sin reentrenar el modelo para cada caso. Está en el anuncio de Mistral y descargable en Hugging Face.

Puntos clave

  • 3.000 millones de parámetros, pesos abiertos, licencia Apache 2.0.
  • Disponible como `mistralai/Shieldstral-1.0-3B` en Hugging Face.
  • Evalúa texto, imágenes y combinaciones de ambos.
  • Iguala o supera a modelos de guardarraíl abiertos de hasta siete veces su tamaño en cuatro áreas: seguridad de texto, detección de rechazos, adaptabilidad de política y seguridad multimodal.

Qué cambia respecto a un moderador clásico

Un clasificador de moderación tradicional se entrena con un conjunto fijo de categorías: violencia, odio, contenido sexual, autolesión. Si tu empresa necesita una categoría propia, hay que reentrenar o encadenar reglas por fuera.

Shieldstral lo plantea como una tarea de preguntas y respuestas. La política se le pasa como una pregunta en lenguaje llano en tiempo de inferencia, y el modelo responde. Mistral lo resume así en su anuncio: "escribes la política como una pregunta en lenguaje natural en el momento de la inferencia, y el modelo devuelve una puntuación de seguridad calibrada".

La puntuación no sale de una etiqueta, sale de leer los logits de sí y de no y calibrarlos. Eso importa en producción porque te da un número continuo con el que fijar tu propio umbral, en vez de un binario que otro decidió por ti.

Por qué 3.000 millones de parámetros es el dato

Un guardarraíl corre en cada petición. Si tu aplicación atiende 100.000 consultas al día, el moderador se ejecuta 100.000 veces o 200.000 si filtras entrada y salida.

A ese volumen, el tamaño del modelo es el coste. Un clasificador de 3.000 millones cabe en una GPU modesta y se puede desplegar dentro de tu propia infraestructura, que es la diferencia entre pagar por llamada a una API externa y pagar electricidad.

Que iguale a modelos de hasta 21.000 millones de parámetros en los benchmarks que publica Mistral es exactamente el argumento comercial. Habrá que ver cómo aguanta con políticas raras y en español, porque estos números salen de evaluaciones propias.

Dónde encaja en la estrategia de Mistral

Mistral lleva meses publicando modelos pequeños y especializados con licencia abierta en lugar de competir de frente por el modelo más grande. En julio sacó Leanstral 1.5 para demostrar teoremas y Robostral Navigate para guiar robots con una sola cámara.

El patrón es coherente con quién les paga. Empresas europeas, sector público y regulados, que necesitan correr el modelo dentro de casa y poder justificar ante un auditor qué hace y dónde. Un moderador de pesos abiertos que se despliega on-premise resuelve una casilla concreta del AI Act, que entró en vigor esta semana con capacidad sancionadora.

Por qué importa

Si tienes un producto con IA de cara al cliente, en algún momento alguien va a escribir algo que no debería llegar al modelo, o el modelo va a responder algo que no debería salir.

Hasta ahora las opciones eran pagar la moderación del propio proveedor, montar reglas frágiles o entrenar un clasificador. Un modelo abierto de 3.000 millones que acepta tu política escrita en lenguaje natural quita casi toda la fricción de la tercera opción.

El caso práctico más obvio en España: un chatbot de atención al cliente que no puede hablar de precios, de competidores ni dar consejo legal. Eso son tres frases en la política, no tres meses de trabajo. Y si el AI Act te obliga a documentar qué controles tienes, un modelo que corre en tu servidor con licencia Apache 2.0 es bastante más fácil de explicar que una llamada a una API de terceros.


Relacionado