✨︎ Resumen (TL;DR):
- Mistral publicó Shieldstral 1.0, un clasificador multimodal que evalúa texto e imágenes con políticas escritas en lenguaje natural.
- El modelo obtuvo 84.9% de F1 promedio en seguridad de texto, empatado con GPT-OSS-Safeguard de 20B.
- Sus pesos están bajo Apache 2.0 y la configuración BF16 cabe, según Mistral, en una GPU NVIDIA de 16 GB; el lanzamiento sigue en vista previa pública.
Mistral lanzó el 4 de agosto de 2026 Shieldstral 1.0, un clasificador multimodal de seguridad que revisa texto e imágenes según políticas escritas en lenguaje natural. El diseño permite cambiar esos criterios sin reentrenar el modelo y, según la compañía, la configuración BF16 cabe en una sola GPU NVIDIA de 16 GB. La versión pública sigue en vista previa.

La política se separa del modelo principal
Shieldstral es un clasificador multimodal de seguridad que calcula si un contenido cumple una política concreta. Mistral lo construyó sobre Ministral-3B-Base-2512 y añadió el codificador visual de Pixtral.
El nombre comercial lo ubica en la clase de 3B, pero la ficha técnica oficial registra 3.8 mil millones de parámetros activos. Mistral recomienda una ventana de contexto de 32,000 tokens.
Al separar la política de seguridad del modelo principal, el sistema permite ajustar las reglas según el producto, la audiencia o el contexto. La aplicación no tiene que modificar el clasificador cada vez que cambia el criterio que quiere evaluar.
El formato de entrada usa tres bloques:
<Instruct>fija el contexto de la evaluación, el nivel de tolerancia y, cuando hace falta, la definición de contenido inseguro.<Query>formula una sola pregunta que puede responderse con sí o no, por ejemplo, si el contenido promueve violencia física.<Document>contiene el prompt, la respuesta, la conversación completa, una imagen o una combinación de imagen y texto.
Shieldstral lee las probabilidades de los tokens yes y no, las convierte en una puntuación continua y decide con un umbral predeterminado de 0.5. El operador puede ajustar ese corte para su producto.
En este lanzamiento, multimodal significa texto e imágenes. Mistral no anuncia clasificación de audio o video.
El empate con un modelo de 20B necesita contexto
El reporte técnico evaluó Shieldstral en 16 benchmarks, 21 particiones y frente a 10 modelos de referencia. Sus autores afirman que todas las muestras de evaluación quedaron fuera del entrenamiento.
Los tres resultados agregados que sostienen el anuncio son:
- Seguridad de texto: 84.9% de F1 promedio, empatado con GPT-OSS-Safeguard de 20B.
- Clasificación multimodal: 83.8% de F1, por encima del 77.6% de OmniGuard de 7B. Shieldstral lideró dos de los tres benchmarks visuales.
- Adaptación a políticas nuevas: 91.3% de F1. GPT-OSS-Safeguard quedó por delante con 94.1%.
El F1 combina precisión y exhaustividad, también llamada recall, en una sola medida. Sirve para comparar clasificadores cuando importa tanto evitar falsos positivos como detectar contenido dañino. Por sí solo, no equivale a una garantía de seguridad en producción.
Shieldstral tampoco ganó cada prueba. En su benchmark homónimo, LlavaGuard de 7B obtuvo 81.4%, frente al 72.0% de Shieldstral. Además, el modelo de 20B que empató el promedio de seguridad de texto superó al sistema de Mistral en la evaluación de políticas nuevas.
El tamaño no equivale a ahorro automático
La comparación de hasta 7 veces enfrenta clases nominales de parámetros, 3B frente a 20B. No mide velocidad, costo ni consumo energético. La documentación técnica de Mistral registra 3.8B parámetros activos para Shieldstral, por lo que el tamaño nominal tampoco debe leerse como una promesa de ahorro.
La salida de un solo token apunta a una inferencia más liviana que la de clasificadores que generan una cadena de razonamiento antes del veredicto. El paper señala esa diferencia, pero no publica una tabla comparativa de latencia, solicitudes por segundo, consumo energético o costo.
Con los datos disponibles, la ventaja de tamaño no puede convertirse en una promesa equivalente de ahorro operativo.
54.1 millones de ejemplos para seguir reglas nuevas
Mistral atribuye buena parte del resultado a una colección de aproximadamente 54.1 millones de muestras con taxonomías y formatos distintos:
- 45.2 millones proceden de conjuntos de texto de fuentes abiertas.
- 4.4 millones son muestras sintéticas de texto creadas por contraste.
- 4.5 millones combinan información visual y textual.
El entrenamiento no se limitó a mostrar ejemplos seguros e inseguros. El equipo tomó una misma pieza de contenido y la enfrentó a preguntas cercanas, pero distintas.
Una muestra podía violar una regla sobre violencia y, al mismo tiempo, funcionar como caso negativo para otra sobre fraude. La estrategia obligó al clasificador a atender la regla solicitada, en lugar de aprender una etiqueta general de peligro.
Para comprobar si podía trabajar con políticas desconocidas, los investigadores separaron la taxonomía de entrenamiento, con 73 categorías finales, de otra taxonomía de evaluación con 52. También utilizaron modelos y semillas diferentes para generar y revisar esa prueba.
La separación reduce el riesgo de que Shieldstral solo memorice nombres de categorías, aunque la evaluación adaptativa sigue dependiendo de datos sintéticos producidos y verificados con otros modelos.
Shieldstral alcanza 87.8% de F1 en español
El apéndice del paper ofrece un desglose por idioma de los benchmarks multilingües PolyGuard y RTP-LX. En español, Shieldstral alcanzó 86.8% de F1 al clasificar prompts y 87.8% al clasificar respuestas. En esta última tarea empató el resultado de GPT-OSS-Safeguard de 20B.
El dato puede ser útil para productos dirigidos a usuarios hispanohablantes, pero no certifica el mismo rendimiento ante jerga regional, códigos mezclados, políticas legales específicas o ataques diseñados para una aplicación concreta.
Mistral reconoce varios límites en la tarjeta del modelo:
- La confiabilidad cambia entre idiomas y dominios con representación desigual en los datos.
- Los conjuntos públicos y sintéticos conservan sesgos y ruido de etiquetado pese a los filtros aplicados.
- El texto codificado, transliterado u ofuscado puede reducir la precisión.
- Los documentos muy largos también pueden degradar el resultado.
El modelo admite en teoría hasta 256,000 tokens, pero Mistral lo entrenó con secuencias de hasta 32,000 y recomienda mantenerse dentro de ese rango.
Pesos Apache 2.0 para despliegue local
Mistral publicó los pesos para uso comercial y no comercial bajo Apache 2.0. Los equipos pueden descargarlos desde Hugging Face, modificarlos, afinarlos y ejecutar el clasificador en su propia infraestructura.
La tarjeta oficial incluye rutas para vLLM, llama.cpp y Transformers. La configuración BF16 cabe, según la empresa, en una sola GPU NVIDIA de 16 GB.
El despliegue local puede resultar útil cuando los prompts, las respuestas o las imágenes contienen información sensible que una empresa no quiere enviar a un servicio externo. También permite actualizar una regla escribiendo otra pregunta, en vez de preparar un nuevo ciclo de entrenamiento.
Shieldstral clasifica el contenido, pero la aplicación decide qué hacer con su puntuación. Cada implementación todavía tiene que calibrar sus umbrales, medir falsos positivos y falsos negativos, registrar decisiones y probar ataques propios en cada idioma.
Los pesos abiertos facilitan que terceros examinen esas fronteras. Aun así, el lanzamiento sigue en vista previa pública y el estudio apareció como preprint en arXiv el 28 de julio. Mistral no acompaña el lanzamiento con una revisión por pares ni con una reproducción independiente.
Por ahora, 84.9%, 83.8% y 91.3% son resultados reportados por el equipo que creó Shieldstral, no una garantía de producción. El trabajo pendiente queda en cada implementación: calibrar sus políticas, medir sus errores y probar ataques propios por idioma.
