Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Mistral : le modèle Shieldstral redéfinit la sécurité IA
Le modèle ouvert Shieldstral de Mistral, avec 3 milliards de paramètres, rivalise avec des modèles de sécurité beaucoup plus volumineux tout en étant bien plus léger. Selon un nouvel article, il est proposé de remplacer les catégories de sécurité fixes par des questions oui ou non que les opérateurs peuvent définir en temps réel sans avoir à réentraîner le classificateur.
Mistral affirme que Shieldstral égalise les modèles trois fois plus grands sur des benchmarks de sécurité textuelle standard et établit un nouveau record pour la classification conjointe de texte et d'image.
Des règles en temps réel pour personnaliser les vérifications de sécurité
De nombreux modèles de sécurité trient le contenu à l'aide de taxonomies fixes. Les auteurs de l'article, dont le co-fondateur de Mistral, Guillaume Lample, soulignent deux problèmes avec cette approche :
- Les ensembles de données de sécurité publique regroupent les risques de manière trop disparate pour soutenir une taxonomie commune.
- Les mêmes règles ne conviennent pas à tous les cas d'utilisation. Par exemple, un contenu adapté à un outil de cybersécurité pourrait être nuisible sur une plateforme de santé mentale.
Les opérateurs définissent les critères de révision en langage clair. Shieldstral renvoie un jeton, qui produit un score de sécurité compris entre zéro et un.
Des données synthétiques pour gérer de nouvelles règles
Les chercheurs ont combiné environ 54,1 millions d'exemples couvrant la sécurité, le contenu nuisible et les tentatives de manipulation dans un format unique. Ils ont appliqué des normes strictes pour la manipulation ciblée, des normes modérées pour les données de sécurité générales et des normes plus souples pour la qualité des réponses.
Chaque exemple d'entraînement comprend des instructions de tâche, une question spécifique oui ou non, et le contenu à examiner. La réponse est un seul jeton.
Pour enseigner à Shieldstral des distinctions plus fines, l'équipe a utilisé un autre modèle de langage pour réécrire du texte sûr en variantes dangereuses. Chaque exemple incluait également une catégorie similaire mais différente qui devait être rejetée, ce qui a permis au modèle de séparer des règles étroitement liées plutôt que de faire un jugement large de sécurité ou d'insécurité.
Les auteurs ont créé les catégories de test d'adaptabilité séparément de l'ensemble d'entraînement, en utilisant des noms et des niveaux de détail différents. Aucune des catégories de test détaillées ne correspond directement à une catégorie d'entraînement, bien que 10 des 12 classes plus larges aient des équivalents approximatifs.
Le modèle 3B rivalise avec un modèle presque sept fois plus grand
Sur les benchmarks textuels combinés, Shieldstral affiche un score F1 de 84,9 %. Le score F1 combine la précision et le rappel en une seule métrique, 100 % représentant un score parfait. Ce résultat égalise celui de GPT-OSS-Safeguard-20B, qui est environ sept fois plus grand, et surpasse Qwen3Guard-8B à 84,0 %, Nemotron-3.5-Safety-4B à 83,3 %, et LlamaGuard-4-12B à 69,1 %.
Pour les images et les combinaisons texte-image, Shieldstral obtient 83,8 %, devant OmniGuard-7B à 77,6 % et LlavaGuard-7B à 71,6 %.
Sur les benchmarks textuels, Shieldstral égalise un modèle OpenAI environ sept fois plus grand.
Performances d'adaptabilité
GPT-OSS-Safeguard-20B mène le benchmark d'adaptabilité avec 94,1 %, contre 91,3 % pour Shieldstral. Ce test utilise des règles qui diffèrent des catégories d'entraînement ou qui sont entièrement nouvelles. Les auteurs considèrent cependant que Shieldstral est plus pratique que GPT-OSS-Safeguard-20B et Nemotron-3.5-Safety, car ces derniers génèrent de longues séquences de raisonnement intermédiaire qui augmentent les coûts de calcul, tandis que Shieldstral renvoie un seul mot.
Sur des politiques absentes de l'entraînement, Shieldstral est à la traîne par rapport aux deux modèles qui génèrent un raisonnement intermédiaire avant de répondre.
Une approche basée sur le modèle Ministral-3B
Shieldstral est basé sur le Ministral-3B de Mistral avec l'encodeur de vision Pixtral. Dans un test de validation avec des catégories détaillées, les données de catégorie synthétiques ont augmenté le score F1 de 23,3 points de pourcentage, ce que les chercheurs estiment être le principal moteur de la capacité d'adaptation du modèle aux nouvelles règles.
Shieldstral est disponible en tant que modèle à poids ouverts sous la licence Apache 2.0.
Des règles personnalisées pour limiter les erreurs de filtrage coûteuses
Les classificateurs de sécurité se situent de chaque côté du modèle de langage principal, filtrant les demandes avant traitement et les réponses avant qu'elles n'atteignent les utilisateurs. Les opérateurs peuvent mettre à jour ces règles sans réentraîner le modèle principal. Cependant, comme chaque demande passe par le classificateur, sa taille, sa vitesse et son coût s'accumulent rapidement.
Le Claude Fable 5 d'Anthropic a montré comment des filtres mal réglés peuvent affecter l'utilisation réelle. Une analyse artificielle a révélé que le système a automatiquement redirigé 8 à 9 % des tâches vers un modèle plus faible. Un physicien médical a qualifié Fable 5 d'inutilisable car son travail inclut souvent le mot "nucléaire". D'autres utilisateurs ont signalé que le système avait signalé l'analyse IRM comme du bioterrorisme.
Anthropic a resserré le filtre après avoir identifié un problème de sécurité et affirme qu'il a depuis bloqué plus souvent des tâches de codage inoffensives. Shieldstral donne aux opérateurs plus de contrôle sur ce compromis. Ils peuvent rédiger des critères de filtrage en temps réel et adapter le filtre à une application spécifique au lieu d'adopter les catégories de quelqu'un d'autre.
Ces classificateurs jouent déjà un rôle croissant dans l'industrie. OpenAI les utilise pour la détection automatique de l'âge dans ChatGPT et dirige les demandes émotionnelles à travers un filtre de sécurité vers des modèles plus stricts. Claude Code utilise un classificateur pour bloquer les scripts externes, les déploiements de production et les poussées forcées. La révision de Fable 5 d'Anthropic exige également que l'entreprise stocke les entrées et les sorties pendant jusqu'à 30 jours, ou jusqu'à deux ans après des violations de règles.



