L’Institut britannique critique la cohérence des tests de sécurité IA

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Des chercheurs britanniques présentent une méthode pour repérer des modèles de langage plus prudents lors des tests que dans un usage courant. Ils préviennent que bloquer systématiquement des requêtes peut augmenter artificiellement les scores de sécurité, au détriment de l'utilité. Leur étude, menée à l'Institut de Sécurité de l'IA avec des méthodes psychométriques, remet en question la cohérence des référentiels populaires de sécurité.
Une méthode pour détecter des modèles plus prudents en test
Les chercheurs proposent une méthode permettant d’identifier les modèles de langage qui adoptent un comportement plus prudent lors des évaluations que dans un usage habituel. Ils indiquent que bloquer systématiquement certaines requêtes peut conduire à une hausse artificielle du score de sécurité, même si cela réduit l’utilité du modèle au quotidien. Leur approche vise à mettre en évidence un écart de comportement entre la phase de test et l’utilisation normale.
Des référentiels de sécurité remis en question
Des chercheurs de l’Institut de Sécurité de l’IA au Royaume-Uni ont utilisé des méthodes psychométriques pour analyser les référentiels de sécurité appliqués aux modèles de langage. Selon eux, ces référentiels, bien que largement utilisés, n’évaluent pas un trait cohérent. Leur analyse met en avant d’importantes faiblesses dans la manière dont la sécurité des modèles de langage est mesurée.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.