⚖️Éthique
Red teaming
Red Teaming
Définition
Le red teaming consiste à attaquer délibérément un modèle d'IA pour découvrir ses failles avant qu'elles ne soient exploitées : biais, jailbreaks, fuites de données, comportements dangereux. Des équipes dédiées (humaines ou automatisées) tentent de « casser » le modèle. C'est une étape clé avant le lancement d'un modèle grand public.
Exemple concret
💡 Avant de publier un modèle, OpenAI et Anthropic font appel à des red teamers chargés de provoquer des réponses problématiques pour les corriger.
Termes liés
Questions fréquentes
Qu'est-ce que Red teaming en intelligence artificielle ?
Le red teaming consiste à attaquer délibérément un modèle d'IA pour découvrir ses failles avant qu'elles ne soient exploitées : biais, jailbreaks, fuites de données, comportements dangereux. Des équipes dédiées (humaines ou automatisées) tentent de « casser » le modèle. C'est une étape clé avant le lancement d'un modèle grand public.
À quoi sert Red teaming ?
Avant de publier un modèle, OpenAI et Anthropic font appel à des red teamers chargés de provoquer des réponses problématiques pour les corriger.
Quels sont les concepts liés à Red teaming ?
Les concepts liés à Red teaming incluent : Jailbreak, Sûreté de l'IA, Guardrails, Alignement IA. Retrouvez chaque définition dans le glossaire IA de Brief IA.
📬 Newsletter gratuite
Ne rate rien de l'actu IA
Reçois chaque soir les 7 meilleures actus IA, décryptées en 5 min. Gratuit.