Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Une équipe distincte a réussi à faire extraire par Grok des conversations et d'autres informations personnelles en cachant des ordres malveillants. L'exposition perdurait au moment de la publication, alors que xAI avait été prévenu en juin. Ce scénario survient après un cas similaire touchant Microsoft 365 Copilot plus tôt dans la semaine.
Face aux injections, les LLM exécutent des ordres cachés et misent sur des garde-fous
Les injections de prompt tirent parti de la propension des modèles à répondre aux requêtes des utilisateurs dès qu'ils le peuvent. Des attaquants glissent ainsi des instructions malveillantes dans des e-mails ou des pages web que l'assistant doit résumer. Les modèles ne différencient pas de manière fiable ce contenu d'instructions tapées directement par l'utilisateur et obéissent à ces consignes cachées. À ce jour, la seule parade décrite pour Grok et d'autres assistants repose sur des garde-fous chargés de repérer ces ordres suspects et d'en bloquer l'exécution.
Sur Grok, l'exfiltration persiste malgré un signalement à xAI en juin
Au moment de la publication, Grok continuait à divulguer des données alors que xAI avait été informé en juin. Une équipe distincte a conçu une attaque qui force le modèle, détenu par Elon Musk et opéré par xAI, à extraire des discussions d'utilisateur et d'autres informations personnelles. L'exfiltration survient lorsque des instructions malveillantes sont chiffrées, au moyen d'une astuce présentée comme très simple.
Microsoft 365 Copilot a connu un précédent plus tôt cette semaine
Plus tôt dans la semaine, des chercheurs ont détaillé une attaque contre Microsoft 365 Copilot pour les entreprises. Elle reposait sur une entrée secrète fournie par l'assistant et a permis d'extraire un mot de passe trouvé dans la boîte de réception de l'utilisateur.




