La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Le filigrane appliqué aux textes générés par modèle ajuste la probabilité des tokens afin d'inscrire une signature statistique vérifiable. Sa détection peut se ramener à un test de z-score avec une clé. Malgré cela, des opérations comme le paraphrasage ou la traduction peuvent l'affaiblir ou l'effacer, ce qui en fait un outil de mesure circonscrit pour les plateformes plutôt qu'un détecteur universel.
Des attaques affaiblissent ou détruisent le filigrane
Le filigrane de texte est un outil de mesure limité mais utile pour les plateformes, et ne constitue pas un détecteur universel d'IA. Sa robustesse face à des attaquants déterminés a un plafond théorique. Plusieurs transformations peuvent détruire ou affaiblir le signal : le paraphrasage, la traduction, le mélange de sources et des manipulations de tokenisation. Ces attaques réduisent la fiabilité d'une détection binaire et limitent l'usage du filigrane à des contextes contrôlés.
Le filigrane actif biaise l'échantillonnage token par token
Dans les systèmes qui l'emploient, le filigrane repose sur un biaisage de l'échantillonnage des tokens à chaque étape de génération, afin d'inscrire une signature statistique. La méthode classique de la « liste verte » partitionne le vocabulaire à chaque étape via un hachage du token précédent combiné à une clé secrète, puis ajoute un delta aux logits des tokens favorisés. La détection se ramène alors à un test de z-score comparable à une expérience pile ou face, et ne nécessite que la clé et le texte. Les compromis sont gouvernés par les paramètres delta et gamma : un biais trop fort nuit à la qualité du texte comme à la marquabilité. Des variantes sans distorsion existent, qui préservent la distribution tout en encodant un signal de corrélation. Le schéma précis ne peut pas être déduit de manière fiable des seules sorties, du fait d'une imprévisibilité de type cryptographique.
Les idées reçues sur les caractères invisibles et classificateurs
Des explications répandues citent des caractères Unicode invisibles, des espaces de largeur zéro, un vocabulaire imposé ou des classificateurs de style pour identifier l'IA. Certaines de ces techniques existent, mais pour d'autres usages. Aucune ne correspond au mécanisme employé par les systèmes qui filigranent réellement le texte, et un simple passage par un éditeur sans enrichissement contournerait ces marquages superficiels.






