La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Des vérifications à faible coût destinées à repérer des critiques de films générées par des modèles de langage ont marqué massivement des textes comme suspects et fait chuter l’exactitude d’un classificateur de sentiment. En parallèle, des travaux scientifiques récents estiment qu’une part notable des évaluations de conférences IA a été substantiellement modifiée par des outils comme ChatGPT, et décrivent un risque de « collapse » quand on réentraîne des modèles sur du texte synthétique.
Beaucoup de faux positifs et une exactitude en baisse après filtrage
Appliqué à l’archive non utilisée pour l’entraînement, le score combiné a signalé 444 des 594 critiques comme potentiellement écrites par une IA et 158 des 200 critiques réservées aux tests. Ces marquages restent des alertes, pas des preuves d’auteur IA. Au réglage retenu pour intercepter 80 % des textes synthétiques, la densité d’incorporation a aussi classé 47 % des références humaines comme suspectes. Et, une fois filtrées avec la moyenne des trois vérifications, les performances du classificateur de sentiment ont reculé de 67,5 % à 57,5 % sur un lot de 200 critiques séparé. Dans l’audit, 444 critiques se situent au-dessus du seuil et 150 en dessous. Les 1 394 critiques ont été notées ensemble pour permettre les comparaisons de similarité et de densité, avec des seuils recalibrés sur ce volume. Le seuil de 0,548 défini pour l’ensemble d’entraînement de 600 critiques n’a pas été réutilisé, les scores ayant été redimensionnés sur l’ensemble complet.
Trois vérifications techniques agrégées en un score d’alerte
La méthode attribue à chaque texte trois scores. La perplexité, mesurée avec GPT-2, évalue la prévisibilité des mots et une valeur faible n’est qu’un signal faible. La similarité de quasi-duplication s’appuie sur des embeddings de phrases all-MiniLM-L6-v2 pour trouver la correspondance la plus proche en sens ou en forme. La densité d’incorporation regarde la proximité moyenne avec les cinq voisins les plus proches. Les trois valeurs sont normalisées entre 0 et 1, la perplexité étant inversée, puis moyennées en un score combiné présenté comme un indicateur d’alerte et non une probabilité. Les comparaisons se font en faisant varier un seuil, en mesurant le rappel et le taux de faux positifs, avec un réglage cherchant à capter au moins 80 % des textes générés tout en limitant les signalements parmi 200 références humaines.
Un protocole sur 600 textes mêlant 200 références et 400 synthétiques
La collection de départ compte 1 000 critiques portant sur 10 films, annotées manuellement en positif ou négatif. Pour l’entraînement, 200 critiques issues de films tels que A Beautiful Mind, Amadeus, Avatar ou Clash of the Titans ont servi de références humaines, équilibrées en sentiment. Un lot de test distinct de 200 critiques, également équilibré et tiré d’autres films comme Les Misérables, Star Wars Episode I: The Phantom Menace, The Expendables I, The Godfather et The Matrix Revolutions, a été tenu à l’écart afin d’éviter toute fuite liée aux films. Deux modèles, gpt-6-astra et gpt-5-nano, ont généré 400 critiques supplémentaires, soit 100 positives et 100 négatives par modèle, à partir d’invites demandant d’inventer un film et une courte critique, sans exemples ni imitation ciblée. L’ensemble d’entraînement final rassemble 600 lignes, dont 200 sources traitées comme humaines et 400 synthétiques, et les résultats se limitent à ces modèles, invites, données et conditions d’expérience.
Des données d’origine IMDb publiées en 2019 sous licence CC BY 4.0
Le jeu 1000 Movie Reviews for Reputation Generation, mis en ligne par Abdessamad Benlahbib sur Mendeley Data le 9 mars 2019, décrit des critiques extraites d’IMDb. Publiée avant le lancement public de ChatGPT en novembre 2022, la collection a été utilisée comme référence humaine, avec la réserve que l’identité des auteurs n’est pas vérifiée texte par texte et que cette qualification repose sur la source et la date. La licence Creative Commons Attribution 4.0 International autorise la réutilisation et l’adaptation avec mention et lien, et l’usage d’un sous-ensemble n’implique aucun aval d’IMDb.
Audit élargi de l’archive et calibrage des seuils
Avant les tests ciblés, l’ensemble des 1 000 entrées a été passé au crible pour repérer les textes à allure générée, puis trois vérifications ont été appliquées à 600 critiques incluant 400 textes synthétiques à origine contrôlée. Chaque vérification a permis de compter les détections sur les synthétiques et les signalements sur les références humaines, avec mesure de l’impact sur un classificateur de sentiment. Lors du chargement des données, six doublons ont été retirés, laissant 994 critiques distinctes, dont 200 ont servi à l’entraînement et 200 au test, le solde de 594 étant conservé pour l’audit.
Dans l’évaluation scientifique, des signes d’écrits modifiés par IA
Une méthode statistique présentée à la 2024 International Conference on Machine Learning estime la part de texte substantiellement écrit ou réécrit par un modèle de langage. Appliquée à des évaluations soumises à quatre grandes conférences d’IA après le lancement de ChatGPT, elle situe cette part entre 6,5 % et 16,9 %. Ces évaluations, rédigées par des chercheurs, portent des jugements techniques ayant des effets concrets. Cette estimation reste circonscrite aux conférences et ne renseigne pas la fréquence dans d’autres contextes. Parallèlement, une étude publiée en 2024 dans Nature décrit un mode de défaillance lié au réentraînement répété sur du texte généré, avec perte d’exemples rares et resserrement des sorties.






