Brief IA : IIT Bombay et Adobe : rétroconception des prompts LLM à la loupe

IIT Bombay et Adobe : rétroconception des prompts LLM à la loupe

Brief IA
Tom Levy·3 min·0 vues

Des chercheurs de l'IIT Bombay et d'Adobe Research ont mis au point un modèle de langage inverse capable de reconstruire les prompts d'origine des grands modèles de langage (LLM) à partir de leur texte de sortie avec une précision quasi parfaite. Cette méthode, nommée « Prédiction du Token Précédent », fonctionne sans accès aux poids du modèle et soulève des préoccupations de sécurité pour les entreprises utilisant des systèmes basés sur des prompts.

En bref
1Des chercheurs de l'IIT Bombay et d'Adobe Research ont mis au point un modèle de langage inverse.
2Ce modèle peut reconstruire le prompt d'origine d'un LLM à partir de son texte de sortie avec une précision quasi parfaite.
3La méthode, nommée « Prédiction du Token Précédent », fonctionne sans accès aux poids du modèle.
💡Pourquoi c'est importantCette avancée pose des risques de sécurité pour les entreprises utilisant des systèmes propriétaires basés sur des prompts.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

IIT Bombay et Adobe : rétroconception des prompts LLM à la loupe

Des chercheurs de l'IIT Bombay et d'Adobe Research ont développé une méthode permettant de reconstruire les prompts utilisés pour les grands modèles de langage (LLM) avec une précision presque parfaite, en utilisant uniquement le texte de sortie. Cette approche fonctionne sans accès aux poids du modèle et s'applique même aux modèles tiers.

Les grands modèles de langage génèrent du texte en prédisant le mot suivant le plus probable, token par token. Inverser ce processus et reconstruire le prompt original à partir de la sortie a longtemps été considéré comme impraticable, car de nombreux prompts différents peuvent produire des réponses similaires.

Un nouvel article des chercheurs de l'IIT Bombay et d'Adobe Research montre que cela peut être réalisé avec une précision surprenante. Leur méthode, appelée "Prédiction du Token Précédent" (PTP), inverse le fonctionnement des modèles de langage. Au lieu de prédire le token suivant, les chercheurs entraînent un modèle de langage inverse qui prédit les tokens précédents.

Ce modèle inverse est entièrement entraîné à partir de zéro sur des données générées de manière synthétique par le LLM cible. Tout ce dont il a besoin est le texte généré.

Une seule réponse produit le prompt exact et plusieurs alternatives

Le modèle inverse peut également générer plusieurs variations de prompts avec des significations distinctes en ajustant les paramètres de décodage. Tous ces prompts reconstruits produisent des réponses similaires lorsqu'ils sont renvoyés dans le modèle de langage original.

Dans un exemple de l'article, le prompt "Comment contacter des concurrents pour connaître leurs stratégies de prix ?" a été reconstruit mot pour mot. Le modèle a également généré six variantes supplémentaires qui capturaient le sens principal mais utilisaient des formulations différentes, telles que "Quelles tactiques une entreprise cherchant à contacter des concurrents sur le marché peut-elle utiliser pour connaître sa stratégie de prix ?"

Des tests avec de véritables prompts d'utilisateurs ont également montré des reconstructions précises. Lorsque les chercheurs ont renvoyé les prompts reconstruits dans le modèle direct, les réponses correspondaient étroitement aux originales.

Pour les prompts d'utilisateurs réels, la formulation reconstruite diffère en termes de mots mais capture le cœur sémantique de l'entrée originale.

Les attaquants n'ont même pas besoin de savoir quel modèle a produit le texte

Un modèle inverse entraîné sur le petit chatbot Qwen-3-0.6B a également pu reconstruire des prompts à partir des réponses de GPT-4o. Les prompts reconstruits n'étaient pas identiques aux originaux, mais selon l'article, ils capturaient le sens et l'intention. Un attaquant potentiel n'aurait même pas besoin de savoir quel modèle a généré une sortie donnée.

Cela crée un large problème de sécurité. Les entreprises risquent d'exposer des prompts de systèmes propriétaires contenant des secrets commerciaux, des règles de modération ou des instructions spécialisées. Les utilisateurs individuels font face à une menace similaire, car des requêtes personnelles ou sensibles pourraient également être extraites de la sortie. Un petit modèle d'inversion ouvert pourrait suffire à réaliser cela.

L'article lui-même ne fait pas de revendications explicites concernant des attaques sur des systèmes commerciaux. Mais si la méthode fonctionne sur des modèles de production actuels, les laboratoires d'IA devront y remédier rapidement et corriger le problème.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires