IIT Bombay et Adobe : rétroconception des prompts LLM à la loupe

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
IIT Bombay et Adobe : rétroconception des prompts LLM à la loupe
Des chercheurs de l'IIT Bombay et d'Adobe Research ont développé une méthode permettant de reconstruire les prompts utilisés pour les grands modèles de langage (LLM) avec une précision presque parfaite, en utilisant uniquement le texte de sortie. Cette approche fonctionne sans accès aux poids du modèle et s'applique même aux modèles tiers.
Les grands modèles de langage génèrent du texte en prédisant le mot suivant le plus probable, token par token. Inverser ce processus et reconstruire le prompt original à partir de la sortie a longtemps été considéré comme impraticable, car de nombreux prompts différents peuvent produire des réponses similaires.
Un nouvel article des chercheurs de l'IIT Bombay et d'Adobe Research montre que cela peut être réalisé avec une précision surprenante. Leur méthode, appelée "Prédiction du Token Précédent" (PTP), inverse le fonctionnement des modèles de langage. Au lieu de prédire le token suivant, les chercheurs entraînent un modèle de langage inverse qui prédit les tokens précédents.
Ce modèle inverse est entièrement entraîné à partir de zéro sur des données générées de manière synthétique par le LLM cible. Tout ce dont il a besoin est le texte généré.
Une seule réponse produit le prompt exact et plusieurs alternatives
Le modèle inverse peut également générer plusieurs variations de prompts avec des significations distinctes en ajustant les paramètres de décodage. Tous ces prompts reconstruits produisent des réponses similaires lorsqu'ils sont renvoyés dans le modèle de langage original.
Dans un exemple de l'article, le prompt "Comment contacter des concurrents pour connaître leurs stratégies de prix ?" a été reconstruit mot pour mot. Le modèle a également généré six variantes supplémentaires qui capturaient le sens principal mais utilisaient des formulations différentes, telles que "Quelles tactiques une entreprise cherchant à contacter des concurrents sur le marché peut-elle utiliser pour connaître sa stratégie de prix ?"
Des tests avec de véritables prompts d'utilisateurs ont également montré des reconstructions précises. Lorsque les chercheurs ont renvoyé les prompts reconstruits dans le modèle direct, les réponses correspondaient étroitement aux originales.
Pour les prompts d'utilisateurs réels, la formulation reconstruite diffère en termes de mots mais capture le cœur sémantique de l'entrée originale.
Les attaquants n'ont même pas besoin de savoir quel modèle a produit le texte
Un modèle inverse entraîné sur le petit chatbot Qwen-3-0.6B a également pu reconstruire des prompts à partir des réponses de GPT-4o. Les prompts reconstruits n'étaient pas identiques aux originaux, mais selon l'article, ils capturaient le sens et l'intention. Un attaquant potentiel n'aurait même pas besoin de savoir quel modèle a généré une sortie donnée.
Cela crée un large problème de sécurité. Les entreprises risquent d'exposer des prompts de systèmes propriétaires contenant des secrets commerciaux, des règles de modération ou des instructions spécialisées. Les utilisateurs individuels font face à une menace similaire, car des requêtes personnelles ou sensibles pourraient également être extraites de la sortie. Un petit modèle d'inversion ouvert pourrait suffire à réaliser cela.
L'article lui-même ne fait pas de revendications explicites concernant des attaques sur des systèmes commerciaux. Mais si la méthode fonctionne sur des modèles de production actuels, les laboratoires d'IA devront y remédier rapidement et corriger le problème.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.