Brief IA : SHAP, LIME et Integrated Gradients pour expliquer vos modèles

SHAP, LIME et Integrated Gradients pour expliquer vos modèles

Brief IA
Tom Levy·4 min·2 vues

SHAP, LIME et Integrated Gradients sont des techniques d'interprétabilité appliquées à un modèle de désabonnement, permettant de fournir des explications locales et globales. Ces approches, confrontées sur des données synthétiques, répondent aux exigences de transparence imposées par l'article 13 de la loi européenne sur l'IA, qui stipule que l'interprétabilité est désormais une obligation pour de nombreux systèmes d'IA.

En bref
1SHAP, LIME et Integrated Gradients sont appliqués à un modèle de désabonnement entraîné sur des données synthétiques dont les facteurs réels sont connus.
2Le cadre inclut un arbre à gradient renforcé et un réseau neuronal, un client de référence identique et un environnement Python explicitement listé.
3L’approche répond aux limites des importances traditionnelles et s’inscrit dans l’exigence de transparence portée par la réglementation européenne.
💡Pourquoi c'est importantL'interprétabilité devient une obligation pour de nombreux systèmes d'IA, et ces techniques permettent de comparer directement leurs explications sur un même cas concret.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Des explications locales et globales deviennent indispensables avec l'article 13 de la loi européenne sur l’IA. Trois approches — SHAP, LIME et Integrated Gradients — sont confrontées au même modèle de désabonnement, entraîné sur des données synthétiques contrôlées, afin de comparer leurs apports sans changer de terrain de jeu.

SHAP fournit des explications locales et globales, version 0.52.0 au 28 mai 2026

SHAP délivre des explications globales et locales en s’appuyant sur la contribution marginale moyenne de chaque caractéristique, issue de la théorie des jeux coopératifs. La bibliothèque est indiquée en version 0.52.0, publiée le 28 mai 2026, et est présentée comme largement adoptée pour l’interprétabilité. L’objectif partagé avec LIME et Integrated Gradients est de rendre intelligibles des modèles autrement considérés comme des boîtes noires. Ces approches répondent à trois limites combinées des pratiques usuelles : absence d’explication locale, biais de calcul des importances et manque de couverture pour d’autres familles de modèles.

Transparence exigée et différence entre global et local

L’article 13 de la réglementation européenne sur l’IA impose que, pour les systèmes à haut risque, les déployeurs puissent réellement interpréter les résultats. L’enjeu dépasse la seule précision prédictive et devient une condition de mise en service pour un nombre croissant de systèmes. L’interprétabilité se décline en deux niveaux : global, pour comprendre quelles caractéristiques comptent en moyenne et dans quel sens, et local, pour expliquer une prédiction donnée. Un modèle peut offrir une lecture globale cohérente tout en demeurant opaque pour un cas individuel, comme lorsqu’un client avec cinq ans d’ancienneté est classé à risque sans justification accessible.

L’attribution d’importance rapide privilégie la hiérarchie des variables

L’usage courant des attributs d’importance comme .feature_importances_ dans des modèles d’ensemble scikit-learn, ou l’examen direct des coefficients dans un modèle linéaire, permet d’obtenir rapidement une hiérarchie des variables. Dans le cas du désabonnement, la durée occupe la première place, suivie par le tarif mensuel, le nombre de tickets de support, le type de contrat puis les paiements en retard. Toutefois, cette méthode demeure purement globale, tend à privilégier excessivement les variables à forte cardinalité et n’est disponible que pour les modèles qui proposent cet attribut. Elle ne s’applique pas aux réseaux neuronaux, aux ensembles hétérogènes ni aux API boîtes noires.

Un banc d’essai contrôlé pour comparer les explications

Un fichier partagé construit un jeu synthétique de désabonnement et entraîne un arbre à gradient renforcé, également accompagné d’un petit réseau neuronal sur les mêmes données pour comparer les techniques. Le générateur aléatoire est initialisé avec la graine 42 et la cohorte compte 2000 individus. Les variables comprennent une ancienneté en mois entre 1 et 72, un tarif mensuel tiré d’une normale de moyenne 70 et écart type 25 tronquée entre 15 et 200, des tickets de support suivant une loi de Poisson de paramètre 1.5, un indicateur binaire de contrat mensuel, et des retards de paiement de Poisson de paramètre 0.8. La probabilité de désabonnement provient d’un modèle logistique avec un intercept de -1.5 et des coefficients de -0.04 pour l’ancienneté, +0.015 pour le tarif, +0.35 pour les tickets, +1.1 pour le contrat mensuel et +0.25 pour les retards de paiement, le tout passé par une sigmoïde, puis seuillé via un tirage uniforme. Les données sont scindées avec un test_size de 0.2 et un random_state 42, et un GradientBoostingClassifier avec random_state 42 est entraîné. Du bruit aléatoire est injecté afin d’éviter un signal trop propre, et la connaissance préalable des moteurs de désabonnement sert de référence pour apprécier la plausibilité des explications. À l’exécution, une précision de test de 0.698 est rapportée, pour un taux moyen de désabonnement de 36.8%. Un même client de référence, X_test.iloc[0], avec 53 mois d’ancienneté et 5 tickets récents, est utilisé pour les trois méthodes afin de comparer les explications sur un cas identique.

Environnement et dépendances pour reproduire les résultats

La reproduction s’effectue avec Python 3.11 ou supérieur. Les dépendances à installer incluent shap, lime, scikit-learn, pandas, numpy, torch et captum. Les scripts affichent les métriques de précision d’entraînement et de test au format trois décimales, ainsi que le taux moyen de désabonnement, pour vérifier le bon déroulement de l’entraînement.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires