La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Des explications locales et globales deviennent indispensables avec l'article 13 de la loi européenne sur l’IA. Trois approches — SHAP, LIME et Integrated Gradients — sont confrontées au même modèle de désabonnement, entraîné sur des données synthétiques contrôlées, afin de comparer leurs apports sans changer de terrain de jeu.
SHAP fournit des explications locales et globales, version 0.52.0 au 28 mai 2026
SHAP délivre des explications globales et locales en s’appuyant sur la contribution marginale moyenne de chaque caractéristique, issue de la théorie des jeux coopératifs. La bibliothèque est indiquée en version 0.52.0, publiée le 28 mai 2026, et est présentée comme largement adoptée pour l’interprétabilité. L’objectif partagé avec LIME et Integrated Gradients est de rendre intelligibles des modèles autrement considérés comme des boîtes noires. Ces approches répondent à trois limites combinées des pratiques usuelles : absence d’explication locale, biais de calcul des importances et manque de couverture pour d’autres familles de modèles.
Transparence exigée et différence entre global et local
L’article 13 de la réglementation européenne sur l’IA impose que, pour les systèmes à haut risque, les déployeurs puissent réellement interpréter les résultats. L’enjeu dépasse la seule précision prédictive et devient une condition de mise en service pour un nombre croissant de systèmes. L’interprétabilité se décline en deux niveaux : global, pour comprendre quelles caractéristiques comptent en moyenne et dans quel sens, et local, pour expliquer une prédiction donnée. Un modèle peut offrir une lecture globale cohérente tout en demeurant opaque pour un cas individuel, comme lorsqu’un client avec cinq ans d’ancienneté est classé à risque sans justification accessible.
L’attribution d’importance rapide privilégie la hiérarchie des variables
L’usage courant des attributs d’importance comme .feature_importances_ dans des modèles d’ensemble scikit-learn, ou l’examen direct des coefficients dans un modèle linéaire, permet d’obtenir rapidement une hiérarchie des variables. Dans le cas du désabonnement, la durée occupe la première place, suivie par le tarif mensuel, le nombre de tickets de support, le type de contrat puis les paiements en retard. Toutefois, cette méthode demeure purement globale, tend à privilégier excessivement les variables à forte cardinalité et n’est disponible que pour les modèles qui proposent cet attribut. Elle ne s’applique pas aux réseaux neuronaux, aux ensembles hétérogènes ni aux API boîtes noires.
Un banc d’essai contrôlé pour comparer les explications
Un fichier partagé construit un jeu synthétique de désabonnement et entraîne un arbre à gradient renforcé, également accompagné d’un petit réseau neuronal sur les mêmes données pour comparer les techniques. Le générateur aléatoire est initialisé avec la graine 42 et la cohorte compte 2000 individus. Les variables comprennent une ancienneté en mois entre 1 et 72, un tarif mensuel tiré d’une normale de moyenne 70 et écart type 25 tronquée entre 15 et 200, des tickets de support suivant une loi de Poisson de paramètre 1.5, un indicateur binaire de contrat mensuel, et des retards de paiement de Poisson de paramètre 0.8. La probabilité de désabonnement provient d’un modèle logistique avec un intercept de -1.5 et des coefficients de -0.04 pour l’ancienneté, +0.015 pour le tarif, +0.35 pour les tickets, +1.1 pour le contrat mensuel et +0.25 pour les retards de paiement, le tout passé par une sigmoïde, puis seuillé via un tirage uniforme. Les données sont scindées avec un test_size de 0.2 et un random_state 42, et un GradientBoostingClassifier avec random_state 42 est entraîné. Du bruit aléatoire est injecté afin d’éviter un signal trop propre, et la connaissance préalable des moteurs de désabonnement sert de référence pour apprécier la plausibilité des explications. À l’exécution, une précision de test de 0.698 est rapportée, pour un taux moyen de désabonnement de 36.8%. Un même client de référence, X_test.iloc[0], avec 53 mois d’ancienneté et 5 tickets récents, est utilisé pour les trois méthodes afin de comparer les explications sur un cas identique.
Environnement et dépendances pour reproduire les résultats
La reproduction s’effectue avec Python 3.11 ou supérieur. Les dépendances à installer incluent shap, lime, scikit-learn, pandas, numpy, torch et captum. Les scripts affichent les métriques de précision d’entraînement et de test au format trois décimales, ainsi que le taux moyen de désabonnement, pour vérifier le bon déroulement de l’entraînement.


