Aller au contenu principal

Data Science & ML · L3 · Section 9/12

Éthique et interprétabilité

Progression

Points d’expérience : XPSérie de jours consécutifs : · —Progression du module : — / —compris

#Éthique et interprétabilité

Un modèle déployé influence des décisions réelles. On vérifie les biais, on mesure l'équité selon des critères explicites et on explique les prédictions autant que possible. L'interprétabilité n'est pas un supplément d'âme: c'est la condition du diagnostic, de la contestation et de l'amélioration.

#Prérequis et objectifs

Prérequis: pages « Évaluation et généralisation » (métriques par classe, calibration) et « Apprentissage supervisé » (feature importance des modèles linéaires et arborescents).

Objectifs d'apprentissage:

  • distinguer biais des données, biais de mesure et biais d'optimisation, et identifier des proxies de variables sensibles;
  • mesurer des écarts de performance par sous-groupe et les rapporter systématiquement;
  • connaître les définitions d'équité usuelles et leurs incompatibilités démontrées;
  • utiliser les outils d'interprétabilité (importances, PDP, SHAP) sans sur-interpréter leurs sorties;
  • séparer ce qu'un modèle peut légitimement affirmer (prédiction, association) de ce qu'il ne peut pas (causalité) sans hypothèses supplémentaires.

#Pourquoi c'est crucial

Biais
Les données reflètent les biais historiques
Discrimination
Impacts différenciés sur des groupes
Responsabilité
Qui répond d'une décision erronée?
Confiance
Comprendre et contester les décisions

#Sources de biais

#Biais dans les données

Les données d'entraînement sur-représentent certains groupes, reflètent des pratiques historiquement discriminatoires, ou manquent de représentativité. Exemple canonique: un outil de tri de CV entraîné sur des embauches passées où peu de femmes étaient recrutées apprend à pénaliser les candidatures féminines, non pas parce que le modèle est fautif, mais parce qu'il optimise fidèlement la mauvaise cible.

#Biais de mesure

La cible elle-même peut être un proxy biaisé du concept visé. Prédire « l'arrestation » au lieu du « crime », « la dépense de santé » au lieu du « besoin de soin » importe les distorsions de la mesure dans le modèle. C'est souvent le biais le plus insidieux: il ne se corrige pas en rééquilibrant les données, car il est dans la définition de la variable cible.

#Biais d'optimisation

Maximiser une métrique globale peut sacrifier les sous-groupes minoritaires: leur contribution au score moyen est faible, donc leurs erreurs pèsent peu dans l'optimisation. Le remède est dans l'évaluation (rapporter les métriques par groupe), pas seulement dans les données.

#Mesurer les écarts: l'audit par sous-groupe

L'audit minimal consiste à rapporter, pour chaque sous-groupe pertinent, les mêmes métriques que pour la population globale: taux d'erreur, précision, rappel, calibration. Un modèle globalement correct peut cacher un rappel de 0.4 sur un groupe et 0.9 sur un autre.

Chargement de l’éditeur...

Observation attendue: l'accuracy globale (environ 91%) masque un écart massif entre les deux groupes (environ 92% contre 78%). Le groupe minoritaire, avec 400 exemples sur 10400, ne pèse que 4% du score global: son taux d'erreur plus que quadruplé déforme à peine la moyenne. C'est précisément pourquoi un score global n'est jamais un audit.

#Définitions d'équité et leurs limites

Plusieurs définitions mathématiques coexistent, et les théorèmes d'impossibilité (Kleinberg et al.) établissent qu'on ne peut pas toutes les satisfaire simultanément, sauf dans des cas dégénérés (parité de base parfaite ou classifieur parfait).

Parité démographique: la proportion de prédictions positives est identique entre groupes. Simple à vérifier, mais peut imposer des taux d'erreur différents, et se heurte au problème des cibles légitimement différentes.

Égalité des opportunités: les taux de vrais positifs sont égaux entre groupes; version plus exigeante avec l'égalité des faux positifs (equalized odds). Pertinente quand l'accès à un bénéfice dépend de la prédiction.

Calibration par groupe: à probabilité prédite p, la fréquence observée de l'événement est p, dans chaque groupe. C'est la condition d'une décision à seuil cohérente, mais elle est incompatible avec l'égalité des taux de vrais positifs quand les distributions de scores diffèrent entre groupes.

#Interprétabilité globale et locale

#Interprétabilité globale

Comprendre quelles features structurent le modèle sur l'ensemble des données.

Importances des features: pour les modèles linéaires, coefficient standardisé; pour les forêts et gradient boosting, gain moyen des scissions. Elles indiquent ce que le modèle utilise, pas ce qui est causalement déterminant dans le monde.

Partial Dependence Plots (PDP): effet marginal moyen d'une feature sur la prédiction, les autres étant marginalisées. Lisibles pour une ou deux features; les interactions fortes les rendent trompeuses (la moyenne cache des effets opposés sur des sous-populations).

#Interprétabilité locale

Expliquer une décision individuelle: pourquoi cette demande a été refusée.

LIME: approxime le modèle autour de l'instance par un modèle simple interprétable, en perturbant l'entrée. Le résultat dépend du schéma de perturbation; instable entre exécutions.

SHAP: attribue à chaque feature une contribution à l'écart entre la prédiction et une valeur de base, en s'appuyant sur les valeurs de Shapley de la théorie des jeux. Cohérent (les contributions somment à la prédiction), mais coûteuse à calculer exactement; les implémentations arborescentes l'approchent.

pythonpython

1import shap2import xgboost3 4model = xgboost.XGBClassifier()5model.fit(X_train, y_train)6 7explainer = shap.TreeExplainer(model)8shap_values = explainer.shap_values(X_test)9 10# Vue globale: importance moyenne des contributions absolues11shap.summary_plot(shap_values, X_test)12 13# Vue locale: contributions d'une instance précise14shap.force_plot(explainer.expected_value, shap_values[0], X_test.iloc[0])

#Corrélation, prédiction, causalité

Un modèle supervisé apprend des associations conditionnelles P(y|x). Il peut prédire utilement sans rien révéler des mécanismes. Affirmer « x cause y » exige des hypothèses supplémentaires: absence de variables de confusion, temporalité plausible, mécanisme identifié, et idéalement une intervention contrôlée (expérience randomisée) ou des méthodes causales explicites (variables instrumentales, double différence, graphes causaux). Les rapports d'analyse doivent distinguer explicitement « le modèle utilise x » de « x influence y ».

#Bonnes pratiques

Auditer avant le déploiement: métriques par sous-groupe, analyse des erreurs qualitatives, revue des features utilisées à la recherche de proxies.

Documenter: model cards décrivant l'usage prévu, les données, les limites connues, les résultats d'audit. La documentation est un livrable, pas une option.

Monitorer en production: la dérive des données peut créer de nouveaux biais après un déploiement honnête; les métriques d'équité se surveillent comme la latence, voir la page « Mise en production ».

Prévoir la contestation: un canal pour demander une explication, contester une décision et obtenir une révision humaine. C'est une exigence réglementaire dans plusieurs cadres, et une source d'information précieuse sur les défaillances du modèle.

Conserver un humain dans la boucle pour les décisions à fort impact, avec les moyens d'exercer ce contrôle: un réviseur qui approuve 100% des décisions sans les examiner n'est pas un contrôle.

#Réglementation

RGPD (Europe): droit à l'explication des décisions automatisées significatives, droit à une intervention humaine, obligations sur les données personnelles.

AI Act (Europe): classification des systèmes d'IA par niveau de risque, exigences croissantes avec le risque (systèmes à haut risque: documentation, supervision humaine, qualité des données).

Secteurs régulés (crédit, assurance, santé, emploi): obligations spécifiques de transparence et de non-discrimination, avec des définitions juridiques d'équité qui peuvent différer des définitions statistiques ci-dessus.

#Exercice vérifiable: révéler un proxy

Construire un jeu de données synthétique où la variable sensible (appartenance à un groupe) n'est pas fournie au modèle, mais où une feature « code postal » en est un proxy: générez deux groupes avec des distributions de code postal disjointes à 80%, et une cible corrélée au groupe. Entraînez une régression logistique sans la variable sensible, puis mesurez l'accuracy par groupe réel (les labels de groupe sont utilisés pour l'évaluation, jamais pour l'entraînement). Corrigé attendu: l'écart d'accuracy entre groupes est net et mesurable (typiquement plusieurs points, voire davantage selon le taux de proxy), alors que la variable sensible est absente des features. Conclusion observable: l'exclusion naïve ne protège de rien; seul l'audit par sous-groupe révèle le problème, et c'est la raison pour laquelle cet audit est une étape obligatoire et non négociable du protocole.

#Quiz

Qu'est-ce que SHAP mesure pour chaque prédiction?
Qu'est-ce que SHAP mesure pour chaque prédiction?
Un modèle exclut la variable « genre » de ses features. Peut-on conclure qu'il ne peut pas discriminer?
Un modèle exclut la variable « genre » de ses features. Peut-on conclure qu'il ne peut pas discriminer?