Data Science & ML · L3 · Section 7/12
Évaluation et généralisation
Progression
#Évaluation et généralisation
Une évaluation honnête sépare entraînement, validation et test. On choisit des métriques adaptées au problème: MSE/MAE en régression; accuracy, précision, rappel, F1 ou AUC en classification, selon les coûts d'erreur. La validation croisée mesure la stabilité du modèle et sert à régler les hyperparamètres sans « manger » le jeu de test final. La calibration vérifie que les probabilités prédites s'alignent avec les fréquences observées.
Le biais-variance n'est pas une formule: c'est une boussole. Un modèle trop simple échoue à capturer la structure (biais élevé). Un modèle trop flexible s'ajuste au bruit (variance élevée). La bonne complexité généralise le mieux sur des données nouvelles. En production, les distributions évoluent; surveillez les dérives et planifiez le réentraînement.
#Prérequis et objectifs
Prérequis: pages « Pipeline et features » et « Apprentissage supervisé » du module (split, scaling, familles de modèles), probabilités conditionnelles du module « Probabilités et statistiques ».
Objectifs d'apprentissage:
- dérouler le protocole split / validation / test sans jamais faire fuiter d'information du test vers l'entraînement;
- choisir une métrique principale à partir des coûts d'erreur métier, et connaître ses pièges (accuracy sur classes déséquilibrées, MSE vs MAE, AUC illisible côté métier);
- estimer un intervalle de confiance autour d'un score au lieu d'un point isolé;
- reconnaître sur-apprentissage et sous-apprentissage sur l'écart train/validation;
- vérifier la calibration des probabilités avant toute décision à seuil.
#Animation: pipeline d'évaluation sans fuite
Séparez vos données en trois ensembles. Le test reste scellé jusqu'à la fin; la validation sert aux itérations.
#Démonstration: holdout et validation croisée
Observation attendue: le holdout donne un chiffre unique, qui dépend du découpage tiré au sort; le K-fold renvoie la moyenne sur cinq découpages et, surtout, la dispersion des folds. Un modèle à 0.86 avec des folds entre 0.83 et 0.88 est mieux caractérisé qu'un modèle à 0.87 connu par un seul split.
#Incertitude: un score sans intervalle n'est pas un résultat
Un score de test est une moyenne sur n engagements indépendants, pas une constante. L'intervalle de confiance binomial approché est simple à énoncer: pour une accuracy p sur n exemples, l'écart-type de l'estimation vaut environ racine(p(1-p)/n). À p=0.85 et n=200: 0.025, soit un 95% CI d'environ ±5 points. Conséquence directe: une amélioration de 1 point sur un test de 200 exemples est bien dans le bruit, et choisir entre deux modèles sur cet écart revient à lire du bruit.
Sur des données corrélées (mêmes utilisateurs en double, séries temporelles), l'incertitude réelle est plus large que la formule: regroupez par utilisateur ou par période avant toute agrégation, sous peine de croire à des gains qui n'existent pas.
#Choisir la métrique principale
La métrique encode le coût métier. En binaire: si les faux négatifs sont graves (dépistage médical), on surveille le rappel; si les faux positifs sont graves (modération automatique), la précision. Le F1 est le compromis harmonique des deux, utile quand aucun des deux coûts ne domine.
L'AUC mesure le pouvoir de séparation indépendamment du seuil; excellente pour comparer des modèles, peu actionnable seule: on ne déploie pas une AUC, on déploie un modèle avec un seuil. La courbe précision-rappel est plus informative que la ROC quand la classe positive est rare.
En régression: MAE en unités d'origine, robuste aux outliers; MSE/RMSE pénalise les grandes erreurs au carré; MAPE en pourcentage, mais explose près de zéro et privilégie les sous-prévisions.
#Calibration des probabilités
Un modèle peut ordonner correctement les exemples (bonne AUC) tout en prédisant des probabilités fausses: 0.9 quand la fréquence réelle des positifs à ce score est 0.6. La fiabilité se vérifie par bins: grouper les prédictions par tranche de probabilité, comparer la moyenne prédite à la fréquence observée. Une courbe de calibration qui colle à la diagonale est prédictible et actionnable; un modèle mal calibré fausse tout raisonnement en coût espéré, même avec une bonne AUC. La calibration (Platt, isotone, ou température pour les réseaux) s'ajuste sur un jeu de calibration distinct de celui qui a servi au seuil.
#Dérive et dégradation en production
Un score de test fige un instant T; les données de production évoluent. Deux dérives à distinguer: la dérive de features (les entrées changent de distribution) et la dérive de concept (la relation entrée-sortie change). La première se surveille sans labels (tests de distribution sur les features entrantes); la seconde exige les labels retardés et une fenêtre de référence honnête (comparaison à une période comparable, pas à la semaine d'entraînement). Le protocole de réentraînement se définit avant la mise en production: fréquence, fenêtre de données, validation hors-ligne obligatoire avant promotion.
#Exercice vérifiable: mesurer la variance d'un score
Dans le playground, la fonction kfold renvoie les folds individuels. Ajoutez le calcul de l'intervalle: écart-type des folds divisé par racine de K, multiplié par 1.96 pour un 95% CI approximatif, et affichez l'accuracy sous la forme « moyenne ± demi-largeur ». Corrigé attendu: avec les valeurs par défaut, la moyenne des 5 folds est proche de 0.85-0.87, avec une demi-largeur de l'ordre de 0.02 à 0.04 selon le tirage. Deuxième partie: relancez le kfold en changeant uniquement la graine (random.seed(1) avant appel); la moyenne bouge. Conclusion observable: la variation entre graines et la demi-largeur du CI donnent l'échelle des écarts qu'il est légitime de considérer comme significatifs; tout gain inférieur à cette échelle n'est pas démontré.
#Erreurs fréquentes
Fuite de données: normalisation, imputation, PCA ou target encoding ajustés sur l'ensemble complet avant split. Chaque transformation s'ajuste sur le train, idéalement dans un Pipeline.
Sélection sur le test: itérer « jusqu'à ce que le test monte » transforme le test en validation; le score final est biaisé vers le haut d'une amplitude mal connue mais systématique.
Mélange d'observations dépendantes: mêmes utilisateurs, mêmes patients, mêmes périodes répartis entre train et test. Le modèle reconnaît l'empreinte du groupe au lieu d'apprendre la tâche. Regroupez par entité ou par temps.
Comparaison sur métriques multiples décidées après coup: choisir la métrique qui arrange le modèle retenu est une sélection déguisée. La métrique principale se fixe avant les expériences, les autres sont secondaires.