Aller au contenu principal

Data Science & ML · L3 · Section 8/12

Régularisation et sélection

Progression

Points d’expérience : XPSérie de jours consécutifs : · —Progression du module : — / —compris

#Régularisation et sélection de modèles

La régularisation pénalise la complexité pour améliorer la généralisation: L2 lisse, L1 raréfie, et l'early stopping arrête l'entraînement avant sur-apprentissage. La sélection de modèles confronte plusieurs familles et hyperparamètres avec un protocole de validation commun, puis fige les choix avant de mesurer sur le test. La validation croisée imbriquée aide à estimer honnêtement la performance quand l'échantillon est limité.

Documenter les choix, les métriques et les ressources utilisées permet de reproduire les résultats et d'éviter les conclusions hâtives. Un bon dossier d'expérience raconte l'itération autant que le résultat final.

#Prérequis et objectifs

Prérequis: page « Apprentissage supervisé » (sur-apprentissage, validation croisée), page « Évaluation et généralisation » (biais-variance, intervalles de confiance), régression linéaire (moindres carrés).

Objectifs d'apprentissage:

  • prédire l'effet d'une pénalité L1 ou L2 sur les coefficients et choisir celle qui correspond au besoin (sélection contre lissage);
  • régler un hyperparamètre par validation croisée sans faire fuiter le test dans le choix;
  • estimer honnêtement la performance d'un protocole complet de sélection (validation croisée imbriquée);
  • documenter une expérience de sorte qu'un tiers puisse la reproduire.

#Animation: choisir et régler la pénalisation

Biais/variance
Complexité contre sur-apprentissage
L2 (ridge)
Coefficients lissés; tous non-nuls
L1 (lasso)
Sparsité; sélection de variables
Early stopping
Arrêter au minimum de validation
Sélection
Validation croisée / imbriquée

#L2 contre L1: deux pénalités, deux effets

La pénalité L2 ajoute λΣβ² au critère d'ajustement: elle rétracte tous les coefficients vers zéro sans jamais les annuler exactement. Le modèle reste dense, mais stable dans les directions collinéaires: deux features corrélées se partagent le poids au lieu de le monopoliser. C'est le remède des features redondantes.

La pénalité L1 ajoute λΣ|β|: la géométrie du losange pousse certains coefficients exactement à zéro. Le modèle devient parcimonieux et interprétable, mais instable en sélection: deux features fortement corrélées, c'est l'une ou l'autre qui survit selon l'échantillon. Le L1 sert à sélectionner, pas à stabiliser.

Le paramètre λ n'est pas un réglage esthétique: trop faible, il ne fait rien; trop fort, il écrase le signal (biais élevé). Il se règle par validation croisée, uniquement sur le train et la validation.

#Playground: la pente ridge en forme fermée

En une dimension, la ridge admet une solution exacte, ce qui rend l'effet de λ lisible sans boîte noire.

Chargement de l’éditeur...

Observation attendue: la pente estimée vaut environ 2.98 pour λ=0 (proche de la vraie valeur 3). Pour λ=100, elle est rétractée d'environ un quart; pour λ=1000, elle est écrasée vers zéro. λ contrôle le retrait (shrinkage): il réduit la variance de l'estimation au prix d'un biais croissant, matérialisation la plus simple du compromis biais-variance.

#Early stopping comme régularisation

Arrêter l'entraînement lorsque la loss de validation cesse de décroître équivaut à une régularisation: on limite le nombre d'étapes effectives d'ajustement, donc la complexité atteinte. C'est la régularisation par excellence des réseaux de neurones et du gradient boosting: gratuite, avec un critère objectif. Deux précautions: conserver les poids de la meilleure époque (pas de la dernière), et réserver un jeu de validation distinct du test final, faute de quoi l'arrêt devient une sélection sur le test.

#Sélection de modèles: le protocole compte plus que le critère

Sélectionner, c'est choisir une famille, une architecture et des hyperparamètres. Le protocole sain:

  1. Fixer la métrique principale et les contraintes (coût d'inférence, interprétabilité) avant toute expérience.
  2. Définir une grille raisonnable d'hyperparamètres, pas une exploration au fil de l'eau.
  3. Comparer tous les candidats par la même validation croisée sur le train (folds identiques).
  4. Choisir le champion sur la moyenne, en vérifiant que l'écart avec le dauphin dépasse la demi-largeur de l'intervalle de confiance.
  5. Réentraîner sur train + validation, puis mesurer une fois sur le test.

Le point 5 appelle une vigilance: le score de test d'un modèle sélectionné par CV est légèrement optimiste, car les hyperparamètres ont été choisis sur les mêmes folds qui mesurent la performance. Corrigé de référence: la validation croisée imbriquée, avec une boucle interne de sélection et une boucle externe d'évaluation, estime sans biais ce que vaut le protocole complet (sélection comprise). Elle coûte plus de calcul; elle est indispensable quand l'échantillon est petit et que la décision est importante.

#Playground: régler λ par validation croisée

Chargement de l’éditeur...

Lecture des résultats: pour un léger bruit gaussien, la MSE CV reste plate autour du minimum sur une plage de λ puis remonte quand le biais domine (la colonne « biais pente » s'écarte de zéro dans le même temps). À l'inverse, λ=0 reste optimal ici parce qu'une seule feature ne présente aucun risque de variance élevée. C'est le point pédagogique: la régularisation aide quand la variance domine (nombreuses features, collinéarité, peu de données), pas quand le modèle est déjà bien spécifié.

#Documenter les expériences

Une expérience reproductible documente: la version des données (hash ou commit), le code exact (versionné), la graine aléatoire, la procédure de validation (folds, stratification), toutes les configurations essayées (y compris celles qui ont échoué, sinon l'histoire du protocole est faussée), et la définition des métriques. Un carnet d'expériences, fût-il un simple tableau, évite la sélection invraisemblable après coup et rend l'analyse d'un tiers possible.

#Exercice vérifiable: la sélection au fil de l'eau biaise le test

Protocole à observer: reprenez le playground de sélection de λ. Boucle A (honnête): sélectionnez λ par K-fold interne, puis évaluez sur les 30 derniers points (test). Boucle B (déloyale): pour chaque λ de la grille, évaluez directement sur ces mêmes 30 points, et ne retenez que le λ qui minimise l'erreur de test. Corrigé: la boucle B affiche une erreur inférieure ou égale à la boucle A par construction, mais si l'on répète l'expérience sur d'autres tirages (changer la graine), son avantage disparaît ou s'inverse: c'est un biais de sélection, pas un meilleur modèle. Conclusion observable: le « test » de la boucle B n'est plus un test; sa valeur est celle d'une validation déguisée.

#Quiz

Vos features sont fortement corrélées entre elles et les coefficients oscillent d'un fold à l'autre. Quelle pénalité stabilise le mieux?
Vos features sont fortement corrélées entre elles et les coefficients oscillent d'un fold à l'autre. Quelle pénalité stabilise le mieux?
Vous réglez vos hyperparamètres en regardant directement le score du jeu de test. Que mesure ce score?
Vous réglez vos hyperparamètres en regardant directement le score du jeu de test. Que mesure ce score?