Aller au contenu principal

Data Science & ML · L3 · Section 12/12

Ressources

Progression

Points d’expérience : XPSérie de jours consécutifs : · —Progression du module : — / —compris

#Ressources — Data Science & Machine Learning

Pourquoi ces ressources: le module a insisté sur la rigueur de protocole; la suite consiste à pratiquer sur des données réelles, avec des références qui traitent l'évaluation aussi sérieusement que les algorithmes. Comment s'en servir: choisir un jeu de données, écrire le protocole AVANT la première expérience, et tenir le carnet d'expériences à jour à chaque itération.

#Références

  • Scikit-learn, documentation officielle: les sections « Model evaluation », « Pipeline » et « Metrics » sont la source de référence des protocoles du module.
  • Kaggle Learn (cours gratuits, pratiques): introductions guidées aux mêmes thèmes, avec notebooks exécutables.
  • « The Elements of Statistical Learning » (Hastie, Tibshirani, Friedman): la référence théorique; chapitres 7 (validation croisée) et 3 (régression régularisée) prolongent directement les pages du module.
  • « Feature Engineering for Machine Learning » (Zheng, Casari) et « Designing Machine Learning Systems » (Hug, 2022): la première pour la partie features, la seconde pour la mise en production et le réentraînement.
  • Google's Machine Learning Crash Course + « Rules of Machine Learning » (Martin Zinkevich): protocoles, pièges de mesure, bonnes pratiques de mise en production.
  • Papers With Code, section « Time Series »: état de l'art et jeux de données pour les séries temporelles, avec les précautions de split temporel rappelées dans le module.

#Jeux de données pour pratiquer

  • Titanic et House Prices (Kaggle): classiques pour dérouler un pipeline complet; attention, les leaderboards publics souffrent de sur-apprentissage sur le test: traitez-les comme des exercices, pas comme des preuves.
  • OpenML: des milliers de jeux avec métadonnées, API Python (openml), pratique pour la comparaison de protocoles.
  • Datasets de scikit-learn (fetch_openml): intégrés au workflow, versionnés, adaptés aux playgrounds du module.
  • Données publiques françaises (data.gouv.fr): données réelles, souvent sales, excellentes pour travailler le nettoyage et la documentation des choix.

#Exercices de synthèse

  • Dérouler le TP « Pipeline ML complet » sur un jeu réel de votre choix, en respectant les six étapes et en produisant le carnet d'expériences complet.
  • Refaire l'exercice « détecter la fuite » sur vos propres features: construire une feature qui fuit, mesurer le score magique, puis la recalculer par fold et observer le retour à l'honnêteté.
  • Sur une série temporelle réelle (ventes, météo, trafic): implémenter le split temporel, la baseline saisonnière naïve, puis un modèle à lags; rapporter MAPE et comparaison à la baseline.
  • Audit d'équité: sur un jeu contenant une variable de groupe, mesurer les métriques par sous-groupe d'un modèle entraîné sans cette variable, et rédiger la note d'audit (définition d'équité retenue, écarts constatés, limites).

#Bonnes pratiques à emporter

  • Le protocole précède les données: métrique principale, split, contraintes écrits avant toute expérience.
  • « Qui a le droit de voir quoi »: la question à se poser à chaque transformation, chaque itération, chaque déploiement.
  • Toujours une baseline naïve: un modèle qui ne la bat pas n'a pas à être discuté.
  • Un score sans intervalle ni dispersion n'est pas un résultat.
  • Corrélation et prédiction ne sont pas causalité; toute affirmation causale exige des hypothèses supplémentaires et idéalement une intervention contrôlée.
  • Le carnet d'expériences, les graines et le code versionné font partie du livrable, au même titre que le modèle.