Data Science & ML · L3 · Section 12/12
Ressources
Progression
Points d’expérience : —XPSérie de jours consécutifs : —· —Progression du module : — / —compris
#Ressources — Data Science & Machine Learning
Pourquoi ces ressources: le module a insisté sur la rigueur de protocole; la suite consiste à pratiquer sur des données réelles, avec des références qui traitent l'évaluation aussi sérieusement que les algorithmes. Comment s'en servir: choisir un jeu de données, écrire le protocole AVANT la première expérience, et tenir le carnet d'expériences à jour à chaque itération.
#Références
- Scikit-learn, documentation officielle: les sections « Model evaluation », « Pipeline » et « Metrics » sont la source de référence des protocoles du module.
- Kaggle Learn (cours gratuits, pratiques): introductions guidées aux mêmes thèmes, avec notebooks exécutables.
- « The Elements of Statistical Learning » (Hastie, Tibshirani, Friedman): la référence théorique; chapitres 7 (validation croisée) et 3 (régression régularisée) prolongent directement les pages du module.
- « Feature Engineering for Machine Learning » (Zheng, Casari) et « Designing Machine Learning Systems » (Hug, 2022): la première pour la partie features, la seconde pour la mise en production et le réentraînement.
- Google's Machine Learning Crash Course + « Rules of Machine Learning » (Martin Zinkevich): protocoles, pièges de mesure, bonnes pratiques de mise en production.
- Papers With Code, section « Time Series »: état de l'art et jeux de données pour les séries temporelles, avec les précautions de split temporel rappelées dans le module.
#Jeux de données pour pratiquer
- Titanic et House Prices (Kaggle): classiques pour dérouler un pipeline complet; attention, les leaderboards publics souffrent de sur-apprentissage sur le test: traitez-les comme des exercices, pas comme des preuves.
- OpenML: des milliers de jeux avec métadonnées, API Python (
openml), pratique pour la comparaison de protocoles. - Datasets de scikit-learn (
fetch_openml): intégrés au workflow, versionnés, adaptés aux playgrounds du module. - Données publiques françaises (data.gouv.fr): données réelles, souvent sales, excellentes pour travailler le nettoyage et la documentation des choix.
#Exercices de synthèse
- Dérouler le TP « Pipeline ML complet » sur un jeu réel de votre choix, en respectant les six étapes et en produisant le carnet d'expériences complet.
- Refaire l'exercice « détecter la fuite » sur vos propres features: construire une feature qui fuit, mesurer le score magique, puis la recalculer par fold et observer le retour à l'honnêteté.
- Sur une série temporelle réelle (ventes, météo, trafic): implémenter le split temporel, la baseline saisonnière naïve, puis un modèle à lags; rapporter MAPE et comparaison à la baseline.
- Audit d'équité: sur un jeu contenant une variable de groupe, mesurer les métriques par sous-groupe d'un modèle entraîné sans cette variable, et rédiger la note d'audit (définition d'équité retenue, écarts constatés, limites).
#Bonnes pratiques à emporter
- Le protocole précède les données: métrique principale, split, contraintes écrits avant toute expérience.
- « Qui a le droit de voir quoi »: la question à se poser à chaque transformation, chaque itération, chaque déploiement.
- Toujours une baseline naïve: un modèle qui ne la bat pas n'a pas à être discuté.
- Un score sans intervalle ni dispersion n'est pas un résultat.
- Corrélation et prédiction ne sont pas causalité; toute affirmation causale exige des hypothèses supplémentaires et idéalement une intervention contrôlée.
- Le carnet d'expériences, les graines et le code versionné font partie du livrable, au même titre que le modèle.