Aller au contenu principal

#Data Science & ML — Slides

  • Pipeline complet: problème, données, features, modèle, évaluation, déploiement; itératif par nature
  • La question qui gouverne tout: « qui a le droit de voir quoi »; train, validation, test et leurs rôles
  • Fuites de données: preprocessing ajusté sur tout le jeu, target encoding global, split temporel ignoré
  • Métriques: accuracy piégeuse en classe déséquilibrée; précision/rappel selon le coût des erreurs
  • Baseline naïve obligatoire; un score sans intervalle de confiance n'est pas un résultat
  • Supervisé: régression logistique, arbres, forêts, gradient boosting; pas d'algorithme universel
  • Sur-apprentissage: écart train/validation; profondeur, régularisation, early stopping
  • Régularisation: L2 lisse et stabilise, L1 raréfie et sélectionne; λ réglé par validation croisée
  • Non supervisé: K-Means (coude, silhouette), DBSCAN (densité, anomalies), PCA (variance expliquée)
  • PCA et scaling dans un Pipeline: ajustés sur le train, appliqués au test
  • Séries temporelles: split temporel strict, features causales (lags, moyennes passées), baseline saisonnière
  • NLP: tokenisation, BoW/TF-IDF (ordre perdu), embeddings, transformers pré-entraînés et fine-tuning
  • Calibration: probabilités alignées sur les fréquences observées, par bins
  • Validation croisée: stabilité des folds; imbriquée pour estimer le protocole complet de sélection
  • Biais: données, mesure, optimisation; proxies reconstruisent les variables sensibles exclues
  • Équité: parité démographique, opportunités, calibration; définitions incompatibles, choix à documenter
  • Interprétabilité: importances, PDP, SHAP; expliquer n'est pas justifier, ni établir la causalité
  • Mise en production: contrat d'entrée/sortie, versionner Pipeline + dépendances, canary/A-B/shadow
  • Surveillance: latence p95, erreurs, dérive de features et de concept; réentraînement au protocole figé
  • Reproductibilité: graines, code versionné, carnet d'expériences, métrique fixée avant les tests