Aller au contenu principal

Probabilités & statistiques · L2 · Section 9/9

Ressources

Progression

Points d’expérience : XPSérie de jours consécutifs : · —Progression du module : — / —compris

#Ressources — Probabilités et statistiques

Pourquoi ces ressources: le module a insisté sur la discipline — hypothèses explicites, conditions vérifiées, graine fixée, effet et intervalle rapportés avant la p-value. La suite consiste à pratiquer sur des données réelles et des références qui traitent l'inférence avec la même rigueur. Comment s'en servir: lire une page, refaire ses playgrounds en changeant les graines et les paramètres, puis attaquer des exercices corrigés avant les jeux de données.

#Références

  • OpenIntro Statistics (Diez, Çetinkaya-Rundel, Barr): gratuit en ligne, le compagnon idéal du module — mêmes outils (intervalles, tests, p-values bien lues), chapitres courts et exercices corrigés.
  • Statistical Inference (Casella, Berger): la référence théorique pour aller au-delà: convergence des estimateurs, suffissance, familles exponentielles.
  • All of Statistics (Wasserman): couvre en un volume le continuum probabilités-inférence du module, avec le style direct qui convient aux informaticiens.
  • Pages Wikipédia « Loi binomiale », « Intervalle de confiance » et « Test d'hypothèse »: révisions rapides avec les formules et leurs conditions.
  • Seeing Theory (Brown University, seeing-theory.brown.edu): visualisations interactives des notions de probabilités et d'inférence — complément visuel des playgrounds du module.
  • Les TD et annales de votre université: formats et attendus de rédaction y sont les plus fidèles.

#Outils pour pratiquer

  • Python standard (random, math, statistics): tout ce qu'il faut pour refaire les simulations du module sans dépendance — c'est le choix fait ici, valable dans tout navigateur via Pyodide.
  • statistics.NormalDist(): loi normale en bibliothèque standard — quantiles et probabilités sans scipy.
  • NumPy/SciPy en local (numpy.random, scipy.stats): quand le volume de simulation grandit; les graines (np.random.default_rng(42)) y jouent le même rôle qu'ici.
  • R ou Julia: alternatives équivalentes; le module Introduction à R montre la même démarche d'inférence dans un autre langage.

#Exercices conseillés

  • Bayes: refaire le dépistage à prévalence 2%, sensibilité 95%, spécificité 90%, puis enchaîner un second test indépendant sur les positifs et recalculer la valeur prédictive.
  • Lois: pour n = 50 et p = 0,3, calculer P(X ≥ 20) exactement, par approximation normale avec correction de continuité, puis par simulation avec graine — comparer les trois écarts.
  • Monte Carlo: estimer P(U₁ + U₂ > 1,2) par simulation (graine 42, n = 100 000) et retrouver le résultat par le calcul d'aire.
  • Intervalles: pour (k, n) = (0, 50) puis (2, 10), calculer Wald, Wilson et observer pourquoi seul le second reste honnête.
  • Tests: sur 62 faces en 100 lancers, refaire le test exact bilatéral, l'approximation normale avec et sans correction de continuité, et l'IC de Wilson; conclure en une phrase de décision complète.
  • Puissance: calibrer n pour détecter 5 points de conversion (0,10 contre 0,15) à 80% de puissance, puis vérifier par simulation de A/B tests.

#Bonnes pratiques à emporter

  • Énoncer H₀, H₁ et le seuil avant de regarder les données; choisir unilatéral/bilatéral à la même étape.
  • Vérifier les conditions d'emploi d'une formule (n·p, n·(1−p) pour le Wald; n < 30 → Student; tirage sans remise → hypergéométrique) avant de l'appliquer.
  • Fixer la graine en tête de script: un résultat non reproductible n'est pas un résultat.
  • Valider un simulateur sur un cas où la réponse exacte est connue avant de l'appliquer au cas inconnu.
  • Rapporter taille d'effet et intervalle de confiance avec chaque p-value; corriger les tests multiples et résister à l'arrêt au premier p significatif.
  • Confondre probabilité (modèle) et fréquence observée (données) reste l'erreur de base: la loi des grands nombres relie les deux, elle ne les identifie pas à n fini.