Probabilités & statistiques · L2 · Section 9/9
Ressources
Progression
Points d’expérience : —XPSérie de jours consécutifs : —· —Progression du module : — / —compris
#Ressources — Probabilités et statistiques
Pourquoi ces ressources: le module a insisté sur la discipline — hypothèses explicites, conditions vérifiées, graine fixée, effet et intervalle rapportés avant la p-value. La suite consiste à pratiquer sur des données réelles et des références qui traitent l'inférence avec la même rigueur. Comment s'en servir: lire une page, refaire ses playgrounds en changeant les graines et les paramètres, puis attaquer des exercices corrigés avant les jeux de données.
#Références
- OpenIntro Statistics (Diez, Çetinkaya-Rundel, Barr): gratuit en ligne, le compagnon idéal du module — mêmes outils (intervalles, tests, p-values bien lues), chapitres courts et exercices corrigés.
- Statistical Inference (Casella, Berger): la référence théorique pour aller au-delà: convergence des estimateurs, suffissance, familles exponentielles.
- All of Statistics (Wasserman): couvre en un volume le continuum probabilités-inférence du module, avec le style direct qui convient aux informaticiens.
- Pages Wikipédia « Loi binomiale », « Intervalle de confiance » et « Test d'hypothèse »: révisions rapides avec les formules et leurs conditions.
- Seeing Theory (Brown University, seeing-theory.brown.edu): visualisations interactives des notions de probabilités et d'inférence — complément visuel des playgrounds du module.
- Les TD et annales de votre université: formats et attendus de rédaction y sont les plus fidèles.
#Outils pour pratiquer
- Python standard (
random,math,statistics): tout ce qu'il faut pour refaire les simulations du module sans dépendance — c'est le choix fait ici, valable dans tout navigateur via Pyodide. statistics.NormalDist(): loi normale en bibliothèque standard — quantiles et probabilités sans scipy.- NumPy/SciPy en local (
numpy.random,scipy.stats): quand le volume de simulation grandit; les graines (np.random.default_rng(42)) y jouent le même rôle qu'ici. - R ou Julia: alternatives équivalentes; le module Introduction à R montre la même démarche d'inférence dans un autre langage.
#Exercices conseillés
- Bayes: refaire le dépistage à prévalence 2%, sensibilité 95%, spécificité 90%, puis enchaîner un second test indépendant sur les positifs et recalculer la valeur prédictive.
- Lois: pour n = 50 et p = 0,3, calculer P(X ≥ 20) exactement, par approximation normale avec correction de continuité, puis par simulation avec graine — comparer les trois écarts.
- Monte Carlo: estimer P(U₁ + U₂ > 1,2) par simulation (graine 42, n = 100 000) et retrouver le résultat par le calcul d'aire.
- Intervalles: pour (k, n) = (0, 50) puis (2, 10), calculer Wald, Wilson et observer pourquoi seul le second reste honnête.
- Tests: sur 62 faces en 100 lancers, refaire le test exact bilatéral, l'approximation normale avec et sans correction de continuité, et l'IC de Wilson; conclure en une phrase de décision complète.
- Puissance: calibrer n pour détecter 5 points de conversion (0,10 contre 0,15) à 80% de puissance, puis vérifier par simulation de A/B tests.
#Bonnes pratiques à emporter
- Énoncer H₀, H₁ et le seuil avant de regarder les données; choisir unilatéral/bilatéral à la même étape.
- Vérifier les conditions d'emploi d'une formule (n·p, n·(1−p) pour le Wald; n < 30 → Student; tirage sans remise → hypergéométrique) avant de l'appliquer.
- Fixer la graine en tête de script: un résultat non reproductible n'est pas un résultat.
- Valider un simulateur sur un cas où la réponse exacte est connue avant de l'appliquer au cas inconnu.
- Rapporter taille d'effet et intervalle de confiance avec chaque p-value; corriger les tests multiples et résister à l'arrêt au premier p significatif.
- Confondre probabilité (modèle) et fréquence observée (données) reste l'erreur de base: la loi des grands nombres relie les deux, elle ne les identifie pas à n fini.