#Probabilités et statistiques
Un modèle probabiliste décrit un phénomène aléatoire avant observation; la statistique remonte le chemin inverse: elle part d’un échantillon limité et cherche ce qu’on peut affirmer, et avec quel risque d’erreur, sur le mécanisme qui a produit ces données. Ce module suit cet axe complet: espaces probabilisés, variables aléatoires, lois usuelles, simulation Monte Carlo, puis estimation, intervalles de confiance et tests d’hypothèses.
Prérequis
- Manipulation de sommes et d’intégrales simples (module Analyse) et notations ensemblistes (module Maths discrètes).
- Bases de Python: boucles, fonctions, listes (module Prog Python). Les simulations du cours sont en Python standard.
Objectifs d’apprentissage
- Construire un espace probabilisé discret et calculer avec probabilité conditionnelle, formule de Bayes et indépendance.
- Passer d’une variable aléatoire à ses indicateurs: loi, espérance, variance, quantiles.
- Choisir une loi usuelle en vérifiant explicitement ses hypothèses de validité.
- Estimer une quantité par simulation reproductible et quantifier l’erreur Monte Carlo.
- En inférence: distinguer paramètre, statistique et p-value, puis construire intervalles de confiance et tests correctement interprétés.
#Modèle contre données
La probabilité est une prévision du modèle: si la pièce est équilibrée, la probabilité de pile vaut 0,5. La fréquence observée est une mesure: sur 100 lancers, vous compterez rarement exactement 50 piles. Confondre les deux mène aux contresens classiques, comme s’attendre à ce qu’un dé « compense » une série de faces.
À petite échelle les fréquences fluctuent; la loi des grands nombres garantit leur stabilisation quand la taille d’échantillon croît, sous hypothèse d’indépendance et de loi identique. Le théorème central limite précise la forme de ces fluctuations: la moyenne empirique, centrée et réduite, se comporte comme une variable normale. Ces deux résultats justifient à la fois la simulation Monte Carlo et les formules approximatives des intervalles de confiance et des tests.
#Le fil du module
- Bases des probabilités: univers, événements, axiomes, conditionnement, Bayes, indépendance.
- Variables aléatoires: loi, fonction de répartition, espérance, variance, théorèmes limites.
- Lois usuelles: Bernoulli, binomiale, géométrique, Poisson, uniforme, exponentielle, normale, et leurs conditions d’emploi.
- Simulation Monte Carlo: estimer probabilités et espérances, mesurer l’erreur, valider par valeurs exactes.
- Proportions: intervalles de Wilson et tests exacts sur une proportion.
- Estimation et inférence: biais, variance, maximum de vraisemblance, lecture correcte d’un intervalle de confiance et d’une p-value.
- Tests d’hypothèses: démarche complète, erreurs de première et seconde espèce, puissance.
- IC et tests en pratique: A/B testing, comparaison de moyennes (Student, Welch), tests multiples.
#Mini-atelier: simuler et vérifier
Écrivez une simulation qui estime la probabilité d’obtenir au moins un « six » en 10 lancers de dé équilibré, avec une graine fixée pour être reproductible.
Vérification: l’événement contraire est « aucun six en 10 lancers », de probabilité (5/6)^10 ≈ 0,1615. La probabilité cherchée vaut donc 1 − (5/6)^10 ≈ 0,8385. Votre estimation sur 10 000 répétitions doit tomber à ±0,01 près de cette valeur; si elle en est loin, votre boucle a un défaut (par exemple un compteur remis à zéro au mauvais endroit).
Deuxième étape: recommencez avec une pièce biaisée de paramètre p inconnu et simulez combien de lancers sont nécessaires pour distinguer p = 0,55 d’une pièce équilibrée. Vous constaterez que quelques centaines de lancers sont nécessaires: c’est exactement la question de puissance abordée dans la section sur les tests.