Aller au contenu principal

Cours · L2

Probabilités & statistiques

Progression du module

Points d’expérience : XPSérie de jours consécutifs : · —Progression du module : — / —compris

#Probabilités et statistiques

Un modèle probabiliste décrit un phénomène aléatoire avant observation; la statistique remonte le chemin inverse: elle part d’un échantillon limité et cherche ce qu’on peut affirmer, et avec quel risque d’erreur, sur le mécanisme qui a produit ces données. Ce module suit cet axe complet: espaces probabilisés, variables aléatoires, lois usuelles, simulation Monte Carlo, puis estimation, intervalles de confiance et tests d’hypothèses.

Prérequis

  • Manipulation de sommes et d’intégrales simples (module Analyse) et notations ensemblistes (module Maths discrètes).
  • Bases de Python: boucles, fonctions, listes (module Prog Python). Les simulations du cours sont en Python standard.

Objectifs d’apprentissage

  • Construire un espace probabilisé discret et calculer avec probabilité conditionnelle, formule de Bayes et indépendance.
  • Passer d’une variable aléatoire à ses indicateurs: loi, espérance, variance, quantiles.
  • Choisir une loi usuelle en vérifiant explicitement ses hypothèses de validité.
  • Estimer une quantité par simulation reproductible et quantifier l’erreur Monte Carlo.
  • En inférence: distinguer paramètre, statistique et p-value, puis construire intervalles de confiance et tests correctement interprétés.

#Modèle contre données

La probabilité est une prévision du modèle: si la pièce est équilibrée, la probabilité de pile vaut 0,5. La fréquence observée est une mesure: sur 100 lancers, vous compterez rarement exactement 50 piles. Confondre les deux mène aux contresens classiques, comme s’attendre à ce qu’un dé « compense » une série de faces.

À petite échelle les fréquences fluctuent; la loi des grands nombres garantit leur stabilisation quand la taille d’échantillon croît, sous hypothèse d’indépendance et de loi identique. Le théorème central limite précise la forme de ces fluctuations: la moyenne empirique, centrée et réduite, se comporte comme une variable normale. Ces deux résultats justifient à la fois la simulation Monte Carlo et les formules approximatives des intervalles de confiance et des tests.

#Le fil du module

  1. Bases des probabilités: univers, événements, axiomes, conditionnement, Bayes, indépendance.
  2. Variables aléatoires: loi, fonction de répartition, espérance, variance, théorèmes limites.
  3. Lois usuelles: Bernoulli, binomiale, géométrique, Poisson, uniforme, exponentielle, normale, et leurs conditions d’emploi.
  4. Simulation Monte Carlo: estimer probabilités et espérances, mesurer l’erreur, valider par valeurs exactes.
  5. Proportions: intervalles de Wilson et tests exacts sur une proportion.
  6. Estimation et inférence: biais, variance, maximum de vraisemblance, lecture correcte d’un intervalle de confiance et d’une p-value.
  7. Tests d’hypothèses: démarche complète, erreurs de première et seconde espèce, puissance.
  8. IC et tests en pratique: A/B testing, comparaison de moyennes (Student, Welch), tests multiples.

#Mini-atelier: simuler et vérifier

Écrivez une simulation qui estime la probabilité d’obtenir au moins un « six » en 10 lancers de dé équilibré, avec une graine fixée pour être reproductible.

Vérification: l’événement contraire est « aucun six en 10 lancers », de probabilité (5/6)^10 ≈ 0,1615. La probabilité cherchée vaut donc 1 − (5/6)^10 ≈ 0,8385. Votre estimation sur 10 000 répétitions doit tomber à ±0,01 près de cette valeur; si elle en est loin, votre boucle a un défaut (par exemple un compteur remis à zéro au mauvais endroit).

Deuxième étape: recommencez avec une pièce biaisée de paramètre p inconnu et simulez combien de lancers sont nécessaires pour distinguer p = 0,55 d’une pièce équilibrée. Vous constaterez que quelques centaines de lancers sont nécessaires: c’est exactement la question de puissance abordée dans la section sur les tests.

Plan du cours · 9 sections

Sections du cours