Aller au contenu principal

Probabilités & statistiques · L2 · Section 5/9

Proportions: IC et tests

Progression

Points d’expérience : XPSérie de jours consécutifs : · —Progression du module : — / —compris

#Proportions: intervalles et tests

Une proportion est le paramètre p d’une loi de Bernoulli: taux de conversion, proportion de requêtes en erreur, prévalence d’un bug. Les données se résument en un couple (k, n): k succès sur n essais. Cette page traite l’estimation de p par intervalle de confiance et son test contre une valeur de référence, en insistant sur les conditions de validité des formules.

Objectifs d’apprentissage

  • Construire un intervalle de confiance pour une proportion et choisir entre Wald, Wilson et Clopper-Pearson selon n et la proximité de p̂ des bornes.
  • Tester H₀: p = p₀ par la binomiale exacte ou l’approximation normale avec correction de continuité, en vérifiant leurs conditions.
  • Distinguer significativité statistique et importance pratique via la taille d’effet.

Prérequis: lois usuelles (Bernoulli, binomiale), estimation et inférence (notion d’estimateur, de biais et de variance).

#Le problème de l’intervalle de Wald

L’estimateur naturel de p est la fréquence observée p̂ = k/n, sans biais et de variance p(1−p)/n. L’intervalle « de Wald » remplace p par p̂ dans l’erreur-type:

p̂ ± 1,96·√(p̂(1−p̂)/n)

Il souffre d’un défaut sérieux: quand p̂ est proche de 0 ou 1, ou quand n est petit, la variance estimée s’effondre et la couverture réelle chute sous le niveau affiché. Cas extrême: k = 0. L’intervalle de Wald dégénère en [0; 0], affirmation absurde (elle exclut toute valeur non nulle de p avec « 95% de confiance » alors qu’un seul succès au prochain tirage peut suffire à la réfuter).

#Wilson et Clopper-Pearson

L’intervalle de Wilson résout le problème en ne linéarisant pas la variance autour de p̂: il résout exactement l’équation |p̂ − p| = z·√(p(1−p)/n) en p, ce qui donne une formule fermée (ci-dessous). Il reste strictement à l’intérieur de [0,1], est asymétrique autour de p̂ quand p̂ est extrême, et sa couverture réelle est proche de 95% même pour n modeste.

L’intervalle de Clopper-Pearson est exact par construction: c’est l’ensemble des p tels que le test binomial bilatéral de niveau 5% ne rejette pas p au vu de (k, n). Garantie de couverture d’au moins 95% (donc conservateur, souvent plus large que nécessaire), calcul par quantiles de la loi bêta. C’est le choix de rigueur en réglementaire ou en petits échantillons.

Recommandation pratique: Wilson par défaut, Clopper-Pearson quand l’exigence est réglementaire ou l’échantillon très petit. Le Wald ne se justifie que pour un calcul mental rapide avec n grand et p̂ vers 0,5.

#Animation: choisir l’intervalle

Wald
p̂ ± z·se; fragile aux extrêmes et petits n
Wilson
Résout |p̂−p| = z·se en p; couverture correcte
Clopper‑Pearson
Exact (binomial), conservateur

#Playground: Wald contre Wilson

Le script calcule les deux intervalles pour plusieurs configurations, puis mesure la couverture réelle par simulation: sur 10 000 échantillons simulés avec le p vrai connu, quelle proportion des intervalles contiennent-ils p? C’est le test expérimental qui départage les formules.

Chargement de l’éditeur...

Avec la graine 7 et 10 000 répétitions: pour p = 0,1 et n = 20, le Wald couvre à 87,5% seulement (niveau annoncé 95%!), le Wilson à 95,6%. Pour p = 0,5, n = 20, les deux couvrent à 95,7%. Le Wald ne devient acceptable que lorsque n·p̂ et n·(1−p̂) dépassent tous deux quelques dizaines. Les intervalles affichés confirment: pour k = 0, n = 20, Wald = [0; 0] contre Wilson = [0; 0,161].

#Tester une proportion

On teste H₀: p = p₀ contre H₁: p ≠ p₀ (bilatéral) ou p > p₀ (unilatéral), à partir de k succès sur n essais. Sous H₀, K suit la binomiale(n, p₀).

Test exact binomial: la p-value unilatérale à droite est P(K ≥ k) = Σᵢ≥k C(n,i) p₀ⁱ (1−p₀)ⁿ⁻ⁱ, calculable directement (playground ci-dessous). En bilatéral, on double la queue la plus extrême, ou on somme les probabilités des valeurs au moins aussi improbables que k.

Approximation normale: la statistique z = (p̂ − p₀)/√(p₀(1−p₀)/n) suit approximativement N(0,1) sous H₀. Condition d’emploi: n·p₀ ≥ 5 et n·(1−p₀) ≥ 5, et on applique la correction de continuité en évaluant à k − 0,5 (test à droite), car on approche une loi discrète par une continue.

Exemple canonique: 62 faces sur 100 lancers, test bilatéral de p₀ = 0,5. Exact: P(K ≥ 62) = 0,0105, p-value bilatérale 0,021. Approximation normale sans correction: z = 2,4, p = 0,016; avec correction de continuité: z = 2,3, p = 0,021. La correction améliore nettement l’approximation.

#Playground: test exact et approximation

Chargement de l’éditeur...

Lecture complète du résultat: p-value bilatérale exacte 0,021, donc rejet de H₀ au seuil 5% (mais pas au seuil 1%: la décision dépend du seuil fixé avant l’expérience). L’intervalle de Wilson [0,522; 0,709] exclut 0,5, information plus riche que la seule p-value: il donne l’ordre de grandeur du biais de la pièce, environ 0,62, avec sa marge d’incertitude. Sur 100 lancers, un écart de +12 faces reste compatible avec des fluctuations d’une pièce parfaitement équilibrée dans 2% des cas: le résultat est significatif, l’effet modeste.

#Exercices

Exercice 1 (choisir l’intervalle). Un service affiche 0 erreur sur 50 requêtes. Donnez l’intervalle de Wilson à 95% pour le taux d’erreur, puis expliquez pourquoi l’intervalle de Wald est inutilisable ici.

Corrigé. Wilson avec k = 0, n = 50: [0; 0,071]. Le Wald donne [0; 0]: il affirme avec « 95% de confiance » que le taux d’erreur est exactement nul, ce qu’aucune quantité d’observations finies ne peut établir. La borne de Wilson, 7,1%, est contre-intuitive mais honnête: 50 requêtes sans erreur sont compatibles avec un taux d’erreur réel allant jusqu’à 7%. Pour borner le taux à moins de 1%, il faut n ≥ ln(0,05)/ln(0,99) ≈ 298 requêtes sans erreur: la règle « des trois » (3/n) donne l’ordre de grandeur de la borne haute quand k = 0.

Exercice 2 (test unilatéral). Un classifier détecte la fraude. Sur 36 transactions fraudeuses, il en signale 9. Testez H₀: p = 0,5 (détection au hasard) contre H₁: p < 0,5, au seuil 5%.

Corrigé. Test unilatéral à gauche: p-value = P(K ≤ 9) pour K binomiale(36, 0,5). Le calcul exact donne ≈ 0,002: on rejette H₀ très largement. Le classifier fait significativement moins bien que le hasard sur cet échantillon, ce qui signale un bug d’implémentation (étiquettes inversées, seuil mal calibré) plutôt qu’un simple manque de performance. Intervalle de Wilson pour la sensibilité: [0,138; 0,411], loin de 0,5. Notez l’usage diagnostique du test: une performance « trop mauvaise » est une information aussi précieuse qu’une bonne performance.

Exercice 3 (taille d’échantillon). Vous voulez détecter une différence de taux de conversion de 5 points (0,10 contre 0,15) avec une puissance de 80% au seuil bilatéral 5%. Combien d’utilisateurs par branche, approximativement?

Éléments de vérification. La formule approchée n ≈ (z₀,₉₇₅·√(2·p̄(1−p̄)) + z₀,₈₀·√(p₁(1−p₁)+p₂(1−p₂)))²/δ², avec p̄ = 0,125, p₁ = 0,10, p₂ = 0,15 et δ = 0,05, donne n ≈ 690 par branche (les calculateurs exacts donnent 650 à 720 selon la variante). Retenez l’ordre de grandeur: détecter 5 points de différence exige plusieurs centaines d’utilisateurs par branche. Vérifiez votre implémentation en simulant des A/B tests avec les vrais taux et en comptant la fréquence de rejet: elle doit approcher 80%.