Exercice 1 : Le théorème central limite et l'erreur type
La moyenne d'un échantillon varie d'un échantillon à l'autre. Sa propre distribution est bien plus resserrée que celle des données, et c'est ce resserrement qui rend l'inférence possible.
Les résultats à un examen national ont une moyenne et un écart-type . On prélève un échantillon aléatoire de 36 copies.
- a) Donnez la moyenne et l'erreur type de la distribution de .
- b) Énoncez le théorème central limite et dites pourquoi il s'applique ici même si les résultats individuels ne sont pas normalement distribués.
- c) Calculez la probabilité que la moyenne de l'échantillon dépasse 73.
- d) On quadruple la taille de l'échantillon, à 144 copies. Que devient l'erreur type ?
- e) Pour diviser l'erreur type par 10, par combien faut-il multiplier la taille de l'échantillon ? Quelle conséquence pratique ?
Voir la correction
a) La moyenne de la distribution d'échantillonnage est celle de la population : . L'erreur type vaut . Les moyennes d'échantillons sont donc six fois moins dispersées que les copies individuelles.
b) Le théorème central limite affirme que pour suffisamment grand, la distribution de est approximativement NORMALE, de moyenne et d'écart-type , QUELLE QUE SOIT la forme de la distribution de la population. Ici : le seuil pratique usuel est atteint. C'est précisément la force du théorème : on n'a besoin d'aucune hypothèse sur la distribution des résultats individuels, qui peut être asymétrique, bimodale ou tronquée.
c) . La table donne 0,9332 à gauche, donc , environ 6,7 %. Noter qu'une copie INDIVIDUELLE dépassant 73 serait bien plus fréquente : , soit 40 %. La distinction entre l'écart-type des données et l'erreur type de la moyenne est la source d'erreur numéro un du chapitre.
d) . Quadrupler a donc DIVISÉ PAR DEUX l'erreur type, et non par quatre, parce que c'est et non qui figure au dénominateur.
e) Il faut multiplier par . Passer de 36 à 3600 copies ne réduit l'erreur type que d'un facteur 10. La conséquence pratique est décisive : la précision d'un sondage progresse très lentement avec le coût. Doubler la précision exige de QUADRUPLER l'échantillon, donc à peu près le budget. C'est la raison pour laquelle presque tous les sondages d'opinion s'arrêtent autour de 1000 personnes : au-delà, le gain de précision ne justifie plus la dépense.