Statistiques avancées 201-337 • Complément québécois et cégep à Montréal

Fiche de révision : estimation et tests d'hypothèse (201-337)

L'inférence est le seul chapitre de statistiques où le calcul juste et la phrase fausse coexistent tranquillement sur la même copie. Le nombre 95%95\,\% est correct, la phrase « il y a 95%95\,\% de chances que la moyenne soit dans cet intervalle » ne l'est pas, et c'est elle qui est notée.

Cette fiche rassemble les gestes qui décident : vérifier les conditions avant de choisir zz ou tt, mettre la bonne proportion au dénominateur, conclure sans jamais « accepter » l'hypothèse nulle, et séparer ce qui est significatif de ce qui est important.

Le fil du chapitre

Le paramètre ne varie pas : c'est l'ÉCHANTILLON qui varie, et tout le chapitre consiste à ne jamais attribuer au paramètre la probabilité qui décrit la méthode.

Ce chapitre fait partie de Statistiques avancées, 201-337

Avant ce chapitre

Cette fiche suppose ces notions acquises. Si une méthode ci-dessous reste opaque, c'est presque toujours l'une d'elles qui manque, pas la fiche.

Remonter plus loin : la chaîne complète (4 chapitres) ↓

Le chemin de remédiation, du plus ancien au plus proche. Un élève qui reprend ce chapitre de zéro le reprend dans cet ordre.

  1. 1Statistique : échantillonnage, diagrammes et mesuresSecondaire 3
  2. 2Nuage de points, corrélation et régressionSecondaire 4 SN4
  3. 3Les statistiques descriptives
  4. 4Probabilités et lois de distribution

L'essentiel

La distribution d'échantillonnage et l'erreur type

  • μx=μ\mu_{\overline{x}}=\mu et σx=σn\sigma_{\overline{x}}=\dfrac{\sigma}{\sqrt{n}} : cette dernière quantité s'appelle l'ERREUR TYPE.
  • Théorème central limite : pour nn assez grand, en pratique n30n\geq 30, la distribution de x\overline{x} est approximativement normale, quelle que soit la forme de la population.
  • La décroissance est en n\sqrt{n} : quadrupler l'échantillon divise l'erreur type par 22, pas par 44.
n = 36n = 9n = 1la moyenne de l'échantillon, autour du vrai mu
Les trois distributions ont le même centre ; seule leur largeur change, en 1n\dfrac{1}{\sqrt{n}} : passer de n=9n=9 à n=36n=36 ne resserre que d'un facteur 22.

L'erreur type décrit la dispersion des MOYENNES d'échantillon, pas celle des individus. Confondre σ\sigma et σx\sigma_{\overline{x}} est l'erreur silencieuse du chapitre : le calcul reste plausible.

Ce qu'un intervalle de confiance dit, et ce qu'il ne dit pas

  • Moyenne, σ\sigma connu : x±zα/2σn\overline{x}\pm z_{\alpha/2}\dfrac{\sigma}{\sqrt{n}}. Valeurs usuelles : 1,6451{,}645 à 90%90\,\%, 1,961{,}96 à 95%95\,\%, 2,5762{,}576 à 99%99\,\%.
  • Proportion : p^±zα/2p^(1p^)n\hat{p}\pm z_{\alpha/2}\sqrt{\dfrac{\hat{p}(1-\hat{p})}{n}}.
  • INTERPRÉTATION correcte : si l'on répétait l'échantillonnage un grand nombre de fois, 95%95\,\% des intervalles construits contiendraient le vrai paramètre.
  • Marge d'erreur imposée : n(zσE)2n\geq\left(\dfrac{z\sigma}{E}\right)^{2} pour une moyenne, n(z2E)2n\geq\left(\dfrac{z}{2E}\right)^{2} pour une proportion au pire cas p^=0,5\hat{p}=0{,}5.

Le paramètre est un nombre fixe : il est dans l'intervalle ou il n'y est pas. Le hasard est dans la méthode, pas dans la vérité, et c'est exactement ce que la phrase attendue doit dire.

La logique d'un test

  • H0H_{0} est l'hypothèse par défaut, celle du statu quo ; H1H_{1} est ce qu'on cherche à établir.
  • La VALEUR-P est la probabilité d'observer un résultat au moins aussi extrême SI H0H_{0} est vraie. On rejette H0H_{0} quand valeur-p <α<\alpha.
  • Erreur de type I : rejeter H0H_{0} vraie, de probabilité α\alpha. Erreur de type II : conserver H0H_{0} fausse, de probabilité β\beta. À nn constant, diminuer l'une augmente l'autre.
  • Test sur une proportion : z=p^p0p0(1p0)/nz=\dfrac{\hat{p}-p_{0}}{\sqrt{p_{0}(1-p_{0})/n}}, avec p0p_{0} AU DÉNOMINATEUR, puisqu'on raisonne sous H0H_{0}.

On ne prouve jamais H0H_{0} : faute de preuve, on la conserve. La nuance entre « accepter » et « ne pas rejeter » vaut un point à chaque conclusion rédigée.

Student, et le seuil de trente

  • Si σ\sigma est INCONNU, on l'estime par ss et xμs/n\dfrac{\overline{x}-\mu}{s/\sqrt{n}} suit une loi de Student à n1n-1 degrés de liberté.
  • La loi de Student est plus étalée que la normale : ses valeurs critiques sont toujours plus GRANDES, donc ses intervalles plus larges.
  • Elle converge vers la normale quand nn grandit, ce qui explique le seuil usuel de 3030.
  • Différence de deux moyennes indépendantes : σx1x2=s12n1+s22n2\sigma_{\overline{x_{1}}-\overline{x_{2}}}=\sqrt{\dfrac{s_{1}^{2}}{n_{1}}+\dfrac{s_{2}^{2}}{n_{2}}} : les VARIANCES s'additionnent, même pour une différence.

Un intervalle à 95%95\,\% pour une différence qui exclut zéro équivaut toujours à une valeur-p inférieure à 0,050{,}05 en bilatéral : les deux approches donnent la même décision.

Les pièges qui coûtent des points

Les erreurs ci-dessous sont celles que je corrige le plus souvent en séance. Chacune coûte des points sur une copie, même quand le raisonnement est juste.

1. Attribuer au paramètre la probabilité de la méthode

2 points, c'est la phrase la plus corrigée de tout le cours

Ce qu'il ne faut pas écrire

« Il y a 95%95\,\% de chances que la moyenne de la population soit comprise entre 12,312{,}3 et 14,714{,}7. »

Ce qu'il faut écrire

« Si l'on répétait l'échantillonnage, 95%95\,\% des intervalles ainsi construits contiendraient la vraie moyenne ; celui-ci en fait peut-être partie. »

le vrai paramètre, fixe et inconnucelui-ci le manque19 intervalles sur 20 contiennent le paramètre
Vingt échantillons, vingt intervalles différents autour du même paramètre fixe : un seul le manque, et rien dans son allure ne le distingue des autres.

Pourquoi : La moyenne de la population est un nombre fixe, pas une variable aléatoire : elle est dedans ou dehors. Ce qui varie d'un échantillon à l'autre, c'est l'intervalle.

2. Diviser par n au lieu de la racine de n

2 points, et un intervalle six fois trop étroit

Ce qu'il ne faut pas écrire

« σ=12\sigma=12 et n=36n=36, donc l'erreur type vaut 1236=0,33\dfrac{12}{36}=0{,}33. »

Ce qu'il faut écrire

« L'erreur type est σn=126=2\dfrac{\sigma}{\sqrt{n}}=\dfrac{12}{6}=2. »

Pourquoi : La moyenne d'un échantillon de 3636 n'est pas 3636 fois plus précise qu'une observation isolée, seulement 66 fois. Toute la lenteur des sondages tient dans cette racine carrée.

3. Lire la valeur-p comme la probabilité que l'hypothèse nulle soit vraie

2 points sur la question d'interprétation

Ce qu'il ne faut pas écrire

« La valeur-p vaut 0,030{,}03, donc il y a 3%3\,\% de chances que H0H_{0} soit vraie. »

Ce qu'il faut écrire

« Si H0H_{0} était vraie, on observerait un résultat au moins aussi extrême dans 3%3\,\% des échantillons ; c'est assez rare pour rejeter H0H_{0} au seuil de 5%5\,\%. »

Pourquoi : La valeur-p est une probabilité calculée SOUS H0H_{0}, donc en supposant H0H_{0} vraie. Elle ne peut pas, dans le même mouvement, mesurer la probabilité de cette hypothèse.

4. Accepter l'hypothèse nulle

1 point à chaque conclusion, et il y en a plusieurs par examen

Ce qu'il ne faut pas écrire

« La valeur-p vaut 0,220{,}22, donc on accepte H0H_{0} : la moyenne est bien égale à 5050. »

Ce qu'il faut écrire

« On ne rejette pas H0H_{0} : les données ne fournissent pas assez de preuves contre elle, ce qui ne prouve pas qu'elle est vraie. »

Pourquoi : Un test ne peut que rejeter ou ne pas rejeter. Une valeur-p élevée peut aussi bien signaler un effet réel mais un échantillon trop petit pour le détecter.

5. Mettre la proportion observée au dénominateur du test

1,5 point, et la décision peut basculer près du seuil

Ce qu'il ne faut pas écrire

« z=0,550,500,55×0,45/400z=\dfrac{0{,}55-0{,}50}{\sqrt{0{,}55\times 0{,}45/400}}. »

Ce qu'il faut écrire

« Sous H0H_{0}, la proportion vaut p0=0,50p_{0}=0{,}50 : z=0,550,500,50×0,50/400=2,00z=\dfrac{0{,}55-0{,}50}{\sqrt{0{,}50\times 0{,}50/400}}=2{,}00. »

Pourquoi : Un test raisonne sous H0H_{0}, donc toutes les quantités théoriques viennent de H0H_{0}. Dans un intervalle de confiance, au contraire, il n'y a pas d'hypothèse et c'est p^\hat{p} qui sert.

6. Utiliser z quand l'écart-type de la population est inconnu

1,5 point, et un intervalle trop étroit donc trop affirmatif

Ce qu'il ne faut pas écrire

« n=12n=12, s=4s=4 : je prends z=1,96z=1{,}96 pour l'intervalle à 95%95\,\%. »

Ce qu'il faut écrire

« σ\sigma est inconnu et n<30n<30, donc j'utilise tt à 1111 degrés de liberté, soit 2,2012{,}201. »

Pourquoi : Estimer σ\sigma par ss ajoute une source d'incertitude, que la loi de Student prend en charge par des queues plus épaisses. Ses valeurs critiques sont donc toujours supérieures à celles de zz.

7. Confondre significatif et important

2 points sur la question de lecture critique

Ce qu'il ne faut pas écrire

« La différence est significative à p=0,01p=0{,}01, donc l'effet du traitement est important. »

Ce qu'il faut écrire

« La différence est significative, mais son ampleur estimée est de 0,250{,}25 point sur 100100 : statistiquement détectable, pratiquement négligeable. »

effet nuln = 10 000n = 40les deux excluent zéro, un seul effet compte
Les deux intervalles excluent zéro, donc les deux effets sont significatifs ; seul le second, large et loin de zéro, décrit un effet de taille utile.

Pourquoi : La significativité mesure la solidité de la PREUVE, qui dépend surtout de nn. Un échantillon énorme rend significatif n'importe quel écart, si minuscule soit-il.

8. Additionner les écarts-types d'une différence

2 points, et une erreur type systématiquement trop grande

Ce qu'il ne faut pas écrire

« σd=s1n1+s2n2\sigma_{d}=\dfrac{s_{1}}{\sqrt{n_{1}}}+\dfrac{s_{2}}{\sqrt{n_{2}}}. »

Ce qu'il faut écrire

« Les VARIANCES s'additionnent : σd=s12n1+s22n2\sigma_{d}=\sqrt{\dfrac{s_{1}^{2}}{n_{1}}+\dfrac{s_{2}^{2}}{n_{2}}}. »

Pourquoi : La variance d'une somme ou d'une différence de variables indépendantes est la somme des variances, jamais la somme des écarts-types. Le signe moins ne retranche rien à l'incertitude, il l'ajoute.

9. Doubler l'échantillon pour diviser la marge par deux

1,5 point, et c'est la question de dimensionnement

Ce qu'il ne faut pas écrire

« La marge est de 4%4\,\% avec 600600 personnes ; avec 12001200 elle tombera à 2%2\,\%. »

Ce qu'il faut écrire

« La marge décroît en 1n\dfrac{1}{\sqrt{n}} : il faut quadrupler l'échantillon, soit 24002400 personnes, pour la diviser par 22. »

Pourquoi : La formule n(z2E)2n\geq\left(\dfrac{z}{2E}\right)^{2} élève au carré : diviser EE par deux multiplie nn par quatre. C'est aussi la raison économique pour laquelle les sondages s'arrêtent à mille personnes.

10. Tirer une causalité d'un khi-deux significatif

2 points, et c'est la question de conclusion du test

Ce qu'il ne faut pas écrire

« Le khi-deux est significatif, donc le type de programme influence la réussite. »

Ce qu'il faut écrire

« Le test établit une ASSOCIATION entre les deux variables ; il ne dit rien du sens de l'influence ni d'une éventuelle variable confondante. »

Pourquoi : Aucun test statistique ne produit de causalité sans randomisation. Le khi-deux compare des effectifs observés à des effectifs théoriques, rien de plus.

Quelle méthode choisir

Quelle statistique de test choisir

On regarde ce qui est estimé, et ce que l'énoncé donne comme dispersion.

  • Si une moyenne, σ\sigma de la population connu cote zz, avec σn\dfrac{\sigma}{\sqrt{n}} au dénominateur

    Exemple : σ=12\sigma=12 donné par le fabricant

  • Si une moyenne, σ\sigma inconnu estimé par ss loi de Student à n1n-1 degrés de liberté

    Exemple : n=12n=12, s=4s=4 : valeur critique 2,2012{,}201

    au-delà de n=30n=30, tt et zz deviennent presque identiques

  • Si une proportion cote zz, avec p0p_{0} au dénominateur pour un TEST, p^\hat{p} pour un INTERVALLE

    Exemple : 0,5×0,5/400\sqrt{0{,}5\times 0{,}5/400} sous H0H_{0}

  • Si deux moyennes indépendantes Student à deux échantillons, les variances s'additionnant

    Exemple : s12n1+s22n2\sqrt{\dfrac{s_{1}^{2}}{n_{1}}+\dfrac{s_{2}^{2}}{n_{2}}}

  • Si un tableau croisé de deux variables qualitatives khi-deux d'indépendance, à (l1)(c1)(l-1)(c-1) degrés de liberté

    Exemple : effectif théorique =total ligne×total colonnen=\dfrac{\text{total ligne}\times\text{total colonne}}{n}

    condition : tous les effectifs THÉORIQUES au moins égaux à 55

Aucun de ces choix ne se fait après le calcul : chacun dépend d'une condition à vérifier et à écrire. La condition non vérifiée coûte le point même quand la statistique est juste.

Dimensionner l'échantillon pour une marge imposée

On lit la marge d'erreur voulue et ce qu'on estime.

  • Si une moyenne, avec σ\sigma connu ou estimé n(zσE)2n\geq\left(\dfrac{z\sigma}{E}\right)^{2}, arrondi à l'entier SUPÉRIEUR

    Exemple : z=1,96z=1{,}96, σ=12\sigma=12, E=2E=2 donnent n139n\geq 139

  • Si une proportion sans information préalable n(z2E)2n\geq\left(\dfrac{z}{2E}\right)^{2}, cas le plus défavorable p^=0,5\hat{p}=0{,}5

    Exemple : marge de 3%3\,\% à 95%95\,\% : n1068n\geq 1068

  • Si une proportion avec une estimation préalable de p^\hat{p} np^(1p^)(zE)2n\geq\hat{p}(1-\hat{p})\left(\dfrac{z}{E}\right)^{2}, toujours plus petit

    Exemple : p^=0,2\hat{p}=0{,}2 réduit l'exigence d'un tiers

  • Si on demande l'effet d'un changement de taille raisonner en n\sqrt{n} : la marge est divisée par k\sqrt{k} quand nn est multiplié par kk

    Exemple : quadrupler nn divise la marge par 22

L'arrondi se fait toujours vers le HAUT : 138,3138{,}3 personnes donnent 139139 personnes, car 138138 ne suffirait pas à tenir la marge promise.

La rédaction attendue

Le correcteur coche des étapes. Les voici dans l'ordre, avec la phrase de conclusion qu'il attend mot pour mot.

Rédiger un test d'hypothèse complet

Quand l'utiliser : L'énoncé demande de tester une affirmation, de vérifier une prétention du fabricant ou de conclure sur une majorité.

  1. 1 Poser H0H_{0} et H1H_{1} avec le paramètre en symbole, et dire si le test est unilatéral ou bilatéral.
  2. 2 Vérifier les conditions d'application et les écrire : taille de l'échantillon, normalité, np05np_{0}\geq 5.
  3. 3 Calculer la statistique en indiquant la valeur utilisée au dénominateur, p0p_{0} ou σ\sigma.
  4. 4 Comparer à la valeur critique, ou donner la valeur-p et la confronter à α\alpha.
  5. 5 Conclure dans le CONTEXTE de l'énoncé, sans jamais « accepter » H0H_{0}.

Phrase de conclusion

« z=2,00>1,645z=2{,}00>1{,}645, donc on rejette H0H_{0} au seuil de 5%5\,\% : les données appuient l'hypothèse d'une majorité favorable dans la population. »

Le piège : Conclure sur la statistique et non sur le contexte : « on rejette H0H_{0} » sans dire ce que cela signifie pour le sondage.

Barème : 1 point les hypothèses, 1 point les conditions, 1 point la statistique, 1 point la décision, 1 point la conclusion en contexte.

Construire et interpréter un intervalle de confiance

Quand l'utiliser : L'énoncé demande d'estimer une moyenne ou une proportion avec un niveau de confiance donné.

  1. 1 Choisir zz ou tt selon que σ\sigma est connu, et écrire la valeur critique retenue.
  2. 2 Calculer l'erreur type, en distinguant σn\dfrac{\sigma}{\sqrt{n}} de σ\sigma lui-même.
  3. 3 Écrire l'intervalle sous la forme estimation plus ou moins marge, puis sous forme de bornes.
  4. 4 Interpréter par une phrase portant sur la MÉTHODE, jamais sur la probabilité du paramètre.

Phrase de conclusion

« L'intervalle à 95%95\,\% est [0,501 ; 0,599][\,0{,}501\ ;\ 0{,}599\,] : en répétant l'échantillonnage, 95%95\,\% des intervalles ainsi construits contiendraient la proportion réelle. »

Le piège : Employer p0p_{0} au lieu de p^\hat{p} dans la marge : un intervalle de confiance ne suppose aucune hypothèse.

Barème : 1 point la valeur critique, 1 point la marge, 1 point les bornes, 1 point l'interprétation correcte.

Vérifier avant de rendre

Cinq minutes de vérification récupèrent plus de points qu'un exercice de plus commencé à la hâte.

L'exercice type décortiqué

Un sondage annonce 55 pour cent : peut-on conclure à une majorité ?

Sur 400400 personnes interrogées au hasard, 220220 se déclarent favorables, soit p^=0,55\hat{p}=0{,}55.

Au seuil de 5%5\,\%, peut-on conclure que la proportion de favorables dépasse 50%50\,\% dans la population ?

1,645z observé = 2,00on ne rejette pascote z sous l'hypothèse nulle
La zone grisée est la région de rejet unilatérale à 5%5\,\% ; la cote observée 2,002{,}00 tombe au-delà de 1,6451{,}645.

Étape 1

H0:p=0,50H_{0}:p=0{,}50 contre H1:p>0,50H_{1}:p>0{,}50, test unilatéral à droite.

Pourquoi

La question dit « dépasse », donc une seule direction intéresse. Poser un test bilatéral doublerait la valeur-p et pourrait renverser la conclusion.

Étape 2

Conditions : np0=2005np_{0}=200\geq 5 et n(1p0)=2005n(1-p_{0})=200\geq 5.

Pourquoi

Elles autorisent l'approximation normale de la loi binomiale sous-jacente. Les écrire vaut un point, et coûte dix secondes.

Étape 3

z=0,550,500,50×0,50/400=0,050,025=2,00z=\dfrac{0{,}55-0{,}50}{\sqrt{0{,}50\times 0{,}50/400}}=\dfrac{0{,}05}{0{,}025}=2{,}00.

Pourquoi

Le dénominateur vient de H0H_{0}, pas des données : c'est ce qui distingue un test d'un intervalle de confiance, et c'est l'erreur la plus fréquente sur cette question.

Étape 4

Valeur critique unilatérale à 5%5\,\% : 1,6451{,}645. Valeur-p : P(Z>2,00)=0,0228P(Z>2{,}00)=0{,}0228.

Pourquoi

Les deux lectures mènent à la même décision, et les donner toutes les deux sécurise le point : 2,00>1,6452{,}00>1{,}645 et 0,0228<0,050{,}0228<0{,}05.

Étape 5

Intervalle à 95%95\,\% : 0,55±1,960,55×0,45400=[0,501 ; 0,599]0{,}55\pm 1{,}96\sqrt{\dfrac{0{,}55\times 0{,}45}{400}}=[\,0{,}501\ ;\ 0{,}599\,].

Pourquoi

Ici c'est p^\hat{p} qui sert, faute d'hypothèse. L'intervalle exclut 0,500{,}50, ce qui confirme le test par une voie indépendante.

Étape 6

Contrôle : le centre de l'intervalle vaut 0,5500{,}550, et 220/400=0,55220/400=0{,}55.

Pourquoi

Le centre doit redonner l'estimation ponctuelle. Un écart signalerait une marge mal soustraite d'un côté.

Conclusion rédigée

« z=2,00>1,645z=2{,}00>1{,}645 et la valeur-p vaut 0,0228<0,050{,}0228<0{,}05 : on rejette H0H_{0}. Les données appuient l'hypothèse d'une majorité de favorables dans la population, avec un intervalle à 95%95\,\% de [50,1% ; 59,9%][\,50{,}1\,\%\ ;\ 59{,}9\,\%\,]. »

L'erreur classique sur cet exercice : Écrire le dénominateur avec 0,55×0,450{,}55\times 0{,}45 : on obtient z=2,01z=2{,}01, presque identique ici, mais la méthode est fausse et l'écart devient décisif quand p^\hat{p} s'éloigne de 0,50{,}5.

À savoir par cœur

  • Erreur type =σn=\dfrac{\sigma}{\sqrt{n}} : quadrupler nn ne divise la marge que par 22.
  • Un intervalle à 95%95\,\% décrit la MÉTHODE, jamais la probabilité du paramètre, qui est fixe.
  • Valeur-p : probabilité d'un résultat au moins aussi extrême SI H0H_{0} est vraie. Ce n'est pas P(H0)P(H_{0}).
  • On rejette ou on NE REJETTE PAS H0H_{0} ; on ne l'accepte jamais.
  • Test de proportion : p0p_{0} au dénominateur. Intervalle de proportion : p^\hat{p} au dénominateur.
  • σ\sigma inconnu : loi de Student à n1n-1 degrés de liberté, valeurs critiques plus grandes que celles de zz.
  • Pour une différence, les VARIANCES s'additionnent : s12n1+s22n2\sqrt{\dfrac{s_{1}^{2}}{n_{1}}+\dfrac{s_{2}^{2}}{n_{2}}}.
  • Khi-deux : effectifs théoriques tous supérieurs ou égaux à 55, et association jamais causalité.

Questions fréquentes

Que signifie vraiment un intervalle de confiance à 95 % ?

Que la méthode employée produit, sur l'ensemble des échantillons possibles, des intervalles dont quatre-vingt-quinze pour cent contiennent le vrai paramètre. Le paramètre est un nombre fixe : il est dans l'intervalle obtenu ou il n'y est pas. La probabilité décrit donc la procédure, pas la position du paramètre.

La valeur-p est-elle la probabilité que l'hypothèse nulle soit vraie ?

Non. C'est la probabilité d'observer un résultat au moins aussi extrême que celui obtenu, en supposant que l'hypothèse nulle est vraie. Elle est calculée sous cette hypothèse, donc elle ne peut pas en mesurer la vraisemblance. Une valeur-p faible signifie que les données seraient surprenantes si l'hypothèse nulle tenait.

Pourquoi ne dit-on jamais qu'on accepte l'hypothèse nulle ?

Parce qu'un test ne cherche des preuves que contre elle. Ne pas en trouver peut vouloir dire qu'elle est vraie, mais aussi que l'échantillon était trop petit pour détecter un écart réel. On dit donc qu'on ne la rejette pas, ce qui laisse ouverte la seconde possibilité.

Quand faut-il utiliser la loi de Student plutôt que la loi normale ?

Dès que l'écart-type de la population est inconnu et qu'on l'estime à partir de l'échantillon. Cette estimation ajoute de l'incertitude, que Student prend en charge avec des queues plus épaisses et donc des valeurs critiques plus grandes. Au-delà d'une trentaine d'observations, les deux lois deviennent presque identiques.

Un résultat significatif est-il forcément important ?

Non. La significativité mesure la solidité de la preuve, et elle dépend surtout de la taille de l'échantillon. Avec dix mille observations, un écart minuscule devient significatif sans avoir la moindre portée pratique. Il faut toujours regarder l'ampleur estimée de l'effet, que l'intervalle de confiance donne directement.

Passer à la pratique

Exercices corrigés : Estimation et tests d'hypothèse

Une méthode se prouve sur une copie, pas sur une fiche. La série du même chapitre reprend chacun de ces pièges dans un exercice, avec le corrigé rédigé étape par étape.

  • 10 exercices corrigés
  • 100 points
  • 150 minutes
Faire les exercices
Fiche précédente Probabilités et lois de distribution Fiche suivante Corrélation et régression linéaire

Ce chapitre resservira dans

Les chapitres qui le réclament en amont, plus tard dans l'année ou dans les années suivantes.

Voir aussi

Vous cherchez un tuteur en statistiques 201-337 à Montréal ?

Contactez-moi pour une première séance. L'inférence est le chapitre où la méthode compte plus que le calcul : cinq étapes toujours identiques, et la moitié des points vient de la rédaction.

Site par Studio Squalli