Spécialité maths, Terminale • Exercices corrigés à Montréal

Exercices corrigés : sommes de variables aléatoires et concentration (Terminale spécialité)

Voici une série d'exercices corrigés de spécialité mathématiques sur les sommes de variables aléatoires, la concentration et la loi des grands nombres, au programme de Terminale en vigueur. Elle s'adresse aux élèves des lycées français, dont le Lycée Marie de France et le Collège Stanislas à Montréal, et à tout élève de Terminale qui prépare l'épreuve de spécialité de juin.

Le fil de la série tient en une phrase : une somme de nn copies indépendantes n'est pas nn fois une copie. X1+⋯+XnX_{1}+\dots+X_{n} et nXnX ont la même espérance nμn\mu, mais la variance de la somme vaut nVnV et celle de nXnX vaut n2Vn^{2}V. L'espérance s'additionne toujours, la variance seulement quand les termes sont indépendants, et c'est ce décalage qui donne σ(Mn)=σn\sigma(M_{n})=\frac{\sigma}{\sqrt{n}} et toute la concentration.

La loi binomiale, ses calculs de probabilités et la concentration d'une fréquence sont dans la série de loi binomiale ; ici, on travaille des lois quelconques, la démonstration de l'espérance et de la variance de la binomiale, et la moyenne d'un échantillon. Calculatrice autorisée, comme à l'épreuve.

Faites chaque exercice au complet avant d'ouvrir la correction : c'est en cherchant qu'on apprend, pas en lisant la solution.

Série autocorrigée Tape tes réponses sous chaque question : la page te dit juste ou faux avant d'ouvrir la correction. Avec un compte, chaque bonne réponse du premier coup rapporte des points.

Ce chapitre fait partie de Spécialité mathématiques en Terminale
Avant de commencer Fiche de révision : les pièges et la méthode de ce chapitre

Avant ce chapitre

Ces notions sont supposées acquises ici. Si le premier exercice résiste, le blocage vient presque toujours de l'une d'elles, pas du chapitre lui-même.

Remonter plus loin : la chaîne complète (5 chapitres) ↓

Le chemin de remédiation, du plus ancien au plus proche. Un élève qui reprend ce chapitre de zéro le reprend dans cet ordre.

  1. 1Probabilités conditionnelles et arbres pondérésSeconde
  2. 2Probabilités conditionnellesPremière
  3. 3Les variables aléatoiresPremière
  4. 4Combinatoire et dénombrement
  5. 5Loi binomiale et concentration

Rappel de cours

  • • LINÉARITÉ DE L'ESPÉRANCE, pour toutes variables XX et YY et tout réel aa : E(X+Y)=E(X)+E(Y)E(X+Y)=E(X)+E(Y) et E(aX)=aE(X)E(aX)=aE(X). Aucune indépendance n'est requise.
  • • VARIANCE : V(aX)=a2V(X)V(aX)=a^{2}V(X), et V(X+b)=V(X)V(X+b)=V(X). Si XX et YY sont INDÉPENDANTES, V(X+Y)=V(X)+V(Y)V(X+Y)=V(X)+V(Y), et aussi V(X−Y)=V(X)+V(Y)V(X-Y)=V(X)+V(Y).
  • • Sans indépendance, l'additivité est fausse : V(X+X)=4V(X)V(X+X)=4V(X), et V(X+(c−X))=0V(X+(c-X))=0.
  • • LOI DE BERNOULLI de paramètre pp : valeurs 11 et 00, E=pE=p, V=p(1−p)V=p(1-p).
  • • LOI BINOMIALE : X=B1+⋯+BnX=B_{1}+\dots+B_{n}, somme de nn Bernoulli indépendantes de paramètre pp ; E(X)=npE(X)=np par linéarité, V(X)=np(1−p)V(X)=np(1-p) par additivité.
  • • ÉCHANTILLON de taille nn d'une loi d'espérance μ\mu et de variance VV : Sn=X1+⋯+XnS_{n}=X_{1}+\dots+X_{n}, E(Sn)=nμE(S_{n})=n\mu, V(Sn)=nVV(S_{n})=nV ; Mn=SnnM_{n}=\frac{S_{n}}{n}, E(Mn)=μE(M_{n})=\mu, V(Mn)=VnV(M_{n})=\frac{V}{n}, σ(Mn)=σn\sigma(M_{n})=\frac{\sigma}{\sqrt{n}}.
  • • BIENAYMÉ-TCHEBYCHEV : pour tout δ>0\delta>0, P(∣X−μ∣≥δ)≤V(X)δ2P(|X-\mu|\geq\delta)\leq\frac{V(X)}{\delta^{2}}.
  • • CONCENTRATION : P(∣Mn−μ∣≥δ)≤Vnδ2P(|M_{n}-\mu|\geq\delta)\leq\frac{V}{n\delta^{2}}. Pour une précision δ\delta et un risque α\alpha, il suffit que n≥Vαδ2n\geq\frac{V}{\alpha\delta^{2}}.
  • • LOI DES GRANDS NOMBRES : pour tout δ>0\delta>0, P(∣Mn−μ∣≥δ)P(|M_{n}-\mu|\geq\delta) tend vers 00 quand nn tend vers +∞+\infty.

Partie A : les bases (/50)

Exercice 1 : L'espérance d'une somme sans calculer sa loi : deux correspondances

Pour se rendre à son travail, Inès prend un bus puis un tramway. On note XX son attente au premier arrêt et YY son attente à la correspondance, en minutes. Les deux lois sont données par les diagrammes ci-dessous : XX vaut 00, 44 ou 88 avec les probabilités 0,50{,}5, 0,30{,}3 et 0,20{,}2 ; YY vaut 22 ou 66 avec les probabilités 0,60{,}6 et 0,40{,}4.

Les horaires du bus et du tramway ne sont pas coordonnés : on modélise les deux attentes par une succession de deux épreuves indépendantes. On note S=X+YS=X+Y l'attente totale.

00,540,380,200,20,4loi de X20,660,400,20,4loi de Y
  • a) Calculez E(X)E(X) et E(Y)E(Y).
  • b) Établissez la loi de SS en dressant le tableau des six couples (x ;y)(x\,;y). On demande ci-dessous P(S=6)P(S=6) et P(S=10)P(S=10).
  • c) Calculez E(S)E(S) à partir de sa loi, puis comparez avec E(X)+E(Y)E(X)+E(Y).
  • d) Certains jours, Inès prend en plus un funiculaire, dont l'attente ZZ a pour espérance 55 minutes ; on ne connaît pas sa loi. Calculez l'espérance de l'attente totale X+Y+ZX+Y+Z. Sur un mois de 2020 trajets de ce type, quelle est l'espérance du temps total d'attente ?

Tape tes réponses, la page te dit juste ou faux 0/7

a)
b)
c)
d)
Voir la correction

Réponses

  • a) E(X)=2,8E(X)=2{,}8 et E(Y)=3,6E(Y)=3{,}6
  • b) P(S=2)=0,3P(S=2)=0{,}3, P(S=6)=0,38P(S=6)=0{,}38, P(S=10)=0,24P(S=10)=0{,}24, P(S=14)=0,08P(S=14)=0{,}08
  • c) E(S)=6,4=E(X)+E(Y)E(S)=6{,}4=E(X)+E(Y)
  • d) E(X+Y+Z)=11,4E(X+Y+Z)=11{,}4 minutes ; sur 2020 trajets, 228228 minutes

a) L'espérance est la moyenne des valeurs pondérée par leurs probabilités : E(X)=0×0,5+4×0,3+8×0,2=1,2+1,6=2,8E(X)=0\times 0{,}5+4\times 0{,}3+8\times 0{,}2=1{,}2+1{,}6=2{,}8 et E(Y)=2×0,6+6×0,4=1,2+2,4=3,6E(Y)=2\times 0{,}6+6\times 0{,}4=1{,}2+2{,}4=3{,}6. En moyenne, sur un grand nombre de trajets, Inès attend 2,82{,}8 minutes le bus et 3,63{,}6 minutes le tramway. Ce ne sont pas des valeurs que XX ou YY peuvent prendre, et ce n'est pas un problème : une espérance est une moyenne, pas une issue.

b) Une issue est un couple (x ;y)(x\,;y). Les deux épreuves étant indépendantes, la probabilité d'un couple est le PRODUIT des probabilités de ses composantes : P(X=4 et Y=2)=0,3×0,6=0,18P(X=4\text{ et }Y=2)=0{,}3\times 0{,}6=0{,}18, par exemple. Les six couples donnent : (0 ;2)(0\,;2), somme 22, probabilité 0,30{,}3 ; (0 ;6)(0\,;6), somme 66, 0,20{,}2 ; (4 ;2)(4\,;2), somme 66, 0,180{,}18 ; (4 ;6)(4\,;6), somme 1010, 0,120{,}12 ; (8 ;2)(8\,;2), somme 1010, 0,120{,}12 ; (8 ;6)(8\,;6), somme 1414, 0,080{,}08. Deux couples mènent à 66 et deux à 1010 : on les regroupe. P(S=2)=0,3P(S=2)=0{,}3, P(S=6)=0,2+0,18=0,38P(S=6)=0{,}2+0{,}18=0{,}38, P(S=10)=0,12+0,12=0,24P(S=10)=0{,}12+0{,}12=0{,}24, P(S=14)=0,08P(S=14)=0{,}08, et le total fait bien 11. Le tableau figure dans la correction. Oublier un des deux couples qui mènent à la même somme est l'erreur classique.

c) E(S)=2×0,3+6×0,38+10×0,24+14×0,08=0,6+2,28+2,4+1,12=6,4E(S)=2\times 0{,}3+6\times 0{,}38+10\times 0{,}24+14\times 0{,}08=0{,}6+2{,}28+2{,}4+1{,}12=6{,}4. Et E(X)+E(Y)=2,8+3,6=6,4E(X)+E(Y)=2{,}8+3{,}6=6{,}4 : c'est le même nombre, et ce n'est pas une coïncidence. C'est la LINÉARITÉ DE L'ESPÉRANCE, E(X+Y)=E(X)+E(Y)E(X+Y)=E(X)+E(Y), vraie pour deux variables aléatoires quelconques. Elle tient parce que l'espérance est une moyenne pondérée sur les issues, et qu'une moyenne de sommes est la somme des moyennes. Elle ne demande AUCUNE indépendance : on s'est servi de l'indépendance en b) pour obtenir la loi de SS, pas pour son espérance.

d) Sans connaître la loi de ZZ, la linéarité donne directement E(X+Y+Z)=E(X)+E(Y)+E(Z)=2,8+3,6+5=11,4E(X+Y+Z)=E(X)+E(Y)+E(Z)=2{,}8+3{,}6+5=11{,}4 minutes. Construire la loi de X+Y+ZX+Y+Z aurait demandé la loi de ZZ et un tableau à trois entrées : la linéarité fait l'économie de tout cela, c'est son intérêt principal. Sur 2020 trajets, l'attente totale est la somme T1+⋯+T20T_{1}+\dots+T_{20} des attentes de chaque jour, et son espérance vaut 20×11,4=22820\times 11{,}4=228 minutes, soit 33 heures et 4848 minutes. Là encore, pas besoin de savoir si les trajets de deux jours différents sont indépendants : pour l'espérance, la question ne se pose pas.

Y = 2 (0,6)Y = 6 (0,4)X = 0 (0,5)S = 2 : 0,3S = 6 : 0,2X = 4 (0,3)S = 6 : 0,18S = 10 : 0,12X = 8 (0,2)S = 10 : 0,12S = 14 : 0,08

Coche ici les exercices faits ou à revoir : un compte gratuit, sans mot de passe, retient tes coches d'une visite à l'autre et te dit quel chapitre attaquer ensuite. Crée ton espace, un courriel suffit.

Exercice 2 : La variance s'additionne, si les variables sont indépendantes : deux stations de vélos

Un service de vélos en libre-service observe deux stations entre 8 h et 8 h 05. On note XX le nombre de vélos rendus à la station A, qui vaut 00, 11 ou 22 avec les probabilités 0,20{,}2, 0,50{,}5 et 0,30{,}3, et YY le nombre de vélos rendus à la station B, qui vaut 00 ou 22 avec les probabilités 0,40{,}4 et 0,60{,}6. Les deux stations sont éloignées : on modélise les deux observations par deux épreuves indépendantes.

La station A ne possède que 22 bornes, vides à 8 h ; on note L=2−XL=2-X le nombre de bornes encore libres à 8 h 05.

  • a) Calculez V(X)V(X) et V(Y)V(Y) par la formule V(X)=E(X2)−E(X)2V(X)=E(X^{2})-E(X)^{2}.
  • b) Établissez la loi de S=X+YS=X+Y. On demande ci-dessous P(S=2)P(S=2) et P(S=3)P(S=3).
  • c) Calculez V(S)V(S) à partir de la loi de SS et comparez avec V(X)+V(Y)V(X)+V(Y). Quelle hypothèse du modèle rend cette égalité légitime ?
  • d) Un technicien additionne par erreur deux fois le relevé de la station A : il calcule W=X+XW=X+X. Calculez V(W)V(W). Calculez aussi V(X+L)V(X+L) et comparez avec V(X)+V(L)V(X)+V(L). Que montrent ces deux calculs ?

Tape tes réponses, la page te dit juste ou faux 0/8

a)
b)
c)
d)
Voir la correction

Réponses

  • a) V(X)=1,7−1,12=0,49V(X)=1{,}7-1{,}1^{2}=0{,}49 et V(Y)=2,4−1,22=0,96V(Y)=2{,}4-1{,}2^{2}=0{,}96
  • b) P(S=0)=0,08P(S=0)=0{,}08, P(S=1)=0,2P(S=1)=0{,}2, P(S=2)=0,24P(S=2)=0{,}24, P(S=3)=0,3P(S=3)=0{,}3, P(S=4)=0,18P(S=4)=0{,}18
  • c) V(S)=6,74−2,32=1,45=V(X)+V(Y)V(S)=6{,}74-2{,}3^{2}=1{,}45=V(X)+V(Y), grâce à l'indépendance des deux épreuves
  • d) V(W)=V(2X)=1,96≠0,98V(W)=V(2X)=1{,}96\neq 0{,}98 ; V(X+L)=0≠0,98V(X+L)=0\neq 0{,}98 : sans indépendance, les variances ne s'additionnent pas

a) E(X)=0×0,2+1×0,5+2×0,3=1,1E(X)=0\times 0{,}2+1\times 0{,}5+2\times 0{,}3=1{,}1 et E(X2)=0+1×0,5+4×0,3=1,7E(X^{2})=0+1\times 0{,}5+4\times 0{,}3=1{,}7, donc V(X)=1,7−1,12=1,7−1,21=0,49V(X)=1{,}7-1{,}1^{2}=1{,}7-1{,}21=0{,}49. De même E(Y)=2×0,6=1,2E(Y)=2\times 0{,}6=1{,}2, E(Y2)=4×0,6=2,4E(Y^{2})=4\times 0{,}6=2{,}4 et V(Y)=2,4−1,44=0,96V(Y)=2{,}4-1{,}44=0{,}96. Le piège est d'écrire E(X2)E(X^{2}) en élevant l'espérance au carré : E(X2)E(X^{2}) se calcule en élevant chaque VALEUR au carré, avec les mêmes probabilités.

b) Les six couples, par indépendance : (0 ;0)(0\,;0) probabilité 0,2×0,4=0,080{,}2\times 0{,}4=0{,}08, somme 00 ; (1 ;0)(1\,;0) : 0,20{,}2, somme 11 ; (2 ;0)(2\,;0) : 0,120{,}12, somme 22 ; (0 ;2)(0\,;2) : 0,120{,}12, somme 22 ; (1 ;2)(1\,;2) : 0,30{,}3, somme 33 ; (2 ;2)(2\,;2) : 0,180{,}18, somme 44. D'où la loi de SS : P(S=0)=0,08P(S=0)=0{,}08, P(S=1)=0,2P(S=1)=0{,}2, P(S=2)=0,12+0,12=0,24P(S=2)=0{,}12+0{,}12=0{,}24, P(S=3)=0,3P(S=3)=0{,}3, P(S=4)=0,18P(S=4)=0{,}18, de total 11.

c) E(S)=0,2+0,48+0,9+0,72=2,3E(S)=0{,}2+0{,}48+0{,}9+0{,}72=2{,}3, qui vaut bien 1,1+1,21{,}1+1{,}2 par linéarité. E(S2)=1×0,2+4×0,24+9×0,3+16×0,18=0,2+0,96+2,7+2,88=6,74E(S^{2})=1\times 0{,}2+4\times 0{,}24+9\times 0{,}3+16\times 0{,}18=0{,}2+0{,}96+2{,}7+2{,}88=6{,}74, donc V(S)=6,74−2,32=6,74−5,29=1,45V(S)=6{,}74-2{,}3^{2}=6{,}74-5{,}29=1{,}45. Et V(X)+V(Y)=0,49+0,96=1,45V(X)+V(Y)=0{,}49+0{,}96=1{,}45 : les variances s'additionnent. Le programme l'admet sous une hypothèse précise : XX et YY sont INDÉPENDANTES, ce qui est le cas ici parce que le modèle est une succession de deux épreuves indépendantes. L'espérance s'additionne toujours, la variance seulement sous cette condition.

d) W=X+X=2XW=X+X=2X, donc V(W)=V(2X)=22V(X)=4×0,49=1,96V(W)=V(2X)=2^{2}V(X)=4\times 0{,}49=1{,}96, alors que V(X)+V(X)=0,98V(X)+V(X)=0{,}98. L'additivité échoue : XX n'est évidemment pas indépendante d'elle-même. Doubler une variable multiplie sa variance par 44, parce que tous les écarts à la moyenne sont doublés, et que la variance est une moyenne d'écarts AU CARRÉ. Pour L=2−XL=2-X : V(L)=(−1)2V(X)=0,49V(L)=(-1)^{2}V(X)=0{,}49, donc V(X)+V(L)=0,98V(X)+V(L)=0{,}98. Mais X+L=2X+L=2 quelle que soit l'issue : c'est une variable constante, de variance nulle. Ici les deux variables se compensent exactement, ce que fait tout vélo rendu, qui occupe une borne de plus. Dans un sens ou dans l'autre, 1,961{,}96 ou 00 au lieu de 0,980{,}98 : additionner les variances de deux variables liées donne un résultat faux, et il faut toujours écrire « XX et YY sont indépendantes » avant d'additionner.

Exercice 3 : La loi binomiale comme somme de Bernoulli : la démonstration exigible

Un sachet contient 4040 graines. Chaque graine germe avec la probabilité 0,850{,}85, indépendamment des autres. On numérote les graines de 11 à 4040 et l'on note BiB_{i} la variable qui vaut 11 si la graine numéro ii germe et 00 sinon. On note XX le nombre de graines qui germent.

Le but de l'exercice est de DÉMONTRER les formules E(X)=npE(X)=np et V(X)=np(1−p)V(X)=np(1-p), que le programme de Terminale range parmi les démonstrations exigibles, et non de les appliquer.

  • a) Quelle est la loi de BiB_{i} ? Montrez que Bi2=BiB_{i}^{2}=B_{i}, puis calculez E(Bi)E(B_{i}) et V(Bi)V(B_{i}).
  • b) Écrivez XX à l'aide des BiB_{i} et calculez E(X)E(X). L'indépendance des germinations a-t-elle servi ?
  • c) Calculez V(X)V(X) et σ(X)\sigma(X), en nommant la propriété utilisée et son hypothèse.
  • d) On note Y=40−XY=40-X le nombre de graines qui ne germent pas. Calculez E(Y)E(Y) et V(Y)V(Y) de deux façons : à partir de XX, puis en écrivant YY comme une somme de variables de Bernoulli.

Tape tes réponses, la page te dit juste ou faux 0/8

a)
b)
c)
d)
Voir la correction

Réponses

  • a) BiB_{i} suit la loi de Bernoulli de paramètre 0,850{,}85 ; E(Bi)=0,85E(B_{i})=0{,}85, V(Bi)=0,85×0,15=0,1275V(B_{i})=0{,}85\times 0{,}15=0{,}1275
  • b) X=B1+⋯+B40X=B_{1}+\dots+B_{40}, E(X)=40×0,85=34E(X)=40\times 0{,}85=34, sans utiliser l'indépendance
  • c) V(X)=40×0,1275=5,1V(X)=40\times 0{,}1275=5{,}1 par additivité (variables indépendantes) ; σ(X)≈2,258\sigma(X)\approx 2{,}258
  • d) E(Y)=6E(Y)=6 et V(Y)=5,1V(Y)=5{,}1 ; YY est aussi une somme de 4040 Bernoulli de paramètre 0,150{,}15

a) BiB_{i} ne prend que deux valeurs, 11 (succès, la graine germe) avec la probabilité p=0,85p=0{,}85 et 00 avec la probabilité 1−p=0,151-p=0{,}15 : c'est la LOI DE BERNOULLI de paramètre 0,850{,}85. Comme 02=00^{2}=0 et 12=11^{2}=1, la variable Bi2B_{i}^{2} prend exactement les mêmes valeurs que BiB_{i} sur chaque issue : Bi2=BiB_{i}^{2}=B_{i}. D'où E(Bi)=1×p+0×(1−p)=p=0,85E(B_{i})=1\times p+0\times(1-p)=p=0{,}85, E(Bi2)=E(Bi)=pE(B_{i}^{2})=E(B_{i})=p et V(Bi)=p−p2=p(1−p)=0,85×0,15=0,1275V(B_{i})=p-p^{2}=p(1-p)=0{,}85\times 0{,}15=0{,}1275. Retenez ces deux résultats sous forme littérale : E=pE=p et V=p(1−p)V=p(1-p).

b) Chaque graine qui germe ajoute 11 au compte, chaque graine qui ne germe pas ajoute 00 : X=B1+B2+⋯+B40X=B_{1}+B_{2}+\dots+B_{40}. C'est l'idée clé du chapitre, REPRÉSENTER une variable comme une somme de variables plus simples. Par linéarité de l'espérance, E(X)=E(B1)+⋯+E(B40)=40×0,85=34E(X)=E(B_{1})+\dots+E(B_{40})=40\times 0{,}85=34, et en général E(X)=npE(X)=np. L'indépendance n'a PAS servi : la linéarité est vraie pour des variables quelconques. On a donc démontré E(X)=npE(X)=np sans écrire une seule fois la formule P(X=k)P(X=k) ni un coefficient binomial.

c) Les germinations sont indépendantes, donc les BiB_{i} sont des variables indépendantes, et l'additivité de la variance s'applique : V(X)=V(B1)+⋯+V(B40)=40×0,1275=5,1V(X)=V(B_{1})+\dots+V(B_{40})=40\times 0{,}1275=5{,}1, et en général V(X)=np(1−p)V(X)=np(1-p). Ici l'hypothèse est indispensable et doit être écrite sur la copie : c'est elle que le correcteur cherche dans la démonstration. σ(X)=5,1≈2,258\sigma(X)=\sqrt{5{,}1}\approx 2{,}258. On reconnaît au passage que XX suit la loi binomiale B(40 ;0,85)\mathcal{B}(40\,;0{,}85), puisqu'elle compte les succès de 4040 épreuves de Bernoulli indépendantes et identiques : la démonstration vaut pour toute loi binomiale.

d) À partir de XX : E(Y)=E(40−X)=40−E(X)=40−34=6E(Y)=E(40-X)=40-E(X)=40-34=6 et V(Y)=V(40−X)=(−1)2V(X)=5,1V(Y)=V(40-X)=(-1)^{2}V(X)=5{,}1. L'ajout d'une constante ne change pas la dispersion, et le signe moins sort au carré. Seconde façon : Y=(1−B1)+⋯+(1−B40)Y=(1-B_{1})+\dots+(1-B_{40}), et chaque 1−Bi1-B_{i} suit la loi de Bernoulli de paramètre 0,150{,}15 ; ces 4040 variables sont indépendantes, donc YY suit B(40 ;0,15)\mathcal{B}(40\,;0{,}15), et E(Y)=40×0,15=6E(Y)=40\times 0{,}15=6, V(Y)=40×0,15×0,85=5,1V(Y)=40\times 0{,}15\times 0{,}85=5{,}1. Les deux calculs concordent. L'erreur à éviter : écrire V(40−X)=40−V(X)V(40-X)=40-V(X), ou −V(X)-V(X), une variance négative étant un signal d'alarme immédiat.

Exercice 4 : Une somme de n copies n'est pas n fois une copie : des points de fidélité

L'application d'un café crédite, à chaque visite, 00, 55 ou 1010 points de fidélité, avec les probabilités 0,180{,}18, 0,640{,}64 et 0,180{,}18 (diagramme ci-dessous). On note XX le nombre de points crédités lors d'une visite.

On considère 100100 visites, dont les tirages sont indépendants et suivent tous la loi de XX : c'est un ÉCHANTILLON de taille 100100 de la loi de XX, noté (X1,…,X100)(X_{1},\dots,X_{100}). On pose S100=X1+⋯+X100S_{100}=X_{1}+\dots+X_{100} et M100=S100100M_{100}=\dfrac{S_{100}}{100}.

00,1850,64100,1800,20,4loi de X
  • a) Calculez E(X)E(X), V(X)V(X) et σ(X)\sigma(X).
  • b) Calculez E(S100)E(S_{100}), V(S100)V(S_{100}) et σ(S100)\sigma(S_{100}).
  • c) Une promotion « tout ou rien » crédite à un client, pour une seule visite, 100100 fois les points tirés : il reçoit Z=100XZ=100X. Calculez E(Z)E(Z), V(Z)V(Z) et σ(Z)\sigma(Z), puis comparez avec S100S_{100}.
  • d) Calculez E(M100)E(M_{100}) et σ(M100)\sigma(M_{100}). Plus généralement, exprimez σ(Mn)\sigma(M_{n}) en fonction de nn, et déterminez la taille nn de l'échantillon pour laquelle σ(Mn)=0,1\sigma(M_{n})=0{,}1.

Tape tes réponses, la page te dit juste ou faux 0/8

a)
b)
c)
d)
Voir la correction

Réponses

  • a) E(X)=5E(X)=5, V(X)=34−25=9V(X)=34-25=9, σ(X)=3\sigma(X)=3
  • b) E(S100)=500E(S_{100})=500, V(S100)=900V(S_{100})=900, σ(S100)=30\sigma(S_{100})=30
  • c) E(Z)=500E(Z)=500, V(Z)=90 000V(Z)=90\,000, σ(Z)=300\sigma(Z)=300 : même espérance, écart type dix fois plus grand
  • d) E(M100)=5E(M_{100})=5, σ(M100)=0,3\sigma(M_{100})=0{,}3 ; σ(Mn)=3n\sigma(M_{n})=\frac{3}{\sqrt{n}}, et n=900n=900

a) E(X)=0×0,18+5×0,64+10×0,18=3,2+1,8=5E(X)=0\times 0{,}18+5\times 0{,}64+10\times 0{,}18=3{,}2+1{,}8=5, ce que la symétrie du diagramme autour de 55 annonçait. E(X2)=25×0,64+100×0,18=16+18=34E(X^{2})=25\times 0{,}64+100\times 0{,}18=16+18=34, donc V(X)=34−25=9V(X)=34-25=9 et σ(X)=3\sigma(X)=3 points. Une visite isolée s'écarte donc typiquement de 33 points de la moyenne, dans un sens ou dans l'autre.

b) Par linéarité, E(S100)=100 E(X)=500E(S_{100})=100\,E(X)=500. Les XiX_{i} sont INDÉPENDANTES, donc les variances s'additionnent : V(S100)=V(X1)+⋯+V(X100)=100×9=900V(S_{100})=V(X_{1})+\dots+V(X_{100})=100\times 9=900, et σ(S100)=900=30\sigma(S_{100})=\sqrt{900}=30. En général, pour un échantillon de taille nn d'une loi d'espérance μ\mu et de variance VV : E(Sn)=nμE(S_{n})=n\mu et V(Sn)=nVV(S_{n})=nV, d'où σ(Sn)=n σ\sigma(S_{n})=\sqrt{n}\,\sigma. L'écart type de la somme grandit, mais seulement comme n\sqrt{n} : sur cent visites, les écarts d'une visite à l'autre se compensent en partie.

c) E(Z)=100 E(X)=500E(Z)=100\,E(X)=500, exactement comme S100S_{100}. Mais V(Z)=V(100X)=1002V(X)=90 000V(Z)=V(100X)=100^{2}V(X)=90\,000 et σ(Z)=300\sigma(Z)=300, DIX fois l'écart type de S100S_{100}. C'est le fil de la série : 100X100X et X1+⋯+X100X_{1}+\dots+X_{100} ont la même espérance et pas du tout la même dispersion. Avec ZZ, un seul tirage décide de tout, et le client reçoit 00 ou 1 0001\,000 points avec la probabilité 0,180{,}18 chacun ; avec S100S_{100}, cent tirages indépendants se compensent, et le total reste le plus souvent entre 440440 et 560560. L'erreur typique de copie, écrire V(S100)=1002V(X)V(S_{100})=100^{2}V(X), revient à confondre ces deux situations.

d) M100=1100S100M_{100}=\frac{1}{100}S_{100}, donc E(M100)=500100=5E(M_{100})=\frac{500}{100}=5 et V(M100)=11002V(S100)=90010 000=0,09V(M_{100})=\frac{1}{100^{2}}V(S_{100})=\frac{900}{10\,000}=0{,}09, soit σ(M100)=0,3\sigma(M_{100})=0{,}3. En général V(Mn)=nVn2=VnV(M_{n})=\frac{nV}{n^{2}}=\frac{V}{n} et σ(Mn)=σn=3n\sigma(M_{n})=\frac{\sigma}{\sqrt{n}}=\frac{3}{\sqrt{n}} : la moyenne de l'échantillon a la même espérance que XX, mais elle est n\sqrt{n} fois moins dispersée. Pour σ(Mn)=0,1\sigma(M_{n})=0{,}1, il faut n=30,1=30\sqrt{n}=\frac{3}{0{,}1}=30, donc n=900n=900 visites. Diviser l'écart type par 33, de 0,30{,}3 à 0,10{,}1, demande 99 fois plus de visites : c'est le prix du n\sqrt{n}, et il reviendra dans chaque question de taille d'échantillon.

Exercice 5 : L'inégalité de Bienaymé-Tchebychev sur une loi quelconque : un parking

On note XX le nombre de places libres dans le parking d'une gare à 8 h, un jour ouvrable pris au hasard. Des relevés conduisent à la loi représentée ci-dessous : XX vaut 1010, 2020, 3030, 4040 ou 5050 avec les probabilités 0,10{,}1, 0,20{,}2, 0,40{,}4, 0,20{,}2 et 0,10{,}1.

On rappelle l'inégalité de Bienaymé-Tchebychev : pour une variable XX d'espérance μ\mu et de variance VV, et pour tout réel δ>0\delta>0, P(∣X−μ∣≥δ)≤Vδ2P(|X-\mu|\geq\delta)\leq\dfrac{V}{\delta^{2}}.

100,1200,2300,4400,2500,100,20,4loi de X
  • a) Calculez μ=E(X)\mu=E(X), V=V(X)V=V(X) et σ(X)\sigma(X) arrondi au centième.
  • b) Majorez P(∣X−30∣≥20)P(|X-30|\geq 20) par l'inégalité, puis calculez la valeur exacte sur la loi. Comparez.
  • c) Même travail pour P(∣X−30∣≥15)P(|X-30|\geq 15). Pourquoi la probabilité exacte n'a-t-elle pas bougé, alors que la majoration a changé ?
  • d) Que donne l'inégalité pour δ=10\delta=10 ? Utilisez enfin l'inégalité sous la forme d'une minoration : minorez P(10<X<50)P(10<X<50) et comparez avec la valeur exacte.

Tape tes réponses, la page te dit juste ou faux 0/9

a)
b)
c)
d)
Voir la correction

Réponses

  • a) μ=30\mu=30, V=120V=120, σ≈10,95\sigma\approx 10{,}95
  • b) P(∣X−30∣≥20)≤0,3P(|X-30|\geq 20)\leq 0{,}3 ; valeur exacte 0,20{,}2
  • c) Majoration 120225≈0,533\frac{120}{225}\approx 0{,}533 ; valeur exacte toujours 0,20{,}2, car aucune valeur de XX n'est entre 1515 et 2020 de 3030
  • d) δ=10\delta=10 : majoration 1,21{,}2, inutile ; P(10<X<50)≥0,7P(10<X<50)\geq 0{,}7, valeur exacte 0,80{,}8

a) Par symétrie de la loi autour de 3030, μ=30\mu=30 : on le vérifie, E(X)=1+4+12+8+5=30E(X)=1+4+12+8+5=30. La variance est la moyenne des carrés des écarts à μ\mu : les valeurs 1010 et 5050 sont à 2020 de 3030, les valeurs 2020 et 4040 à 1010. V=400×(0,1+0,1)+100×(0,2+0,2)=80+40=120V=400\times(0{,}1+0{,}1)+100\times(0{,}2+0{,}2)=80+40=120, et σ=120≈10,95\sigma=\sqrt{120}\approx 10{,}95 places.

b) Avec δ=20\delta=20 : P(∣X−30∣≥20)≤120202=120400=0,3P(|X-30|\geq 20)\leq\dfrac{120}{20^{2}}=\dfrac{120}{400}=0{,}3. La valeur exacte se lit sur la loi : ∣X−30∣≥20|X-30|\geq 20 signifie X=10X=10 ou X=50X=50, de probabilité 0,1+0,1=0,20{,}1+0{,}1=0{,}2. La majoration est vraie, 0,2≤0,30{,}2\leq 0{,}3, mais elle n'est pas égale à la probabilité. L'inégalité n'utilise de la loi que deux nombres, μ\mu et VV : elle vaut pour TOUTES les lois qui ont cette espérance et cette variance, et doit donc être assez large pour la pire d'entre elles. C'est son intérêt, elle marche sans connaître la loi, et c'est sa limite.

c) Avec δ=15\delta=15 : P(∣X−30∣≥15)≤120225≈0,533P(|X-30|\geq 15)\leq\dfrac{120}{225}\approx 0{,}533. Or ∣X−30∣≥15|X-30|\geq 15 signifie encore X=10X=10 ou X=50X=50, puisque les écarts possibles ne valent que 00, 1010 ou 2020 : la probabilité exacte reste 0,20{,}2. La majoration dépend continûment de δ\delta, la probabilité exacte, elle, ne change que lorsque δ\delta franchit un écart réellement possible. Écrire que la probabilité « vaut » 0,5330{,}533 serait une faute : l'inégalité ne donne qu'une borne supérieure, et la phrase de conclusion doit dire « est inférieure ou égale à ».

d) Avec δ=10\delta=10 : 120100=1,2\dfrac{120}{100}=1{,}2, et toute probabilité est déjà inférieure à 11 : l'inégalité n'apprend RIEN. Ce n'est pas une erreur de calcul, c'est ce qui arrive dès que δ≤σ\delta\leq\sigma, ici 10<10,9510<10{,}95 : l'inégalité ne dit quelque chose que pour des écarts de plusieurs écarts types. La valeur exacte est P(X≠30)=0,6P(X\neq 30)=0{,}6. Pour la minoration, on passe à l'événement contraire : 10<X<5010<X<50 équivaut à ∣X−30∣<20|X-30|<20, donc P(10<X<50)=1−P(∣X−30∣≥20)≥1−0,3=0,7P(10<X<50)=1-P(|X-30|\geq 20)\geq 1-0{,}3=0{,}7. La valeur exacte est 0,2+0,4+0,2=0,80{,}2+0{,}4+0{,}2=0{,}8, bien supérieure ou égale à 0,70{,}7. Cette forme, « au moins 70 %70\ \% des jours », est celle qu'on utilise pour garantir un résultat.

Partie B : problèmes et raisonnement (/50)

Exercice 6 : La linéarité sans l'indépendance : le vestiaire

À la fin d'une soirée, nn invités récupèrent au hasard un manteau chacun dans un vestiaire qui en contient exactement nn, toutes les répartitions étant équiprobables. On note XX le nombre d'invités qui repartent avec LEUR manteau, et, pour ii de 11 à nn, IiI_{i} la variable qui vaut 11 si l'invité ii récupère son manteau et 00 sinon.

Pour n=4n=4, les 2424 répartitions possibles se classent comme dans le tableau ci-dessous, selon le nombre kk d'invités qui récupèrent leur manteau.

k01234répartitions98601
  • a) Dans le cas général, quelle est la loi de IiI_{i} ? Donnez E(Ii)E(I_{i}) en fonction de nn, puis sa valeur pour n=4n=4.
  • b) Écrivez XX à l'aide des IiI_{i} et déduisez-en E(X)E(X). Vérifiez le résultat pour n=4n=4 avec le tableau.
  • c) Pour n=4n=4, calculez V(X)V(X) à partir du tableau. Comparez avec V(I1)+V(I2)+V(I3)+V(I4)V(I_{1})+V(I_{2})+V(I_{3})+V(I_{4}) et expliquez l'écart.
  • d) Le vestiaire d'une salle de spectacle contient 300300 manteaux. Combien d'invités, en moyenne, repartent avec le leur ? Pourquoi serait-il déraisonnable de chercher la loi de XX pour répondre ?

Tape tes réponses, la page te dit juste ou faux 0/6

a)
b)
c)
d)
Voir la correction

Réponses

  • a) IiI_{i} suit la loi de Bernoulli de paramètre 1n\frac{1}{n} ; E(Ii)=1nE(I_{i})=\frac{1}{n}, soit 0,250{,}25 pour n=4n=4
  • b) X=I1+⋯+InX=I_{1}+\dots+I_{n}, E(X)=n×1n=1E(X)=n\times\frac{1}{n}=1 ; tableau : 8+12+0+424=1\frac{8+12+0+4}{24}=1
  • c) V(X)=2−12=1V(X)=2-1^{2}=1 ; somme des variances 0,750{,}75 : les IiI_{i} ne sont pas indépendantes
  • d) En moyenne 11 invité, quel que soit nn ; la loi demanderait de classer 300!300! répartitions

a) IiI_{i} ne prend que les valeurs 00 et 11 : c'est une variable de Bernoulli. Son paramètre est la probabilité que l'invité ii reçoive son propre manteau. Toutes les répartitions étant équiprobables, le manteau que reçoit l'invité ii est l'un des nn manteaux, chacun avec la même probabilité, donc P(Ii=1)=1nP(I_{i}=1)=\frac{1}{n}. Pour n=4n=4 : sur les 2424 répartitions, celles où l'invité 11 a son manteau sont les 3!=63!=6 façons de répartir les trois autres, et 624=14\frac{6}{24}=\frac{1}{4}. Donc E(Ii)=1nE(I_{i})=\frac{1}{n}, et 0,250{,}25 pour n=4n=4.

b) Chaque invité qui retrouve son manteau ajoute 11 au compte : X=I1+I2+⋯+InX=I_{1}+I_{2}+\dots+I_{n}. Par linéarité, E(X)=n×1n=1E(X)=n\times\frac{1}{n}=1, QUEL QUE SOIT nn. Vérification pour n=4n=4 : E(X)=0×9+1×8+2×6+3×0+4×124=2424=1E(X)=\frac{0\times 9+1\times 8+2\times 6+3\times 0+4\times 1}{24}=\frac{24}{24}=1. Le résultat est remarquable, et il n'a demandé ni la loi de XX, ni aucune indépendance. C'est le sens de la capacité du programme « représenter une variable comme somme de variables aléatoires plus simples » : on découpe XX en indicatrices, dont l'espérance est une simple probabilité.

c) E(X2)=1×8+4×6+9×0+16×124=4824=2E(X^{2})=\frac{1\times 8+4\times 6+9\times 0+16\times 1}{24}=\frac{48}{24}=2, donc V(X)=2−1=1V(X)=2-1=1. Chaque IiI_{i} a pour variance 14×34=316\frac{1}{4}\times\frac{3}{4}=\frac{3}{16}, et la somme des quatre vaut 1216=0,75\frac{12}{16}=0{,}75, différente de 11. L'additivité ne s'applique pas, parce que les IiI_{i} ne sont PAS indépendantes : le tableau le montre, k=3k=3 est impossible, car si trois invités ont leur manteau, le quatrième n'a plus que le sien. Savoir que I1=1I_{1}=1 change la probabilité que I2=1I_{2}=1, qui passe de 14\frac{1}{4} à 13\frac{1}{3}. La linéarité de l'espérance a fonctionné en b), l'additivité de la variance échoue ici : c'est exactement la frontière du chapitre.

d) La linéarité donne E(X)=300×1300=1E(X)=300\times\frac{1}{300}=1 : en moyenne un seul invité repart avec son manteau, qu'il y ait 44, 300300 ou un million de manteaux. Chercher la loi de XX obligerait à classer 300!300! répartitions, un nombre de plus de six cents chiffres, et même le cas n=4n=4 a demandé un tableau. Dans un exercice de baccalauréat, le mot « en moyenne » devant une variable qui COMPTE quelque chose doit faire penser à une somme d'indicatrices avant tout calcul de loi.

Exercice 7 : Simuler N échantillons et retrouver sigma sur racine de n

Dans un jeu vidéo, chaque coffre ouvert contient 11 pièce d'or avec la probabilité 45\frac{4}{5} et 66 pièces avec la probabilité 15\frac{1}{5}. On note XX le nombre de pièces d'un coffre. Le programme ci-dessous simule NN échantillons de taille nn de la loi de XX et renvoie l'écart type ss de la série des NN moyennes obtenues.

Exécuté avec N=1 000N=1\,000 et n=100n=100, il renvoie s≈0,1986s\approx 0{,}1986, et la moyenne des 1 0001\,000 moyennes vaut 1,9861{,}986. L'histogramme de ces 1 0001\,000 moyennes est donné ci-dessous. Parmi elles, 74,6 %74{,}6\ \% sont à moins de 0,20{,}2 de 22, 96,4 %96{,}4\ \% à moins de 0,40{,}4 et 99,9 %99{,}9\ \% à moins de 0,60{,}6.

1,591,6211,7561,81251,918022072,11582,21242,3732,4292,5132,642,710100200effectifs des 1 000 moyennes
from random import choice
from math import sqrt

def moyenne_echantillon(n):
    s = 0
    for k in range(n):
        s = s + choice([1, 1, 1, 1, 6])
    return ...

def ecart_type_moyennes(N, n):
    L = [moyenne_echantillon(n) for j in range(N)]
    m = sum(L) / N
    v = sum((x - m)**2 for x in L) / N
    return sqrt(v)
  • a) Calculez μ=E(X)\mu=E(X), V(X)V(X) et σ(X)\sigma(X). Pourquoi la liste [1, 1, 1, 1, 6] simule-t-elle bien la loi de XX ?
  • b) Complétez la ligne return de la première fonction. Calculez E(M100)E(M_{100}) et σ(M100)\sigma(M_{100}), puis comparez avec la sortie du programme.
  • c) Quelle valeur de ss doit-on attendre, approximativement, si l'on exécute ecart_type_moyennes(1000, 400) ?
  • d) Les trois pourcentages de l'énoncé correspondent à des écarts de k σnk\,\frac{\sigma}{\sqrt{n}} pour k=1k=1, 22 et 33. Quelle proportion minimale l'inégalité de Bienaymé-Tchebychev garantit-elle dans chaque cas ? Commentez.

Tape tes réponses, la page te dit juste ou faux 0/7

a)
b)
c)
d)
Voir la correction

Réponses

  • a) μ=2\mu=2, V(X)=8−4=4V(X)=8-4=4, σ(X)=2\sigma(X)=2 ; la liste contient 66 une fois sur cinq
  • b) return s / n ; E(M100)=2E(M_{100})=2, σ(M100)=210=0,2\sigma(M_{100})=\frac{2}{10}=0{,}2, contre s≈0,1986s\approx 0{,}1986 observé
  • c) s≈2400=0,1s\approx\frac{2}{\sqrt{400}}=0{,}1
  • d) Au moins 00, 0,750{,}75 et 89≈0,889\frac{8}{9}\approx 0{,}889 ; observé 0,7460{,}746, 0,9640{,}964 et 0,9990{,}999 : l'inégalité est vraie mais très prudente

a) μ=1×45+6×15=105=2\mu=1\times\frac{4}{5}+6\times\frac{1}{5}=\frac{10}{5}=2, E(X2)=1×45+36×15=405=8E(X^{2})=1\times\frac{4}{5}+36\times\frac{1}{5}=\frac{40}{5}=8, donc V(X)=8−4=4V(X)=8-4=4 et σ(X)=2\sigma(X)=2. La fonction choice tire un élément de la liste de façon équiprobable : la liste contient cinq éléments dont un seul vaut 66, donc 66 sort avec la probabilité 15\frac{1}{5} et 11 avec 45\frac{4}{5}. Écrire choice([1, 6]) serait une erreur, qui donnerait la probabilité 12\frac{1}{2} à chaque valeur. Chaque appel est indépendant des précédents, ce qui fait des nn tirages un échantillon.

b) La variable s accumule la somme SnS_{n} ; la fonction doit renvoyer la MOYENNE, donc return s / n. Pour n=100n=100 : E(M100)=μ=2E(M_{100})=\mu=2 et V(M100)=V(X)100=0,04V(M_{100})=\frac{V(X)}{100}=0{,}04, d'où σ(M100)=σ100=210=0,2\sigma(M_{100})=\frac{\sigma}{\sqrt{100}}=\frac{2}{10}=0{,}2. Le programme renvoie s≈0,1986s\approx 0{,}1986 pour l'écart type OBSERVÉ des 1 0001\,000 moyennes, et leur moyenne vaut 1,9861{,}986, proche de 22. La simulation confirme la formule σ(Mn)=σn\sigma(M_{n})=\frac{\sigma}{\sqrt{n}} : une moyenne de 100100 coffres est dix fois moins dispersée qu'un coffre isolé, alors que la loi de XX est très dissymétrique. Attention : ss est une valeur observée, qui change à chaque exécution ; σn\frac{\sigma}{\sqrt{n}} est la valeur théorique autour de laquelle ss fluctue.

c) Avec n=400n=400 : σn=220=0,1\frac{\sigma}{\sqrt{n}}=\frac{2}{20}=0{,}1. Quadrupler la taille des échantillons divise l'écart type des moyennes par 22, pas par 44. On attend donc un ss voisin de 0,10{,}1, et un histogramme deux fois plus resserré autour de 22.

d) L'inégalité de concentration donne P(∣Mn−μ∣≥kσn)≤V/nk2V/n=1k2P\left(|M_{n}-\mu|\geq k\frac{\sigma}{\sqrt{n}}\right)\leq\dfrac{V/n}{k^{2}V/n}=\dfrac{1}{k^{2}}, donc une proportion d'au moins 1−1k21-\frac{1}{k^{2}} dans l'intervalle. Pour k=1k=1 : au moins 00, l'inégalité ne dit rien. Pour k=2k=2 : au moins 0,750{,}75. Pour k=3k=3 : au moins 89≈0,889\frac{8}{9}\approx 0{,}889. Les proportions observées, 0,7460{,}746, 0,9640{,}964 et 0,9990{,}999, respectent ces garanties avec une large marge. Le programme officiel le souligne : l'inégalité est universelle, elle vaut pour toute loi, et la contrepartie est qu'elle est loin d'être optimale. Elle sert à GARANTIR, par une condition suffisante, pas à prédire la proportion réelle, que seule la simulation ou le calcul exact donnent.

from random import choice
from math import sqrt

def moyenne_echantillon(n):
    s = 0
    for k in range(n):
        s = s + choice([1, 1, 1, 1, 6])
    return s / n

def ecart_type_moyennes(N, n):
    L = [moyenne_echantillon(n) for j in range(N)]
    m = sum(L) / N
    v = sum((x - m)**2 for x in L) / N
    return sqrt(v)

Exercice 8 : Cinq affirmations à corriger

Chacune des cinq affirmations suivantes est FAUSSE. Dites pourquoi, puis donnez la version correcte. Sauf mention contraire, XX et YY sont deux variables aléatoires indépendantes telles que E(X)=1E(X)=1, V(X)=2V(X)=2, E(Y)=4E(Y)=4 et V(Y)=3V(Y)=3.

  • a) « Pour toutes variables aléatoires UU et WW, on a V(U+W)=V(U)+V(W)V(U+W)=V(U)+V(W). » Pour la réfuter, calculez V(X+X)V(X+X).
  • b) « La formule E(U+W)=E(U)+E(W)E(U+W)=E(U)+E(W) n'est valable que si UU et WW sont indépendantes. »
  • c) « V(3X)=3V(X)=6V(3X)=3V(X)=6. »
  • d) « Comme XX et YY sont indépendantes, V(X−Y)=V(X)−V(Y)=−1V(X-Y)=V(X)-V(Y)=-1. »
  • e) « Si l'on multiplie par 44 la taille d'un échantillon, l'écart type de sa moyenne est divisé par 44. »

Tape tes réponses, la page te dit juste ou faux 0/5

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) Faux : V(X+X)=V(2X)=8≠4V(X+X)=V(2X)=8\neq 4 ; l'additivité exige l'indépendance
  • b) Faux : la linéarité de l'espérance vaut pour toutes variables
  • c) Faux : V(3X)=9V(X)=18V(3X)=9V(X)=18
  • d) Faux : V(X−Y)=V(X)+V(−Y)=V(X)+V(Y)=5V(X-Y)=V(X)+V(-Y)=V(X)+V(Y)=5
  • e) Faux : σ(M4n)=σ4n=12 σ(Mn)\sigma(M_{4n})=\frac{\sigma}{\sqrt{4n}}=\frac{1}{2}\,\sigma(M_{n}), divisé par 22

a) La variable XX n'est pas indépendante d'elle-même. X+X=2XX+X=2X, donc V(X+X)=22V(X)=8V(X+X)=2^{2}V(X)=8, alors que l'affirmation donnerait V(X)+V(X)=4V(X)+V(X)=4. Version correcte : « si UU et WW sont INDÉPENDANTES, alors V(U+W)=V(U)+V(W)V(U+W)=V(U)+V(W) ». Au baccalauréat, l'additivité s'utilise dans le cadre d'une succession d'épreuves indépendantes, et la phrase qui la justifie rapporte le point : « les variables sont indépendantes, donc les variances s'additionnent ».

b) C'est l'inverse de la vérité : la linéarité de l'espérance vaut pour DEUX VARIABLES QUELCONQUES, indépendantes ou non. Le vestiaire le montre : les indicatrices IiI_{i} sont dépendantes, et pourtant E(X)=∑E(Ii)=1E(X)=\sum E(I_{i})=1. Version correcte : « pour toutes variables aléatoires UU et WW et tout réel aa, E(U+W)=E(U)+E(W)E(U+W)=E(U)+E(W) et E(aU)=aE(U)E(aU)=aE(U) ». Seule la variance demande l'indépendance. Confondre les deux conduit à refuser un calcul d'espérance parfaitement légitime, et à perdre la question entière.

c) La variance est une moyenne d'écarts AU CARRÉ : multiplier XX par 33 multiplie chaque écart à la moyenne par 33, donc chaque carré par 99. V(3X)=32V(X)=9×2=18V(3X)=3^{2}V(X)=9\times 2=18, et σ(3X)=3σ(X)=32\sigma(3X)=3\sigma(X)=3\sqrt{2}. Version correcte : V(aX)=a2V(X)V(aX)=a^{2}V(X) et σ(aX)=∣a∣ σ(X)\sigma(aX)=|a|\,\sigma(X). L'unité confirme : si XX est en mètres, V(X)V(X) est en mètres carrés, et un facteur 33 sur les mètres devient un facteur 99 sur les mètres carrés.

d) Une variance n'est jamais négative : −1-1 doit alerter immédiatement. On écrit X−Y=X+(−1)YX-Y=X+(-1)Y, et −Y-Y est indépendante de XX comme YY, donc V(X−Y)=V(X)+V(−Y)=V(X)+(−1)2V(Y)=2+3=5V(X-Y)=V(X)+V(-Y)=V(X)+(-1)^{2}V(Y)=2+3=5. Les dispersions de deux variables indépendantes s'AJOUTENT toujours, qu'on fasse la somme ou la différence : l'écart entre deux mesures indépendantes est plus incertain que chacune d'elles. Pour l'espérance, en revanche, E(X−Y)=1−4=−3E(X-Y)=1-4=-3 : là, le signe moins se conserve.

e) σ(Mn)=σn\sigma(M_{n})=\frac{\sigma}{\sqrt{n}}, donc σ(M4n)=σ4n=σ2n\sigma(M_{4n})=\frac{\sigma}{\sqrt{4n}}=\frac{\sigma}{2\sqrt{n}} : l'écart type est divisé par 4=2\sqrt{4}=2, et non par 44. C'est la VARIANCE de la moyenne qui est divisée par 44, puisque V(Mn)=VnV(M_{n})=\frac{V}{n}. Version correcte : « multiplier la taille de l'échantillon par 44 divise l'écart type de la moyenne par 22 ; pour le diviser par 44, il faut un échantillon 1616 fois plus grand ». C'est pour cela qu'une précision se paie très cher en nombre de mesures.

Exercice 9 : Moyenner des mesures : combien en faut-il pour une précision donnée ?

Un capteur mesure la température d'une cuve. Chaque mesure vaut θ+ε\theta+\varepsilon, où θ\theta est la vraie température et ε\varepsilon l'erreur de mesure, exprimée en dixièmes de degré. L'erreur prend les valeurs −2-2, −1-1, 00, 11 et 22 avec les probabilités 0,10{,}1, 0,20{,}2, 0,40{,}4, 0,20{,}2 et 0,10{,}1.

On fait nn mesures successives, dont les erreurs sont indépendantes et suivent toutes cette loi ; on note X1,…,XnX_{1},\dots,X_{n} les mesures et MnM_{n} leur moyenne. Toutes les grandeurs sont exprimées en dixièmes de degré.

  • a) Calculez E(ε)E(\varepsilon) et V(ε)V(\varepsilon), puis E(Xi)E(X_{i}) et V(Xi)V(X_{i}).
  • b) Exprimez E(Mn)E(M_{n}) et V(Mn)V(M_{n}) en fonction de θ\theta et nn. Calculez σ(M48)\sigma(M_{48}) au millième.
  • c) À l'aide de l'inégalité de concentration, déterminez le plus petit nn qui garantit P(∣Mn−θ∣≥0,5)≤0,05P(|M_{n}-\theta|\geq 0{,}5)\leq 0{,}05.
  • d) On veut maintenant une précision de 0,250{,}25 dixième, avec le même risque. Quel est le plus petit nn garanti par l'inégalité ? Par combien la taille a-t-elle été multipliée ?
  • e) Le capteur se dérègle : toutes ses erreurs augmentent de 11 dixième. Vers quelle valeur MnM_{n} se concentre-t-elle quand nn grandit ? Énoncez la loi des grands nombres utilisée.

Tape tes réponses, la page te dit juste ou faux 0/7

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) E(ε)=0E(\varepsilon)=0, V(ε)=1,2V(\varepsilon)=1{,}2 ; E(Xi)=θE(X_{i})=\theta, V(Xi)=1,2V(X_{i})=1{,}2
  • b) E(Mn)=θE(M_{n})=\theta, V(Mn)=1,2nV(M_{n})=\frac{1{,}2}{n} ; σ(M48)=0,025≈0,158\sigma(M_{48})=\sqrt{0{,}025}\approx 0{,}158
  • c) 1,20,25 n≤0,05  ⟺  n≥96\frac{1{,}2}{0{,}25\,n}\leq 0{,}05\iff n\geq 96 : n=96n=96
  • d) 1,20,0625 n≤0,05  ⟺  n≥384\frac{1{,}2}{0{,}0625\,n}\leq 0{,}05\iff n\geq 384 ; taille multipliée par 44
  • e) MnM_{n} se concentre autour de θ+1\theta+1 : moyenner réduit la dispersion, pas le biais

a) La loi de ε\varepsilon est symétrique autour de 00, donc E(ε)=0E(\varepsilon)=0 : le capteur ne se trompe pas en moyenne, il est NON BIAISÉ. E(ε2)=4×0,2+1×0,4=1,2E(\varepsilon^{2})=4\times 0{,}2+1\times 0{,}4=1{,}2, donc V(ε)=1,2−0=1,2V(\varepsilon)=1{,}2-0=1{,}2. Une mesure est Xi=θ+εiX_{i}=\theta+\varepsilon_{i}, avec θ\theta constant : E(Xi)=θ+E(εi)=θE(X_{i})=\theta+E(\varepsilon_{i})=\theta et V(Xi)=V(εi)=1,2V(X_{i})=V(\varepsilon_{i})=1{,}2, car ajouter une constante ne change pas la dispersion.

b) (X1,…,Xn)(X_{1},\dots,X_{n}) est un échantillon de la loi de XiX_{i}. Par linéarité, E(Mn)=1n×nθ=θE(M_{n})=\frac{1}{n}\times n\theta=\theta ; par indépendance, V(Mn)=1n2×n×1,2=1,2nV(M_{n})=\frac{1}{n^{2}}\times n\times 1{,}2=\frac{1{,}2}{n}. Pour n=48n=48 : V(M48)=1,248=0,025V(M_{48})=\frac{1{,}2}{48}=0{,}025 et σ(M48)=0,025≈0,158\sigma(M_{48})=\sqrt{0{,}025}\approx 0{,}158 dixième, contre 1,2≈1,095\sqrt{1{,}2}\approx 1{,}095 pour une mesure seule : c'est tout l'intérêt de moyenner.

c) L'inégalité de concentration s'écrit P(∣Mn−θ∣≥δ)≤Vnδ2P(|M_{n}-\theta|\geq\delta)\leq\dfrac{V}{n\delta^{2}} avec V=1,2V=1{,}2 et δ=0,5\delta=0{,}5 : 1,20,25 n=4,8n\dfrac{1{,}2}{0{,}25\,n}=\dfrac{4{,}8}{n}. Il SUFFIT que 4,8n≤0,05\dfrac{4{,}8}{n}\leq 0{,}05, c'est-à-dire n≥4,80,05=96n\geq\dfrac{4{,}8}{0{,}05}=96. Le plus petit entier garanti est n=96n=96. C'est un raisonnement par condition suffisante : la vraie probabilité est sans doute bien plus petite, mais 9696 mesures sont CERTAINES de suffire, quelle que soit la forme exacte de la loi. La courbe bleue de la correction montre la majoration 4,8n\frac{4{,}8}{n} qui passe sous le seuil 0,050{,}05 en n=96n=96.

d) Avec δ=0,25\delta=0{,}25 : 1,20,0625 n=19,2n≤0,05\dfrac{1{,}2}{0{,}0625\,n}=\dfrac{19{,}2}{n}\leq 0{,}05 équivaut à n≥384n\geq 384. La précision a été divisée par 22 et la taille multipliée par 4=224=2^{2}, parce que δ\delta figure AU CARRÉ dans la majoration. Diviser la marge par 1010 demanderait 100100 fois plus de mesures : c'est la même loi du n\sqrt{n} que pour l'écart type de la moyenne.

e) Les nouvelles erreurs valent εi+1\varepsilon_{i}+1, d'espérance 11 et toujours de variance 1,21{,}2. Alors E(Mn)=θ+1E(M_{n})=\theta+1 et V(Mn)=1,2nV(M_{n})=\frac{1{,}2}{n} : la moyenne se concentre autour de θ+1\theta+1, soit un dixième de degré au-dessus de la vraie température. LOI DES GRANDS NOMBRES : pour tout δ>0\delta>0, P(∣Mn−μ∣≥δ)P(|M_{n}-\mu|\geq\delta) tend vers 00 quand nn tend vers +∞+\infty, où μ\mu est l'espérance d'UNE mesure, ici θ+1\theta+1. Moyenner réduit la dispersion, jamais le biais : mille mesures d'un capteur mal étalonné donnent, avec une grande précision, une valeur fausse.

501001502002503003504004500,050,10,150,20,250,3δ = 0,5δ = 0,25risque 0,05n

Exercice 10 : La marche aléatoire : une somme de pas indépendants

Un pion part de l'origine d'une droite graduée. À chaque seconde, il avance d'une unité avec la probabilité p=0,6p=0{,}6 et recule d'une unité avec la probabilité 0,40{,}4, indépendamment des pas précédents. On note XiX_{i} le déplacement au pas numéro ii, qui vaut 11 ou −1-1, et Sn=X1+⋯+XnS_{n}=X_{1}+\dots+X_{n} la position après nn pas. La figure montre une trajectoire de 100100 pas obtenue par le programme ci-dessous.

On a simulé 1 0001\,000 marches de 100100 pas : la moyenne des positions finales vaut 20,31820{,}318, leur écart type 10,16510{,}165, et 2727 marches sur 1 0001\,000 finissent à une position négative ou nulle.

102030405060708090100-551015202530droite y = 0,2 xune trajectoirepas
from random import random

def marche(n, p):
    s = 0
    for k in range(n):
        if random() < p:
            s = s + 1
        else:
            s = s - 1
    return s
  • a) On pose Bi=1B_{i}=1 si le pas ii est vers l'avant, 00 sinon. Exprimez XiX_{i} en fonction de BiB_{i}, puis calculez E(Xi)E(X_{i}) et V(Xi)V(X_{i}).
  • b) Calculez E(S100)E(S_{100}), V(S100)V(S_{100}) et σ(S100)\sigma(S_{100}) au centième. La simulation est-elle cohérente ?
  • c) Majorez P(S100≤0)P(S_{100}\leq 0) par l'inégalité de Bienaymé-Tchebychev. Exprimez ensuite S100S_{100} à l'aide d'une variable binomiale et donnez la valeur exacte à 10−410^{-4} près.
  • d) Pour la marche SYMÉTRIQUE (p=0,5p=0{,}5), calculez E(Sn)E(S_{n}) et σ(Sn)\sigma(S_{n}). Que vaut σ(S10 000)\sigma(S_{10\,000}) ? Que dit la loi des grands nombres de Snn\frac{S_{n}}{n} ?

Tape tes réponses, la page te dit juste ou faux 0/8

a)
b)
c)
d)
Voir la correction

Réponses

  • a) Xi=2Bi−1X_{i}=2B_{i}-1 ; E(Xi)=0,2E(X_{i})=0{,}2, V(Xi)=4×0,24=0,96V(X_{i})=4\times 0{,}24=0{,}96
  • b) E(S100)=20E(S_{100})=20, V(S100)=96V(S_{100})=96, σ(S100)≈9,80\sigma(S_{100})\approx 9{,}80 ; cohérent avec 20,31820{,}318 et 10,16510{,}165
  • c) P(S100≤0)≤P(∣S100−20∣≥20)≤0,24P(S_{100}\leq 0)\leq P(|S_{100}-20|\geq 20)\leq 0{,}24 ; S100=2B−100S_{100}=2B-100, B∼B(100 ;0,6)B\sim\mathcal{B}(100\,;0{,}6), P(B≤50)≈0,0271P(B\leq 50)\approx 0{,}0271
  • d) E(Sn)=0E(S_{n})=0, σ(Sn)=n\sigma(S_{n})=\sqrt{n}, σ(S10 000)=100\sigma(S_{10\,000})=100 ; Snn\frac{S_{n}}{n} se concentre autour de 00

a) Si Bi=1B_{i}=1, Xi=1X_{i}=1 ; si Bi=0B_{i}=0, Xi=−1X_{i}=-1 : dans les deux cas Xi=2Bi−1X_{i}=2B_{i}-1. BiB_{i} suit la loi de Bernoulli de paramètre 0,60{,}6, donc E(Xi)=2×0,6−1=0,2E(X_{i})=2\times 0{,}6-1=0{,}2 et V(Xi)=22V(Bi)=4×0,6×0,4=0,96V(X_{i})=2^{2}V(B_{i})=4\times 0{,}6\times 0{,}4=0{,}96. Vérification directe : E(Xi2)=1E(X_{i}^{2})=1 puisque Xi2=1X_{i}^{2}=1 toujours, et V(Xi)=1−0,22=0,96V(X_{i})=1-0{,}2^{2}=0{,}96.

b) Par linéarité, E(S100)=100×0,2=20E(S_{100})=100\times 0{,}2=20. Les pas sont indépendants, donc V(S100)=100×0,96=96V(S_{100})=100\times 0{,}96=96 et σ(S100)=96≈9,80\sigma(S_{100})=\sqrt{96}\approx 9{,}80. La simulation donne une moyenne de 20,31820{,}318 et un écart type de 10,16510{,}165 : des valeurs observées sur 1 0001\,000 marches, qui fluctuent autour des valeurs théoriques, et l'accord est bon. La trajectoire de la figure suit en gros la droite en pointillé, de pente 0,20{,}2 : c'est la dérive moyenne, E(Sn)=0,2 nE(S_{n})=0{,}2\,n, autour de laquelle la position oscille.

c) Si S100≤0S_{100}\leq 0, alors S100−20≤−20S_{100}-20\leq -20, donc ∣S100−20∣≥20|S_{100}-20|\geq 20 : l'événement {S100≤0}\{S_{100}\leq 0\} est inclus dans {∣S100−20∣≥20}\{|S_{100}-20|\geq 20\}. D'où P(S100≤0)≤96202=0,24P(S_{100}\leq 0)\leq\dfrac{96}{20^{2}}=0{,}24. Justifier cette inclusion est le point de rédaction, car l'inégalité porte sur un écart dans les DEUX sens. Pour la valeur exacte, S100=∑(2Bi−1)=2B−100S_{100}=\sum(2B_{i}-1)=2B-100, où B=B1+⋯+B100B=B_{1}+\dots+B_{100} suit la loi binomiale B(100 ;0,6)\mathcal{B}(100\,;0{,}6). S100≤0S_{100}\leq 0 équivaut à B≤50B\leq 50, et la calculatrice donne P(B≤50)≈0,0271P(B\leq 50)\approx 0{,}0271, en accord avec les 2727 marches sur 1 0001\,000 de la simulation. La majoration 0,240{,}24 est vraie mais neuf fois trop large : elle ne connaît que l'espérance et la variance.

d) Pour p=0,5p=0{,}5 : E(Xi)=0E(X_{i})=0 et V(Xi)=1V(X_{i})=1, donc E(Sn)=0E(S_{n})=0 et V(Sn)=nV(S_{n})=n, σ(Sn)=n\sigma(S_{n})=\sqrt{n}. Après 10 00010\,000 pas, σ(S10 000)=100\sigma(S_{10\,000})=100 : le pion n'a AUCUNE dérive, et pourtant il s'éloigne typiquement d'une centaine d'unités de l'origine, dans un sens ou dans l'autre. Espérance nulle ne veut pas dire « reste près de 00 ». En revanche la position MOYENNE par pas, Snn\frac{S_{n}}{n}, a pour espérance 00 et pour écart type nn=1n\frac{\sqrt{n}}{n}=\frac{1}{\sqrt{n}}, soit 0,010{,}01 pour n=10 000n=10\,000 : c'est la loi des grands nombres, P(∣Snn∣≥δ)≤1nδ2P\left(\left|\frac{S_{n}}{n}\right|\geq\delta\right)\leq\frac{1}{n\delta^{2}} tend vers 00. La somme se disperse comme n\sqrt{n}, la moyenne se resserre comme 1n\frac{1}{\sqrt{n}} : c'est le fil de la série, vu sur une trajectoire.

Chapitre précédent Loi binomiale et concentration Chapitre suivant La convexité

© Ahmed Squalli Houssaini. Série publiée sur www.letuteurscientifique.ca/exercices/tspe-sommes-variables-aleatoires. Libre pour l'usage personnel et en classe ; sa republication ailleurs demande une autorisation écrite (mentions légales).

Voir aussi

Vous cherchez un tuteur de spécialité maths en Terminale à Montréal ?

Contactez-moi pour une première séance. Ce chapitre ferme la partie probabilités du programme : un élève qui distingue une somme de copies indépendantes d'une copie multipliée par n y trouve des points faciles à l'épreuve.

Site par Studio Squalli