Maths Première, programme français • Exercices corrigés à Montréal

Exercices corrigés : analyse de l'information chiffrée, tableau croisé et nuage de points (Première)

Voici une série d'exercices corrigés sur l'analyse de l'information chiffrée, première partie du programme de mathématiques du tronc commun de Première, intégré à l'enseignement scientifique et suivi par les élèves qui ne font pas davantage de mathématiques en Première. Elle s'adresse aux élèves des lycées français, dont le Lycée Marie de France et le Collège Stanislas à Montréal, et à tout élève qui prépare l'épreuve anticipée de fin de Première.

Le fil de la série tient en une phrase : un chiffre ne répond qu'à la question pour laquelle il a été calculé. Une fréquence se lit dans SA population, une droite d'ajustement ne vaut que dans la PLAGE de ses données, et une corrélation, même forte, ne dit jamais la cause.

Aucun calcul ne demande de calculatrice : les nombres ont été choisis pour se traiter à la main, comme à l'épreuve, et les coefficients des moindres carrés sont donnés par le tableur, conformément au programme, qui n'attend aucune théorie sur cette méthode. Les données sont vraisemblables et arrondies pour le calcul. Le tableau croisé lui-même, avec ses fréquences conditionnelles, a sa série de Seconde : celle-ci va au croisement représenté et aux deux caractères quantitatifs.

Faites chaque exercice au complet avant d'ouvrir la correction : c'est en cherchant qu'on apprend, pas en lisant la solution.

Série autocorrigée Tape tes réponses sous chaque question : la page te dit juste ou faux avant d'ouvrir la correction. Avec un compte, chaque bonne réponse du premier coup rapporte des points.

Ce chapitre fait partie de Maths du tronc commun en Première, sans spécialité
Avant de commencer Fiche de révision : les pièges et la méthode de ce chapitre

Avant ce chapitre

Ces notions sont supposées acquises ici. Si le premier exercice résiste, le blocage vient presque toujours de l'une d'elles, pas du chapitre lui-même.

Remonter plus loin : la chaîne complète (7 chapitres) ↓

Le chemin de remédiation, du plus ancien au plus proche. Un élève qui reprend ce chapitre de zéro le reprend dans cet ordre.

  1. 1Proportionnalité et pourcentagesCinquième, Mathématiques
  2. 2Proportionnalité, pourcentages et vitessesQuatrième, Mathématiques
  3. 3Statistiques et probabilitésQuatrième, Mathématiques
  4. 4Moyenne, médiane, quartiles et étendueTroisième, Mathématiques
  5. 5Pourcentages et évolutionsSeconde, Mathématiques
  6. 6Les statistiques descriptivesSeconde, Mathématiques
  7. 7Tableaux croisés et fréquences conditionnellesSeconde, Mathématiques

Rappel de cours

  • • FRÉQUENCE MARGINALE : un total de ligne ou de colonne divisé par le total général. FRÉQUENCE CONDITIONNELLE de AA parmi BB : l'effectif de la case AA et BB divisé par l'effectif de BB.
  • • Deux caractères qualitatifs sont LIÉS quand leurs fréquences conditionnelles s'écartent nettement de la fréquence marginale. Un lien constaté n'est pas une cause.
  • • DIAGRAMME CIRCULAIRE : angle d'un secteur == fréquence ×360\times 360 degrés. Deux diagrammes circulaires comparent des répartitions, jamais des effectifs.
  • • La fréquence d'ensemble est la moyenne des fréquences des groupes PONDÉRÉE par leurs effectifs ; elle n'est leur moyenne simple que si les groupes ont le même effectif.
  • • Un caractère quantitatif peut être regroupé en classes ; par ses quartiles, il donne quatre classes de même effectif.
  • • NUAGE DE POINTS : on décrit le sens du lien et sa forme avant tout calcul. POINT MOYEN : G(xˉ ;yˉ)G(\bar{x}\,;\bar{y}), moyennes de TOUTES les valeurs.
  • • AJUSTEMENT AU JUGÉ : une droite qui suit la direction du nuage et passe par GG.
  • • DROITE DE MAYER : on range les points selon xx, on les partage en deux groupes de même effectif, et l'on trace la droite (G1G2)(G_{1}G_{2}) des deux points moyens ; elle passe par GG.
  • • MOINDRES CARRÉS : la droite donnée par le tableur rend minimale la somme des carrés des écarts verticaux ; elle passe par GG, ce qui sert de vérification.
  • • INTERPOLATION : estimer dans la plage des données. EXTRAPOLATION : estimer hors de cette plage ; d'autant moins fiable qu'on s'en éloigne.
  • • Le coefficient directeur s'interprète AVEC SES UNITÉS : unité de yy par unité de xx.
  • • CORRÉLATION N'EST PAS CAUSALITÉ : un troisième caractère peut faire varier les deux autres ensemble.

Partie A : les bases (/50)

Exercice 1 : Lire un tableau croisé dans les deux sens : l'étiquette énergie des logements

Une commune a fait réaliser le diagnostic de performance énergétique de 800800 logements. Chaque logement est décrit par deux caractères qualitatifs : sa période de construction, et sa classe énergétique regroupée en trois modalités, économe (classes A à C), moyen (classe D) et énergivore (classes E à G). Le tableau croise les deux caractères.

Dans chaque question, écrivez d'abord PARMI QUELS logements vous comptez, puis le total par lequel vous divisez.

avant 19751975 à 2000après 2000Totaléconome2060120200moyen8014060280énergivore20010020320Total300300200800
  • a) Donnez la fréquence marginale des logements énergivores, puis celle des logements construits avant 1975.
  • b) Calculez la fréquence des logements énergivores parmi ceux construits avant 1975, puis parmi ceux construits après 2000.
  • c) Calculez la fréquence des logements construits avant 1975 parmi les logements énergivores. Pourquoi n'est-ce pas la première fréquence de b) ?
  • d) Calculez la fréquence des logements énergivores parmi ceux construits de 1975 à 2000. En comparant les fréquences conditionnelles à la fréquence marginale de a), dites si les deux caractères sont liés.

Tape tes réponses, la page te dit juste ou faux 0/8

a)
b)
c)
d)
Voir la correction

Réponses

  • a) Énergivores : 320800=0,4\frac{320}{800}=0{,}4 ; avant 1975 : 300800=0,375\frac{300}{800}=0{,}375
  • b) Parmi les logements d'avant 1975 : 200300≈0,667\frac{200}{300}\approx 0{,}667 ; parmi ceux d'après 2000 : 20200=0,1\frac{20}{200}=0{,}1
  • c) 200320=0,625\frac{200}{320}=0{,}625 : même case 200200, mais on divise par les 320320 énergivores, pas par les 300300 logements anciens
  • d) 100300≈0,333\frac{100}{300}\approx 0{,}333 ; les fréquences 0,6670{,}667, 0,3330{,}333 et 0,10{,}1 s'écartent de 0,40{,}4 : les caractères sont liés

a) Une fréquence marginale se lit sur un TOTAL du tableau, divisé par le total général : on ignore l'autre caractère. Logements énergivores : 320800=0,4\dfrac{320}{800}=0{,}4, soit 40 %40\ \% des logements étudiés. Logements construits avant 1975 : 300800=0,375\dfrac{300}{800}=0{,}375, soit 37,5 %37{,}5\ \%. Ces deux nombres décrivent chacun UN seul caractère : ils ne disent encore rien du lien entre la période et la classe énergétique. Pour le chercher, il faut croiser, c'est-à-dire compter à l'intérieur d'une sous-population.

b) On se place parmi les 300300 logements construits avant 1975 : c'est le total de leur colonne, et c'est lui qui va au dénominateur. Parmi eux, 200200 sont énergivores : 200300=23≈0,667\dfrac{200}{300}=\dfrac{2}{3}\approx 0{,}667. Parmi les 200200 logements construits après 2000, 2020 sont énergivores : 20200=0,1\dfrac{20}{200}=0{,}1. Deux logements anciens sur trois sont énergivores, contre un logement récent sur dix. On ne compare pas les effectifs 200200 et 2020 entre eux : les deux colonnes n'ont pas le même total, et seul le quotient par ce total permet une comparaison honnête.

c) Cette fois la population est celle des 320320 logements énergivores, total de leur LIGNE. Parmi eux, 200200 datent d'avant 1975 : 200320=0,625\dfrac{200}{320}=0{,}625. Le numérateur est la même case que dans la première fréquence de b), les 200200 logements anciens ET énergivores ; seul le dénominateur change, 320320 au lieu de 300300. Les deux phrases ne disent pas la même chose : « deux logements anciens sur trois sont énergivores » renseigne sur l'état du parc ancien, « 62,5 %62{,}5\ \% des logements énergivores sont anciens » renseigne sur l'origine des logements à rénover. Un service de rénovation qui cible les énergivores a besoin de la seconde, le propriétaire d'un logement ancien de la première.

d) Parmi les 300300 logements de 1975 à 2000 : 100300=13≈0,333\dfrac{100}{300}=\dfrac{1}{3}\approx 0{,}333. Si la classe énergétique ne dépendait pas de la période, on trouverait à peu près la fréquence marginale, 40 %40\ \% d'énergivores, dans chaque colonne. Or les trois fréquences conditionnelles, 0,6670{,}667, 0,3330{,}333 et 0,10{,}1, s'en écartent nettement et décroissent avec la période : les deux caractères sont liés, plus le logement est récent, moins il est souvent énergivore. Une explication est plausible, la première réglementation thermique des bâtiments date de 1974, mais le tableau seul ne la démontre pas : il constate un lien, il n'en donne pas la cause. La méthode à retenir pour deux caractères qualitatifs est celle-ci : comparer les fréquences conditionnelles entre elles et à la fréquence marginale.

Coche ici les exercices faits ou à revoir : un compte gratuit, sans mot de passe, retient tes coches d'une visite à l'autre et te dit quel chapitre attaquer ensuite. Crée ton espace, un courriel suffit.

Exercice 2 : Deux diagrammes circulaires : comparer des parts, pas des surfaces

Une enquête relève le mode de déplacement principal des actifs pour aller travailler, dans deux communes. La commune A, une grande ville, compte 3 6003\,600 actifs ; la commune B, une petite ville, en compte 1 2001\,200. Chaque diagramme circulaire donne la répartition des actifs de SA commune, et les deux disques ont été dessinés de la même taille.

Sur la figure, V désigne la voiture, T les transports en commun et M le vélo ou la marche ; l'angle de chaque secteur est écrit à côté de sa lettre.

V 90°T 144°M 126°V 252°T 36°M 72°A : 3 600 actifsB : 1 200 actifs
  • a) Dans la commune A, calculez la fréquence des actifs qui vont travailler en voiture, puis leur nombre.
  • b) Même question pour la commune B.
  • c) Un élu de la commune B déclare : « Chez nous, le secteur voiture est presque trois fois plus grand : nous avons bien plus d'automobilistes que la commune A. » Qu'en pensez-vous ?
  • d) On réunit les deux communes. Calculez le nombre d'automobilistes, puis l'angle du secteur voiture dans le diagramme circulaire des 4 8004\,800 actifs. Pourquoi n'est-ce pas la moyenne des deux angles ?

Tape tes réponses, la page te dit juste ou faux 0/7

a)
b)
c)
d)
Voir la correction

Réponses

  • a) 90360=0,25\frac{90}{360}=0{,}25, soit 900900 automobilistes
  • b) 252360=0,7\frac{252}{360}=0{,}7, soit 840840 automobilistes
  • c) Faux : B a moins d'automobilistes, 840840 contre 900900 ; un disque montre une répartition, pas un effectif
  • d) 1 7401\,740 automobilistes, angle 1 7404 800×360=130,5\frac{1\,740}{4\,800}\times 360=130{,}5 degrés ; la moyenne 171171 oublie que A pèse trois fois plus

a) Un diagramme circulaire répartit les 360360 degrés du disque proportionnellement aux effectifs : la fréquence d'une modalité est l'angle de son secteur divisé par 360360. Commune A, voiture : 90360=0,25\dfrac{90}{360}=0{,}25. Le nombre d'automobilistes s'obtient en appliquant cette fréquence au total de SA commune : 0,25×3 600=9000{,}25\times 3\,600=900. Contrôle : les trois angles de A, 90+144+12690+144+126, font bien 360360, et les fréquences 0,250{,}25, 0,40{,}4 et 0,350{,}35 font 11.

b) Commune B : 252360=0,7\dfrac{252}{360}=0{,}7, et 0,7×1 200=8400{,}7\times 1\,200=840 automobilistes. Les autres modes : transports en commun 36360=0,1\dfrac{36}{360}=0{,}1, soit 120120 actifs, vélo ou marche 72360=0,2\dfrac{72}{360}=0{,}2, soit 240240 actifs. Total 840+120+240=1 200840+120+240=1\,200 : le compte est juste. Calculer les trois effectifs et vérifier leur somme prend dix secondes et évite de recopier un angle de travers.

c) Le secteur voiture de B est bien 25290=2,8\dfrac{252}{90}=2{,}8 fois plus ouvert que celui de A. Mais il y a MOINS d'automobilistes dans B, 840840 contre 900900. Il n'y a aucune contradiction : chaque disque représente SA commune, et deux disques de même taille pour 1 2001\,200 et pour 3 6003\,600 actifs effacent la différence d'effectif. Deux diagrammes circulaires comparent des PROFILS, c'est-à-dire des répartitions en fréquences : on peut dire que la voiture est proportionnellement beaucoup plus utilisée dans B, 70 %70\ \% des actifs contre 25 %25\ \%, mais pas qu'elle y a plus d'utilisateurs. Pour comparer des effectifs, il faut revenir aux nombres, ou dessiner des disques d'aires proportionnelles aux totaux.

d) Les deux communes réunies comptent 3 600+1 200=4 8003\,600+1\,200=4\,800 actifs, dont 900+840=1 740900+840=1\,740 automobilistes. Fréquence : 1 7404 800=0,3625\dfrac{1\,740}{4\,800}=0{,}3625, et l'angle vaut 0,3625×360=130,50{,}3625\times 360=130{,}5 degrés. La moyenne des deux angles, 90+2522=171\dfrac{90+252}{2}=171, reviendrait à donner le même poids aux deux communes, comme si B était aussi peuplée que A. L'angle d'ensemble est la moyenne des angles PONDÉRÉE par les effectifs, 3 600×90+1 200×2524 800=130,5\dfrac{3\,600\times 90+1\,200\times 252}{4\,800}=130{,}5 : il est plus proche de l'angle de A, la commune la plus peuplée. C'est l'erreur de la moyenne des moyennes, sous sa forme graphique.

Exercice 3 : Nuage de points et point moyen : la température baisse avec l'altitude

Six stations météorologiques d'un même massif montagneux ont relevé leur température moyenne annuelle. On note xx l'altitude de la station, en mètres, et yy sa température moyenne, en degrés Celsius.

Altitude xx : 300300 ; 500500 ; 900900 ; 1 3001\,300 ; 1 6001\,600 ; 2 0002\,000. Température yy : 1212 ; 10,510{,}5 ; 88 ; 66 ; 3,53{,}5 ; 22 (dans le même ordre). Le nuage de points est tracé sur la figure.

40080012001600200024002468101214altitude (m)température (°C)
  • a) Décrivez le nuage : le lien est-il croissant ou décroissant ? Les points sont-ils à peu près alignés ?
  • b) Calculez les coordonnées du point moyen GG du nuage.
  • c) Un élève trace au jugé la droite dd qui passe par GG et dont le coefficient directeur vaut −0,006-0{,}006. Déterminez son équation réduite, puis traduisez −0,006-0{,}006 en degrés par centaine de mètres.
  • d) Avec la droite dd, estimez la température moyenne à 1 5001\,500 m, puis au sommet d'un pic de 3 0003\,000 m. Laquelle des deux estimations est la plus fiable ? Pourquoi ?

Tape tes réponses, la page te dit juste ou faux 0/9

a)
b)
c)
d)
Voir la correction

Réponses

  • a) Lien décroissant, points presque alignés : un ajustement affine est raisonnable
  • b) G(1 100 ;7)G(1\,100\,;7)
  • c) d:y=−0,006x+13,6d : y=-0{,}006x+13{,}6 ; la température baisse de 0,60{,}6 °C par centaine de mètres
  • d) 4,64{,}6 °C à 1 5001\,500 m (interpolation, fiable) ; −4,4-4{,}4 °C à 3 0003\,000 m (extrapolation, simple ordre de grandeur)

a) Les six points descendent de gauche à droite et se répartissent le long d'une bande étroite, presque rectiligne : le lien est décroissant, plus la station est haute, plus elle est froide, et un ajustement par une droite est raisonnable. Décrire un nuage, c'est dire ces deux choses, le SENS du lien et sa FORME, avant tout calcul : c'est la forme qui autorise, ou non, un ajustement affine. Un nuage courbé ou sans direction nette n'en justifierait pas.

b) Le point moyen GG a pour abscisse la moyenne des xx et pour ordonnée la moyenne des yy : xˉ=300+500+900+1 300+1 600+2 0006=6 6006=1 100\bar{x}=\dfrac{300+500+900+1\,300+1\,600+2\,000}{6}=\dfrac{6\,600}{6}=1\,100 et yˉ=12+10,5+8+6+3,5+26=426=7\bar{y}=\dfrac{12+10{,}5+8+6+3{,}5+2}{6}=\dfrac{42}{6}=7. Donc G(1 100 ;7)G(1\,100\,;7). Ce point n'est AUCUN des six points du nuage : aucune station n'est à 1 1001\,100 m. C'est un point de résumé, le centre de gravité du nuage, et c'est pour cela qu'une bonne droite d'ajustement passe par lui. Ce n'est pas non plus le milieu du premier et du dernier point, qui serait (1 150 ;7)(1\,150\,;7) : la moyenne utilise TOUTES les valeurs, pas seulement les extrêmes.

c) Une droite de coefficient directeur −0,006-0{,}006 a une équation y=−0,006x+by=-0{,}006x+b. Elle passe par GG, donc 7=−0,006×1 100+b7=-0{,}006\times 1\,100+b, soit 7=−6,6+b7=-6{,}6+b et b=13,6b=13{,}6. Équation : y=−0,006x+13,6y=-0{,}006x+13{,}6. Le coefficient directeur se lit en degrés par mètre : quand l'altitude augmente de 11 m, la température baisse de 0,0060{,}006 °C, donc de 100×0,006=0,6100\times 0{,}006=0{,}6 °C par centaine de mètres. C'est l'ordre de grandeur que retiennent les météorologues pour l'air de montagne. Un ajustement « au jugé » n'est donc pas n'importe quoi : on choisit une droite qui suit la direction du nuage et qui passe par son point moyen.

d) À 1 5001\,500 m : y=−0,006×1 500+13,6=−9+13,6=4,6y=-0{,}006\times 1\,500+13{,}6=-9+13{,}6=4{,}6 °C. À 3 0003\,000 m : y=−18+13,6=−4,4y=-18+13{,}6=-4{,}4 °C. La première estimation est une INTERPOLATION : 1 5001\,500 m est à l'intérieur de la plage des altitudes observées, de 300300 à 2 0002\,000 m, entre deux stations réelles, et la droite y suit de près les données. La seconde est une EXTRAPOLATION : 3 0003\,000 m est bien au-dessus de la station la plus haute, et rien ne garantit que la décroissance reste la même là-haut, où la neige, le vent et l'exposition changent tout. Elle donne un ordre de grandeur, pas une valeur fiable. Plus on s'éloigne de la plage des données, moins une droite d'ajustement a de titre à répondre.

40080012001600200024002468101214Galtitude (m)température (°C)

Exercice 4 : La droite de Mayer : la population d'une commune qui grandit

Une commune de périphérie s'est fortement développée depuis 1990. Le tableau donne sa population yy, en milliers d'habitants, tous les cinq ans ; xx désigne le nombre d'années écoulées depuis 1990.

xx : 00 ; 55 ; 1010 ; 1515 ; 2020 ; 2525 ; 3030 ; 3535. Population yy : 2020 ; 2323 ; 2727 ; 3030 ; 3232 ; 3636 ; 3838 ; 4242 (dans le même ordre). Le nuage est tracé sur la figure.

51015202530354015202530354045années depuis 1990milliers d'habitants
  • a) La méthode de Mayer partage le nuage, rangé par abscisses croissantes, en deux groupes de même effectif. Calculez les coordonnées du point moyen G1G_{1} des quatre premiers points et du point moyen G2G_{2} des quatre derniers.
  • b) Déterminez l'équation réduite de la droite de Mayer (G1G2)(G_{1}G_{2}). Traduisez son coefficient directeur en habitants par an.
  • c) Calculez les coordonnées du point moyen GG de tout le nuage, puis vérifiez qu'il est sur la droite de Mayer.
  • d) Estimez la population en 2012, puis en 2040. Laquelle de ces deux estimations est une interpolation ?

Tape tes réponses, la page te dit juste ou faux 0/12

a)
b)
c)
d)
Voir la correction

Réponses

  • a) G1(7,5 ;25)G_{1}(7{,}5\,;25) et G2(27,5 ;37)G_{2}(27{,}5\,;37)
  • b) y=0,6x+20,5y=0{,}6x+20{,}5 : 600600 habitants de plus par an en moyenne
  • c) G(17,5 ;31)G(17{,}5\,;31), et 0,6×17,5+20,5=310{,}6\times 17{,}5+20{,}5=31 : GG est sur la droite
  • d) 2012 : environ 33 70033\,700 habitants (interpolation) ; 2040 : environ 50 50050\,500 (extrapolation)

a) Le nuage compte 88 points, déjà rangés par abscisses croissantes puisque les années se suivent. Premier groupe : x1=0+5+10+154=304=7,5x_{1}=\dfrac{0+5+10+15}{4}=\dfrac{30}{4}=7{,}5 et y1=20+23+27+304=1004=25y_{1}=\dfrac{20+23+27+30}{4}=\dfrac{100}{4}=25, donc G1(7,5 ;25)G_{1}(7{,}5\,;25). Second groupe : x2=20+25+30+354=1104=27,5x_{2}=\dfrac{20+25+30+35}{4}=\dfrac{110}{4}=27{,}5 et y2=32+36+38+424=1484=37y_{2}=\dfrac{32+36+38+42}{4}=\dfrac{148}{4}=37, donc G2(27,5 ;37)G_{2}(27{,}5\,;37). Le partage se fait TOUJOURS après avoir rangé les points selon xx : couper un tableau présenté dans le désordre donnerait deux points moyens sans signification, qui mélangent le début et la fin de la période.

b) Coefficient directeur : a=37−2527,5−7,5=1220=0,6a=\dfrac{37-25}{27{,}5-7{,}5}=\dfrac{12}{20}=0{,}6. La droite passe par G1G_{1} : 25=0,6×7,5+b25=0{,}6\times 7{,}5+b, donc b=25−4,5=20,5b=25-4{,}5=20{,}5. Équation : y=0,6x+20,5y=0{,}6x+20{,}5. Unités : yy est en milliers d'habitants et xx en années, donc 0,60{,}6 millier d'habitants par an, c'est-à-dire 600600 habitants de plus chaque année, en moyenne sur la période. L'ordonnée à l'origine 20,520{,}5 est la population que la droite attribue à 1990, 20 50020\,500 habitants, proche des 20 00020\,000 recensés : la droite résume le nuage, elle ne passe exactement par aucun de ses points.

c) Point moyen de tout le nuage : xˉ=0+5+10+15+20+25+30+358=1408=17,5\bar{x}=\dfrac{0+5+10+15+20+25+30+35}{8}=\dfrac{140}{8}=17{,}5 et yˉ=100+1488=2488=31\bar{y}=\dfrac{100+148}{8}=\dfrac{248}{8}=31, donc G(17,5 ;31)G(17{,}5\,;31). Sur la droite : 0,6×17,5+20,5=10,5+20,5=310{,}6\times 17{,}5+20{,}5=10{,}5+20{,}5=31, c'est bien yˉ\bar{y}. Ce n'est pas un hasard : les deux groupes ont le même effectif, donc GG est le milieu du segment [G1G2][G_{1}G_{2}], (7,5+27,52 ;25+372)=(17,5 ;31)\left(\dfrac{7{,}5+27{,}5}{2}\,;\dfrac{25+37}{2}\right)=(17{,}5\,;31). Ce contrôle ne coûte rien et attrape la plupart des erreurs de calcul sur G1G_{1} ou G2G_{2}.

d) 2012 correspond à x=22x=22 : y=0,6×22+20,5=13,2+20,5=33,7y=0{,}6\times 22+20{,}5=13{,}2+20{,}5=33{,}7, soit environ 33 70033\,700 habitants. C'est une interpolation : 2222 est entre 00 et 3535, dans la plage des recensements. 2040 correspond à x=50x=50 : y=0,6×50+20,5=30+20,5=50,5y=0{,}6\times 50+20{,}5=30+20{,}5=50{,}5, soit environ 50 50050\,500 habitants. C'est une extrapolation, quinze ans après le dernier recensement : elle suppose que la commune continuera de gagner 600600 habitants par an, alors qu'une commune finit par manquer de terrains à bâtir, ou qu'un nouveau quartier peut au contraire accélérer les arrivées. On la présente comme un scénario « si la tendance se poursuit », jamais comme une certitude.

51015202530354015202530354045G1G2années depuis 1990milliers d'habitants

Exercice 5 : La droite du tableur : grandir de 2 à 10 ans, et pas au-delà

Le carnet de santé d'un enfant donne sa taille à cinq âges. On note xx l'âge, en années, et yy la taille, en centimètres. Âge xx : 22 ; 44 ; 66 ; 88 ; 1010. Taille yy : 8686 ; 102102 ; 115115 ; 128128 ; 139139.

Un tableur donne la droite d'ajustement par la méthode des moindres carrés : y=6,6x+74,4y=6{,}6x+74{,}4. Cette méthode retient, parmi toutes les droites, celle qui rend la plus petite possible la somme des carrés des écarts verticaux entre les points et la droite ; aucune formule n'est à connaître. La figure montre le nuage et cette droite.

12345678910111260708090100110120130140150âge (années)taille (cm)
  • a) Calculez les coordonnées du point moyen GG du nuage, puis vérifiez que la droite du tableur passe par GG.
  • b) Que signifie le coefficient directeur 6,66{,}6 ? Estimez la taille de l'enfant à 77 ans.
  • c) Quelle taille la droite donne-t-elle à la naissance (x=0x=0), puis à 3030 ans ? Comparez avec la réalité : un nouveau-né mesure environ 5050 cm.
  • d) Sur quel intervalle de valeurs de xx peut-on raisonnablement utiliser cette droite ?

Tape tes réponses, la page te dit juste ou faux 0/7

a)
b)
c)
d)
Intervalle d'utilisation ;
Voir la correction

Réponses

  • a) G(6 ;114)G(6\,;114) et 6,6×6+74,4=1146{,}6\times 6+74{,}4=114 : GG est sur la droite
  • b) L'enfant grandit en moyenne de 6,66{,}6 cm par an ; à 77 ans, environ 120,6120{,}6 cm
  • c) 74,474{,}4 cm à la naissance au lieu de 5050 ; 272,4272{,}4 cm à 3030 ans : deux extrapolations absurdes
  • d) Sur [2 ;10][2\,;10], la plage des mesures

a) xˉ=2+4+6+8+105=305=6\bar{x}=\dfrac{2+4+6+8+10}{5}=\dfrac{30}{5}=6 et yˉ=86+102+115+128+1395=5705=114\bar{y}=\dfrac{86+102+115+128+139}{5}=\dfrac{570}{5}=114. Donc G(6 ;114)G(6\,;114). Avec la droite du tableur : 6,6×6+74,4=39,6+74,4=1146{,}6\times 6+74{,}4=39{,}6+74{,}4=114. La droite passe bien par GG. C'est une propriété de la droite des moindres carrés, qu'on utilise ici comme VÉRIFICATION : si l'on recopie mal un coefficient affiché par le tableur, GG n'est plus sur la droite, et l'erreur se voit tout de suite. On n'a pas à savoir comment le tableur trouve la droite, seulement ce qu'elle minimise : la somme des carrés des écarts verticaux.

b) Le coefficient directeur s'exprime en centimètres par année : entre 22 et 1010 ans, l'enfant grandit en moyenne de 6,66{,}6 cm par an. À 77 ans : 6,6×7+74,4=46,2+74,4=120,66{,}6\times 7+74{,}4=46{,}2+74{,}4=120{,}6 cm. C'est une interpolation, entre les mesures de 66 ans (115115 cm) et de 88 ans (128128 cm), et la valeur trouvée tombe bien entre les deux : l'estimation est crédible. Ce contrôle, « la valeur interpolée est-elle entre ses deux voisines ? », se fait de tête.

c) À la naissance : y=74,4y=74{,}4 cm, alors qu'un nouveau-né mesure environ 5050 cm, soit une erreur de plus de 2424 cm. À 3030 ans : 6,6×30+74,4=198+74,4=272,46{,}6\times 30+74{,}4=198+74{,}4=272{,}4 cm, plus de 2,72{,}7 m ! Les deux extrapolations sont fausses, pour des raisons opposées : avant 22 ans, l'enfant grandit BEAUCOUP plus vite que 6,66{,}6 cm par an, environ 2525 cm pendant la première année ; après la puberté, la croissance s'arrête. La droite résume bien la croissance entre 22 et 1010 ans parce que, sur cette période, elle est à peu près régulière. Elle ne décrit pas la croissance humaine en général, et aucun calcul exact ne rend juste un modèle utilisé hors de son domaine.

d) La droite n'a été ajustée que sur des mesures faites entre 22 et 1010 ans : c'est sur l'intervalle [2 ;10][2\,;10] qu'on peut s'en servir, pour interpoler. On peut à la rigueur la prolonger de quelques mois, avec prudence ; au-delà, on extrapole, et la question c) montre ce que cela coûte. Règle à retenir : une droite d'ajustement ne vaut que dans la plage de ses données. Écrire cet intervalle à côté de l'équation fait partie de la réponse, au même titre que les coefficients.

Partie B : problèmes et raisonnement (/50)

Exercice 6 : Un caractère quantitatif mis en classes : le niveau de vie et les vacances

Un institut interroge 2 0002\,000 personnes. Pour chacune, il relève le niveau de vie de son ménage, caractère QUANTITATIF, qu'il regroupe en quatre classes à l'aide de ses quartiles : la classe Q1 réunit le quart des personnes au niveau de vie le plus faible, la classe Q2 le quart suivant, et ainsi de suite jusqu'à la classe Q4, le quart au niveau de vie le plus élevé.

Il relève aussi si la personne est partie en vacances au moins une fois dans l'année. Le diagramme en barres donne, pour chaque classe, la fréquence des personnes parties.

0 %20 %40 %60 %80 %36 %Q160 %Q266 %Q378 %Q4part des personnes parties en vacances
  • a) Combien de personnes compte chaque classe ? Justifiez. Calculez le nombre de personnes parties en vacances dans la classe Q1, puis dans la classe Q4.
  • b) Dressez le tableau croisé classe par départ, avec ses totaux. Calculez la fréquence marginale des départs, et vérifiez qu'ici elle est égale à la moyenne des quatre fréquences du diagramme. Pourquoi cette égalité est-elle vraie ici ?
  • c) Deux phrases circulent : « 78 %78\ \% des personnes les plus aisées partent en vacances » et « parmi les personnes parties en vacances, 32,5 %32{,}5\ \% appartiennent à la classe la plus aisée ». Vérifiez chacune en nommant sa population. Quelle part des vacanciers appartient à la classe Q1 ?
  • d) Un élève propose de représenter la situation par un diagramme circulaire de la population selon la classe. Quel serait l'angle de chaque secteur ? Pourquoi ce diagramme ne montre-t-il pas le lien entre niveau de vie et vacances ?

Tape tes réponses, la page te dit juste ou faux 0/9

a)
b)
c)
d)
Voir la correction

Réponses

  • a) 500500 personnes par classe (un quart de 2 0002\,000) ; 180180 partis dans Q1, 390390 dans Q4
  • b) Partis : 180180, 300300, 330330, 390390, total 1 2001\,200 ; fréquence marginale 0,60{,}6 = moyenne des quatre fréquences, car les classes ont le même effectif
  • c) 390500=0,78\frac{390}{500}=0{,}78 parmi Q4 et 3901 200=0,325\frac{390}{1\,200}=0{,}325 parmi les partis : les deux sont exactes ; Q1 : 1801 200=0,15\frac{180}{1\,200}=0{,}15
  • d) Quatre secteurs de 9090 degrés : le diagramme montre la construction des classes, pas le départ ; le lien se voit sur les barres des fréquences de départ

a) Les classes sont définies par les QUARTILES du niveau de vie : par construction, chacune réunit un quart des personnes interrogées, soit 2 0004=500\dfrac{2\,000}{4}=500 personnes. Regrouper un caractère quantitatif par ses quartiles donne des classes de même EFFECTIF, ce qui n'est pas le cas de classes de même amplitude, par tranches de revenu, qui seraient d'effectifs très inégaux. Personnes parties : classe Q1, 36 %36\ \% de 500500, soit 0,36×500=1800{,}36\times 500=180 ; classe Q4, 0,78×500=3900{,}78\times 500=390. De même, 300300 dans Q2 et 330330 dans Q3.

b) Le tableau croisé a deux lignes, parties et non parties, et quatre colonnes de 500500 personnes. Parties : 180180, 300300, 330330, 390390, total 1 2001\,200. Non parties : 320320, 200200, 170170, 110110, total 800800. Fréquence marginale des départs : 1 2002 000=0,6\dfrac{1\,200}{2\,000}=0{,}6. Moyenne des quatre fréquences : 0,36+0,6+0,66+0,784=2,44=0,6\dfrac{0{,}36+0{,}6+0{,}66+0{,}78}{4}=\dfrac{2{,}4}{4}=0{,}6. L'égalité n'est PAS une règle générale : la fréquence d'ensemble est la moyenne des fréquences des classes PONDÉRÉE par leurs effectifs. Ici les quatre classes ont le même effectif, donc tous les poids sont égaux et la moyenne pondérée se confond avec la moyenne simple. Avec des classes d'effectifs différents, comme les deux communes de l'exercice 2, la moyenne simple serait fausse.

c) Première phrase : on compte parmi les 500500 personnes de la classe Q4, dont 390390 sont parties, 390500=0,78\dfrac{390}{500}=0{,}78 : elle est exacte. Seconde phrase : on compte parmi les 1 2001\,200 personnes parties, dont 390390 sont de la classe Q4, 3901 200=0,325\dfrac{390}{1\,200}=0{,}325 : exacte aussi. Même case, 390390, deux populations, deux nombres différents, et deux phrases vraies. Parmi les vacanciers, la classe Q1 ne pèse que 1801 200=0,15\dfrac{180}{1\,200}=0{,}15 : un vacancier appartient plus de deux fois plus souvent au quart le plus aisé qu'au quart le plus modeste. Une phrase chiffrée sans sa population de référence ne peut être ni vérifiée ni comparée.

d) Chaque classe regroupe un quart des personnes, donc chaque secteur mesurerait 3604=90\dfrac{360}{4}=90 degrés : quatre quarts identiques. Ce diagramme décrit la façon dont les classes ont été construites, il ne dit rien des vacances. Pour faire voir le lien, il faut représenter le caractère « départ » À L'INTÉRIEUR de chaque classe : c'est exactement le diagramme en barres de l'énoncé, qui monte de 36 %36\ \% à 78 %78\ \%. On peut aussi tracer, pour chaque classe, une barre de hauteur 100 %100\ \% partagée entre partis et non partis. Ce lien est statistique : l'âge, la taille de la famille ou le lieu de résidence jouent aussi, et le diagramme ne les sépare pas.

Exercice 7 : Corrélation n'est pas causalité : les voitures et l'espérance de vie

Pour six pays notés A à F, on relève le nombre xx de voitures pour 100100 habitants et l'espérance de vie à la naissance yy, en années.

xx : 55 ; 1515 ; 2525 ; 3535 ; 4545 ; 5555. yy : 6262 ; 6767 ; 6969 ; 7373 ; 7979 ; 8282 (dans le même ordre, du pays A au pays F). Le tableur donne la droite des moindres carrés y=0,4x+60y=0{,}4x+60, tracée sur la figure avec le nuage.

1020304050605560657075808590voitures pour 100 habitantsespérance de vie (ans)
  • a) Calculez les coordonnées du point moyen GG et vérifiez que la droite du tableur passe par GG.
  • b) Que signifie le coefficient directeur 0,40{,}4 ? Quelle espérance de vie la droite associe-t-elle à un pays de 4040 voitures pour 100100 habitants ?
  • c) Un commentateur conclut : « Pour gagner 44 ans d'espérance de vie, un pays n'a qu'à augmenter son parc de 1010 voitures pour 100100 habitants. » Pourquoi ce raisonnement est-il faux ? Quel troisième caractère peut expliquer le lien observé ?
  • d) Trois autres pays, P, Q et R, ont un niveau de richesse très proche. Ils comptent 4040, 5050 et 6060 voitures pour 100100 habitants, et leurs espérances de vie sont 8282, 8282 et 8181 ans. Que prévoirait la droite pour le pays R ? Parmi ces pays de même richesse, le lien du nuage persiste-t-il ?

Tape tes réponses, la page te dit juste ou faux 0/7

a)
b)
c)
d)
Voir la correction

Réponses

  • a) G(30 ;72)G(30\,;72) et 0,4×30+60=720{,}4\times 30+60=72
  • b) D'un pays à l'autre, 1010 voitures de plus pour 100100 habitants vont de pair avec 44 ans d'espérance de vie en plus ; pour 4040 voitures : 7676 ans
  • c) Un lien statistique n'est pas un effet de cause ; la richesse du pays fait monter les deux caractères à la fois
  • d) 8484 ans prévus pour R, 8181 observés ; le lien disparaît à richesse égale

a) xˉ=5+15+25+35+45+556=1806=30\bar{x}=\dfrac{5+15+25+35+45+55}{6}=\dfrac{180}{6}=30 et yˉ=62+67+69+73+79+826=4326=72\bar{y}=\dfrac{62+67+69+73+79+82}{6}=\dfrac{432}{6}=72. Donc G(30 ;72)G(30\,;72). Sur la droite : 0,4×30+60=12+60=720{,}4\times 30+60=12+60=72 : GG est bien sur la droite des moindres carrés. Le nuage monte de gauche à droite de façon presque rectiligne : les deux caractères sont fortement liés, et c'est précisément pour cela qu'il faut se méfier de ce qu'on va en conclure.

b) Le coefficient 0,40{,}4 s'exprime en années d'espérance de vie par voiture pour 100100 habitants : d'un pays à l'autre, 1010 voitures de plus pour 100100 habitants vont de pair, EN MOYENNE, avec 10×0,4=410\times 0{,}4=4 années d'espérance de vie en plus. Pour 4040 voitures pour 100100 habitants, la droite donne 0,4×40+60=16+60=760{,}4\times 40+60=16+60=76 ans. Le vocabulaire compte : « vont de pair » décrit une comparaison entre pays DIFFÉRENTS, pas ce qui arriverait à UN pays qui changerait son parc automobile.

c) Le raisonnement transforme un lien statistique en effet de cause. Or le nuage compare des pays qui diffèrent par beaucoup d'autres choses que leurs voitures. Le troisième caractère le plus évident est le niveau de richesse : un pays riche a les moyens d'acheter des voitures, ET il a un système de santé, une alimentation, un accès à l'eau potable et des conditions de travail qui allongent la vie. La richesse fait monter les deux caractères à la fois, ce qui crée la corrélation sans qu'une voiture ne soigne personne. L'effet direct de la voiture sur la santé est même plutôt négatif : accidents, pollution de l'air, manque d'exercice. Une corrélation, même forte, ne prouve pas une causalité : pour établir une cause, il faut comparer des situations qui ne diffèrent QUE par le caractère étudié.

d) Pour R, la droite prévoirait 0,4×60+60=840{,}4\times 60+60=84 ans, et pour P et Q 7676 et 8080 ans : 88 ans d'écart entre P et R. Les valeurs observées sont 8282, 8282 et 8181 ans : l'espérance de vie ne monte pas avec le nombre de voitures, elle baisse même légèrement. Parmi des pays de même richesse, le lien disparaît. C'est la signature d'un troisième caractère : quand on le fixe, la corrélation entre les deux autres s'évanouit. La droite du tableur ne mesurait donc pas l'effet des voitures, mais celui de tout ce qui sépare un pays pauvre d'un pays riche. C'est exactement la démarche à suivre devant une corrélation qui surprend : chercher ce qui pourrait faire varier les deux caractères ensemble, puis comparer à ce caractère constant.

Exercice 8 : Cinq affirmations à corriger

Chacune des cinq affirmations ci-dessous est FAUSSE. Elles reprennent les situations des exercices 2 à 7. Pour chacune, dites ce qui a été confondu, donnez la valeur correcte et écrivez l'énoncé juste.

Toutes ont la même source : on a fait dire à un chiffre plus que ce pour quoi il a été calculé.

  • a) « À l'exercice 2, le secteur voiture est bien plus grand dans le diagramme de la commune B : la commune B compte donc plus d'automobilistes que la commune A. »
  • b) « À l'exercice 3, le point moyen du nuage est le milieu du segment qui joint le premier et le dernier point, soit (1 150 ;7)(1\,150\,;7). »
  • c) « À l'exercice 4, la droite de Mayer passe par le premier et par le dernier point du nuage. »
  • d) « D'après la droite de l'exercice 5, l'enfant mesurera 2,722{,}72 m à 3030 ans. »
  • e) « À l'exercice 7, le coefficient 0,40{,}4 prouve que chaque voiture de plus pour 100100 habitants fait gagner 0,40{,}4 an d'espérance de vie. »

Tape tes réponses, la page te dit juste ou faux 0/5

a)
b)
c)
d)
Intervalle de validité ;
e)
Voir la correction

Réponses

  • a) B a 840840 automobilistes, A en a 900900 : un disque montre des fréquences, pas des effectifs
  • b) G(1 100 ;7)G(1\,100\,;7) : le point moyen utilise les six valeurs, pas les seuls extrêmes
  • c) En x=0x=0 la droite donne 20,520{,}5, pas 2020 : elle passe par G1G_{1}, G2G_{2} et GG, pas par les points extrêmes
  • d) Extrapolation hors de [2 ;10][2\,;10] : la droite ne prévoit pas la taille adulte
  • e) 0,40{,}4 mesure un lien statistique entre pays, pas l'effet d'une voiture ; à richesse égale, le lien disparaît

a) Faux. Les deux disques ont la même taille mais pas le même total : 3 6003\,600 actifs pour A, 1 2001\,200 pour B. Le secteur de B représente 70 %70\ \% de 1 2001\,200, soit 840840 automobilistes ; celui de A, 25 %25\ \% de 3 6003\,600, soit 900900. Énoncé juste : « La voiture est proportionnellement bien plus utilisée dans B, 70 %70\ \% des actifs contre 25 %25\ \%, mais la commune A compte plus d'automobilistes. » Un diagramme circulaire montre une répartition, jamais un effectif : pour comparer des effectifs, on revient aux nombres.

b) Faux. Le point moyen utilise les six altitudes et les six températures, pas seulement les extrêmes : xˉ=6 6006=1 100\bar{x}=\dfrac{6\,600}{6}=1\,100, alors que le milieu des extrêmes a pour abscisse 300+2 0002=1 150\dfrac{300+2\,000}{2}=1\,150. Les ordonnées coïncident ici, 77 dans les deux cas, mais c'est une coïncidence de ces données. Énoncé juste : « G(1 100 ;7)G(1\,100\,;7) a pour coordonnées la moyenne des xx et la moyenne des yy. » Prendre le milieu des extrêmes, c'est ignorer les quatre stations intermédiaires.

c) Faux. La droite y=0,6x+20,5y=0{,}6x+20{,}5 donne 20,520{,}5 en x=0x=0, alors que le premier point est (0 ;20)(0\,;20), et 0,6×35+20,5=41,50{,}6\times 35+20{,}5=41{,}5 en x=35x=35, alors que le dernier point est (35 ;42)(35\,;42). Elle passe par les points moyens G1(7,5 ;25)G_{1}(7{,}5\,;25) et G2(27,5 ;37)G_{2}(27{,}5\,;37), et donc par G(17,5 ;31)G(17{,}5\,;31), qui ne sont pas des points du nuage. Énoncé juste : « La droite de Mayer passe par les points moyens des deux groupes. » La droite qui joint les points extrêmes est un autre ajustement, au jugé, qui dépend de deux mesures seulement.

d) Faux. 272,4272{,}4 cm est ce que donne la droite en x=30x=30, mais elle a été ajustée sur des mesures de 22 à 1010 ans : à 3030 ans, on extrapole vingt ans au-delà des données, sur une période où la croissance s'arrête. Énoncé juste : « La droite y=6,6x+74,4y=6{,}6x+74{,}4 décrit la croissance de cet enfant entre 22 et 1010 ans ; elle ne permet pas de prévoir sa taille adulte. » Un résultat absurde, plus de 2,72{,}7 m, doit faire douter du modèle, pas seulement du calcul.

e) Faux. Le coefficient 0,40{,}4 mesure un lien STATISTIQUE entre pays : ceux qui ont plus de voitures ont, en moyenne, une espérance de vie plus longue. Il ne mesure pas l'effet d'une voiture. Parmi les pays P, Q et R, de même richesse, l'espérance de vie ne monte pas avec le nombre de voitures, 8282, 8282 puis 8181 ans. Énoncé juste : « Le nombre de voitures et l'espérance de vie sont corrélés, très probablement parce que tous deux dépendent de la richesse du pays. » Corrélation n'est pas causalité.

Exercice 9 : Problème : le dioxyde de carbone du Mauna Loa, et deux extrapolations

La concentration de dioxyde de carbone dans l'atmosphère est mesurée en continu depuis 1958 à l'observatoire du Mauna Loa, à Hawaï. Elle s'exprime en parties par million (ppm) : 400400 ppm signifie 400400 molécules de dioxyde de carbone pour un million de molécules d'air.

Le tableau donne la moyenne annuelle, arrondie à l'unité, tous les dix ans ; xx désigne le nombre d'années écoulées depuis 1980. xx : 00 ; 1010 ; 2020 ; 3030 ; 4040. Concentration yy : 339339 ; 354354 ; 370370 ; 390390 ; 414414. Le tableur donne la droite des moindres carrés y=1,86x+336,2y=1{,}86x+336{,}2, tracée sur la figure.

51015202530354045330340350360370380390400410420années depuis 1980concentration (ppm)
  • a) Calculez les coordonnées du point moyen GG et vérifiez que la droite passe par GG.
  • b) Interprétez le coefficient 1,861{,}86. Estimez avec la droite la concentration en 2005 ; la mesure réelle est d'environ 380380 ppm.
  • c) Calculez l'écart y−y^y-\hat{y} entre la mesure yy et la valeur y^\hat{y} donnée par la droite, pour 1980, 2000 et 2020. Que révèle le signe de ces écarts ?
  • d) Utilisez la droite pour « remonter » en 1750, soit x=−230x=-230. Comparez avec la valeur d'environ 280280 ppm connue pour l'époque préindustrielle.
  • e) Calculez la valeur que la droite donne pour 2050. D'après c), cette valeur est-elle plutôt trop forte ou trop faible si la tendance se poursuit ?

Tape tes réponses, la page te dit juste ou faux 0/10

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) G(20 ;373,4)G(20\,;373{,}4) et 1,86×20+336,2=373,41{,}86\times 20+336{,}2=373{,}4
  • b) Hausse moyenne de 1,861{,}86 ppm par an ; 2005 : 382,7382{,}7 ppm, près de 33 ppm au-dessus de la mesure
  • c) Écarts 2,82{,}8 ; −3,4-3{,}4 ; 3,43{,}4 : au-dessus aux extrémités, au-dessous au milieu, la hausse s'accélère
  • d) −91,6-91{,}6 ppm : valeur absurde, extrapolation lointaine
  • e) 466,4466{,}4 ppm, plutôt trop faible si l'accélération se poursuit

a) xˉ=0+10+20+30+405=20\bar{x}=\dfrac{0+10+20+30+40}{5}=20 et yˉ=339+354+370+390+4145=1 8675=373,4\bar{y}=\dfrac{339+354+370+390+414}{5}=\dfrac{1\,867}{5}=373{,}4. Donc G(20 ;373,4)G(20\,;373{,}4). Sur la droite du tableur : 1,86×20+336,2=37,2+336,2=373,41{,}86\times 20+336{,}2=37{,}2+336{,}2=373{,}4 : GG est bien sur la droite. Le nuage monte régulièrement et paraît presque rectiligne à cette échelle, d'où l'idée d'un ajustement affine.

b) Le coefficient 1,861{,}86 se lit en ppm par an : de 1980 à 2020, la concentration a gagné en moyenne 1,861{,}86 ppm chaque année. En 2005, x=25x=25 : 1,86×25+336,2=46,5+336,2=382,71{,}86\times 25+336{,}2=46{,}5+336{,}2=382{,}7 ppm. C'est une interpolation, et pourtant l'écart avec la mesure, environ 380380 ppm, approche 33 ppm, du même ordre que les écarts de la question c). L'interpolation est plus sûre que l'extrapolation, elle n'est pas exacte pour autant : elle hérite des défauts de la droite.

c) 1980 : y^=336,2\hat{y}=336{,}2, écart 339−336,2=2,8339-336{,}2=2{,}8. 2000 : y^=373,4\hat{y}=373{,}4, écart 370−373,4=−3,4370-373{,}4=-3{,}4. 2020 : y^=1,86×40+336,2=410,6\hat{y}=1{,}86\times 40+336{,}2=410{,}6, écart 414−410,6=3,4414-410{,}6=3{,}4. Les points des extrémités sont AU-DESSUS de la droite, celui du milieu EN DESSOUS, et les deux autres aussi : −0,8-0{,}8 en 1990, −2-2 en 2010. Ce motif, positif, négatif, positif, est celui d'un nuage qui se courbe vers le haut. Les hausses par décennie le confirment : 1515, 1616, 2020 puis 2424 ppm. La concentration n'augmente pas de façon affine, elle ACCÉLÈRE, et la droite n'en est qu'un résumé moyen.

d) x=−230x=-230 : 1,86×(−230)+336,2=−427,8+336,2=−91,61{,}86\times(-230)+336{,}2=-427{,}8+336{,}2=-91{,}6 ppm. Une concentration négative n'a aucun sens. Les bulles d'air piégées dans les glaces de l'Antarctique montrent qu'elle était d'environ 280280 ppm avant l'ère industrielle, presque stable depuis des siècles. La droite a été ajustée sur 4040 ans de mesures et on l'a prolongée sur 230230 ans : c'est une extrapolation lointaine, qui suppose que la concentration a toujours gagné 1,861{,}86 ppm par an, ce qui est faux avant le XIXe siècle.

e) Pour 2050, x=70x=70 : 1,86×70+336,2=130,2+336,2=466,41{,}86\times 70+336{,}2=130{,}2+336{,}2=466{,}4 ppm. D'après c), le nuage se courbe vers le haut et les derniers points sont au-dessus de la droite : si l'accélération se poursuit, la droite SOUS-ESTIME l'avenir, et 466,4466{,}4 ppm est plutôt une valeur basse. Mais c'est une extrapolation à trente ans : les émissions dépendent aussi des décisions humaines, et aucune droite ajustée sur le passé ne les connaît. Le bon usage d'une telle droite est de dire « si la tendance des quarante dernières années se poursuit », jamais « en 2050 il y aura ».

Exercice 10 : Problème : les vendanges, un thermomètre du passé

Dans un vignoble, la date de début des vendanges dépend de la chaleur de la saison : plus l'été est chaud, plus le raisin mûrit tôt. Des archives notent cette date depuis plusieurs siècles, ce qui permet aux climatologues de reconstituer des températures anciennes.

Pour cinq années récentes, on relève la température moyenne xx d'avril à août, en degrés Celsius, et la date de début des vendanges yy, comptée en jours après le 31 août : y=18y=18 désigne le 18 septembre. xx : 1515 ; 1616 ; 1717 ; 1818 ; 1919. yy : 3131 ; 2323 ; 1818 ; 1111 ; 77. Le tableur donne la droite des moindres carrés y=−6x+120y=-6x+120. Les données sont vraisemblables et arrondies pour le calcul.

141516171819205101520253035température d'avril à août (°C)jours après le 31 août
  • a) Calculez les coordonnées du point moyen GG et vérifiez que la droite du tableur passe par GG. Que signifie le coefficient −6-6 ?
  • b) Un élève trace au jugé la droite Δ\Delta qui joint le premier et le dernier point du nuage. Déterminez son équation réduite. Passe-t-elle par GG ?
  • c) Pour chacune des deux droites, calculez la somme des carrés des écarts verticaux entre les cinq points et la droite. Laquelle ajuste le mieux le nuage, au sens des moindres carrés ?
  • d) Avec la droite du tableur, estimez la date des vendanges après un été à 17,517{,}5 °C.
  • e) Une archive indique qu'une année du XVIIe siècle, les vendanges ont commencé le 6 octobre. Estimez la température moyenne de cet été-là. Est-ce une interpolation ou une extrapolation ?

Tape tes réponses, la page te dit juste ou faux 0/10

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) G(17 ;18)G(17\,;18) et −6×17+120=18-6\times 17+120=18 ; un été plus chaud de 11 °C avance les vendanges de 66 jours
  • b) Δ:y=−6x+121\Delta : y=-6x+121 ; en x=17x=17 elle donne 1919, donc elle ne passe pas par GG
  • c) 44 pour la droite du tableur, 99 pour Δ\Delta : la droite du tableur ajuste mieux
  • d) y=15y=15 : le 15 septembre
  • e) y=36y=36 donne x=14x=14 °C ; extrapolation, un degré sous la plage [15 ;19][15\,;19]

a) xˉ=15+16+17+18+195=17\bar{x}=\dfrac{15+16+17+18+19}{5}=17 et yˉ=31+23+18+11+75=905=18\bar{y}=\dfrac{31+23+18+11+7}{5}=\dfrac{90}{5}=18. Donc G(17 ;18)G(17\,;18), et −6×17+120=−102+120=18-6\times 17+120=-102+120=18 : GG est sur la droite. Le coefficient directeur se lit en jours par degré : un été plus chaud de 11 °C va de pair avec des vendanges 66 jours plus tôt. Ici le lien a une explication physique connue, la maturation du raisin dépend de la chaleur accumulée, ce qui autorise à parler d'effet, mais c'est la biologie qui le dit, pas la droite.

b) Δ\Delta passe par (15 ;31)(15\,;31) et (19 ;7)(19\,;7). Coefficient directeur : 7−3119−15=−244=−6\dfrac{7-31}{19-15}=\dfrac{-24}{4}=-6. Ordonnée à l'origine : 31=−6×15+b31=-6\times 15+b, donc b=31+90=121b=31+90=121, et Δ:y=−6x+121\Delta : y=-6x+121. En x=17x=17, elle donne −102+121=19-102+121=19, et non 1818 : Δ\Delta ne passe pas par GG. Elle a la même pente que la droite du tableur mais se trouve décalée d'un jour vers le haut : construite sur deux points seulement, elle reporte leurs particularités sur toute la droite.

c) Droite du tableur : valeurs 3030, 2424, 1818, 1212, 66 ; écarts 31−30=131-30=1, 23−24=−123-24=-1, 00, 11−12=−111-12=-1, 7−6=17-6=1 ; somme des carrés 1+1+0+1+1=41+1+0+1+1=4. Droite Δ\Delta : valeurs 3131, 2525, 1919, 1313, 77 ; écarts 00, −2-2, −1-1, −2-2, 00 ; somme des carrés 0+4+1+4+0=90+4+1+4+0=9. La droite du tableur l'emporte, 4<94<9. C'est exactement le sens de « moindres carrés » : parmi toutes les droites possibles, le tableur retient celle dont cette somme est la plus petite. On élève les écarts au carré pour que les positifs et les négatifs ne se compensent pas, et pour pénaliser davantage un grand écart que plusieurs petits.

d) Été à 17,517{,}5 °C : y=−6×17,5+120=−105+120=15y=-6\times 17{,}5+120=-105+120=15, soit le 15 septembre. 17,517{,}5 est entre 1515 et 1919 : c'est une interpolation, dans la plage des données, et la date trouvée est bien entre celles des étés à 1717 °C (le 18) et à 1818 °C (le 11).

e) Le 6 octobre tombe 30+6=3630+6=36 jours après le 31 août, puisque septembre compte 3030 jours. On résout −6x+120=36-6x+120=36 : 6x=846x=84, donc x=14x=14. L'été aurait eu une température moyenne d'environ 1414 °C, plus froid que tous les étés de la série. C'est une EXTRAPOLATION, puisque 1414 est hors de [15 ;19][15\,;19], mais modérée, à un degré de la plage. On a utilisé la droite « à l'envers », pour retrouver xx à partir de yy : c'est permis, mais l'estimation reste aussi fragile que la droite dont elle vient. Les climatologues procèdent ainsi, avec des séries bien plus longues et des marges d'incertitude affichées.

141516171819205101520253035Gtrait plein : tableurpointillé : Δtempérature d'avril à août (°C)jours après le 31 août
Chapitre suivant Phénomènes aléatoires

© Ahmed Squalli Houssaini. Série publiée sur www.letuteurscientifique.ca/exercices/1mtc-information-chiffree. Libre pour l'usage personnel et en classe ; sa republication ailleurs demande une autorisation écrite (mentions légales).

Voir aussi

Les statistiques du tronc commun de Première vous inquiètent, à Montréal ?

Contactez-moi pour une première séance. Ce chapitre se prépare bien : quelques gestes sûrs, point moyen, bonne population, plage des données, et les points de l'épreuve anticipée sont à portée de main.

Site par Studio Squalli