Math SN4, secondaire 4 à Montréal • Statistique

Exercices corrigés : nuage de points, corrélation et droite de régression (math SN4)

Voici une série d'exercices corrigés de mathématiques SN4 sur la statistique à deux variables, calibrés sur le niveau réel des évaluations à Montréal. C'est le dernier chapitre du programme de secondaire 4, et le seul où l'on demande à l'élève de JUGER un modèle plutôt que de le calculer : une droite de régression peut être parfaitement exacte et complètement trompeuse.

Faites chaque exercice au complet avant d'ouvrir la correction : c'est en cherchant qu'on apprend, pas en lisant la solution.

Série autocorrigée Tape tes réponses sous chaque question : la page te dit juste ou faux avant d'ouvrir la correction. Avec un compte, chaque bonne réponse du premier coup rapporte des points.

Ce chapitre fait partie de Mathématique SN4 : Sciences naturelles, secondaire 4
Avant de commencer Fiche de révision : les pièges et la méthode de ce chapitre

Avant ce chapitre

Ces notions sont supposées acquises ici. Si le premier exercice résiste, le blocage vient presque toujours de l'une d'elles, pas du chapitre lui-même.

Remonter plus loin : la chaîne complète (2 chapitres) ↓

Le chemin de remédiation, du plus ancien au plus proche. Un élève qui reprend ce chapitre de zéro le reprend dans cet ordre.

  1. 1Nombres réels, racines et ensemblesSecondaire 3
  2. 2Statistique : échantillonnage, diagrammes et mesuresSecondaire 3

Rappel de cours

  • • Une corrélation se décrit par son SENS (positive si les deux variables augmentent ensemble, négative sinon) et par son INTENSITÉ (nulle, faible, moyenne, forte, parfaite).
  • • Méthode du rectangle : on trace le plus petit rectangle contenant le nuage, orienté selon son allongement, puis r≈±(1−lL)r\approx\pm\left(1-\dfrac{l}{L}\right), où ll est la largeur et LL la longueur. Le signe est celui de la pente du nuage.
  • • Repères d'interprétation : ∣r∣|r| autour de 0,50{,}5 correspond à une corrélation moyenne, autour de 0,750{,}75 à une corrélation forte, au-delà de 0,90{,}9 à une corrélation très forte.
  • • Droite de Mayer : on ordonne les données selon xx, on les partage en deux groupes de même effectif, on calcule le point moyen de chaque groupe, et la droite passe par ces deux points.
  • • INTERPOLER, c'est estimer à l'intérieur de l'intervalle des données observées : c'est fiable. EXTRAPOLER, c'est estimer au-delà : le modèle n'y a jamais été vérifié.
  • • Une corrélation, même très forte, ne démontre JAMAIS une relation de cause à effet.
  • • Droite MÉDIANE-MÉDIANE : on ordonne selon xx, on forme TROIS groupes de même effectif (s'il reste une donnée elle va au groupe du milieu, s'il en reste deux elles vont aux deux groupes extrêmes), on calcule dans chaque groupe la médiane des xx et la médiane des yy séparément, on trace la droite par M1M_1 et M3M_3, puis on la translate du tiers de son écart vertical à M2M_2. La droite obtenue passe par le point moyen des trois médianes, ce qui sert de vérification.
  • • Mayer utilise des MOYENNES, donc une valeur extrême tire la droite ; la médiane-médiane utilise des MÉDIANES, donc une valeur extrême ne compte que par son rang. Nuage régulier, Mayer ; nuage avec une donnée aberrante, médiane-médiane, et on le justifie.
  • • Dans un TABLEAU À DOUBLE ENTRÉE, les totaux de ligne et les totaux de colonne doivent donner le même effectif total. Le mot qui suit « parmi » désigne le total à mettre au dénominateur du pourcentage.

Partie A : Décrire et modéliser (/50)

Exercice 1 : Construire et décrire un nuage de points

Une enseignante relève, pour dix élèves, le nombre d'heures de révision consacrées à un examen et la note obtenue sur 100. Ces données servent de fil conducteur aux exercices 1, 3 et 4.

Le nuage correspondant est représenté sur la figure.

Heures0123456789
Note42485158606771748085
1234567891030405060708090heuresnote
  • a) Quelle est la variable indépendante et quelle est la variable dépendante ? Justifiez.
  • b) Décrivez le SENS de la corrélation et justifiez à partir des données.
  • c) Décrivez son INTENSITÉ. Le nuage est-il proche d'une droite ?
  • d) Un onzième élève a révisé 55 heures et obtenu 4545. Où se situerait son point, et comment qualifieriez-vous cette donnée ?

Tape tes réponses, la page te dit juste ou faux 0/4

a)
b)
c)
d)
Voir la correction

Réponses

  • a) Indépendante : heures de révision ; dépendante : note
  • b) Positive : les notes croissent avec les heures
  • c) Forte, r≈0,99r\approx 0{,}99 : presque une droite
  • d) (5 ;45)(5\,;45), très sous le nuage : donnée aberrante

a) La variable indépendante est le nombre d'heures de révision : c'est celle que l'élève contrôle et qu'on porte en abscisse. La variable dépendante est la note, portée en ordonnée, car c'est elle qu'on cherche à expliquer par l'autre. Le critère de décision est toujours le même : on se demande laquelle des deux pourrait raisonnablement influencer l'autre. Ici, réviser peut faire monter une note, alors qu'obtenir une note ne fait pas réviser rétroactivement.

b) La corrélation est POSITIVE : lorsque le nombre d'heures augmente, la note augmente aussi. On le vérifie sur les données brutes sans même tracer le nuage, puisque la suite des notes, 4242, 4848, 5151, 5858, 6060, 6767, 7171, 7474, 8080, 8585, est strictement croissante. Sur le graphique, cela se traduit par un nuage qui monte de la gauche vers la droite.

c) L'intensité est FORTE. Les points sont alignés de façon très régulière, avec des écarts faibles par rapport à une droite imaginaire : entre deux élèves consécutifs, la note gagne à chaque fois entre 22 et 77 points, sans jamais reculer, ce qui est une progression très régulière. On estimerait rr autour de 0,990{,}99. Le nuage est donc très proche d'une droite, ce qui justifie l'emploi d'une droite de régression dans les exercices suivants. Un nuage en forme de banane ou de nuage rond, lui, ne l'aurait pas justifié.

d) Le point serait (5;45)(5;45). Or les élèves qui ont révisé 55 heures obtiennent normalement autour de 6767, et une note de 4545 correspond plutôt à une révision de moins d'une heure. Ce point se situerait donc TRÈS EN DESSOUS du nuage, nettement à l'écart des autres : c'est une donnée ABERRANTE. Devant une telle valeur, la démarche correcte n'est pas de la supprimer d'office, mais de chercher d'abord si elle vient d'une erreur de saisie ou d'une circonstance particulière, une maladie par exemple. L'exercice 7 montre l'ampleur des dégâts qu'un seul point de ce type peut causer à un modèle.

Coche ici les exercices faits ou à revoir : un compte gratuit, sans mot de passe, retient tes coches d'une visite à l'autre et te dit quel chapitre attaquer ensuite. Crée ton espace, un courriel suffit.

Exercice 2 : Estimer le coefficient de corrélation

La méthode du rectangle permet d'estimer rr sans aucun calcul statistique : on trace le plus petit rectangle qui contient le nuage, orienté selon son allongement, puis on applique r≈±(1−lL)r\approx\pm\left(1-\dfrac{l}{L}\right).

Sur la figure, ce rectangle a une longueur L=15L=15 unités et une largeur l=3l=3 unités.

-224681012-22468101214
  • a) Estimez le coefficient de corrélation du nuage de la figure, signe compris.
  • b) Qualifiez cette corrélation en mots.
  • c) Un second nuage, décroissant, est contenu dans un rectangle de longueur 1010 et de largeur 88. Estimez son coefficient et qualifiez-le.
  • d) Que devient le rectangle lorsque la corrélation est parfaite ? Et lorsqu'elle est nulle ? Déduisez-en les valeurs extrêmes de rr.

Tape tes réponses, la page te dit juste ou faux 0/6

a)
b)
c)
d)
Voir la correction

Réponses

  • a) r≈0,8r\approx 0{,}8
  • b) Forte et positive
  • c) r≈−0,2r\approx -0{,}2 : faible et négative
  • d) Parfaite : l=0l=0, r=±1r=\pm 1 ; nulle : l=Ll=L, r=0r=0

a) On applique la formule : 1−lL=1−315=1−0,2=0,81-\dfrac{l}{L}=1-\dfrac{3}{15}=1-0{,}2=0{,}8. Le nuage monte de la gauche vers la droite, donc le signe est positif. On estime r≈0,8r\approx 0{,}8. Attention à ne pas inverser le quotient : c'est la largeur sur la longueur, et non l'inverse, sans quoi on obtiendrait 1−5=−41-5=-4, une valeur impossible puisque rr reste toujours entre −1-1 et 11.

b) Une valeur de 0,80{,}8 correspond à une corrélation FORTE et POSITIVE. Concrètement, cela signifie que le nombre représenté en abscisse explique une grande partie de la variation observée en ordonnée, et qu'une droite de régression fournira des prévisions raisonnablement fiables.

c) Ici 1−810=1−0,8=0,21-\dfrac{8}{10}=1-0{,}8=0{,}2, et le nuage est décroissant, donc r≈−0,2r\approx -0{,}2. C'est une corrélation FAIBLE et NÉGATIVE. Un rectangle presque carré signale un nuage rond, donc l'absence de direction privilégiée : tracer une droite de régression sur de telles données n'aurait guère de sens, et toute prévision qu'on en tirerait serait peu crédible.

d) Si la corrélation est PARFAITE, tous les points sont exactement alignés : le rectangle s'aplatit complètement, sa largeur ll devient nulle, et la formule donne 1−0L=11-\dfrac{0}{L}=1. On obtient donc r=1r=1 pour une droite croissante et r=−1r=-1 pour une droite décroissante. Si la corrélation est NULLE, le nuage n'a aucune direction privilégiée, il est aussi large que long, donc l=Ll=L et la formule donne 1−LL=01-\dfrac{L}{L}=0, soit r=0r=0. Le coefficient est ainsi toujours compris entre −1-1 et 11, et ces deux cas limites en donnent une lecture géométrique immédiate : plus le rectangle est fin, plus ∣r∣|r| est proche de 11.

Exercice 3 : La droite de Mayer

On reprend les données de l'exercice 1 : les heures de révision xx et les notes yy de dix élèves.

La méthode de Mayer partage les données ordonnées en DEUX groupes de même effectif, calcule le point moyen de chacun, et fait passer la droite par ces deux points.

  • a) Formez les deux groupes et calculez les coordonnées des deux points moyens P1P_1 et P2P_2.
  • b) Calculez la pente de la droite de Mayer.
  • c) Déterminez l'équation de la droite sous la forme y=ax+by=ax+b.
  • d) Vérifiez que la droite passe bien par les deux points moyens.

Tape tes réponses, la page te dit juste ou faux 0/6

a)
b)
c)
Voir la correction

Réponses

  • a) P1=(2 ;51,8)P_1=(2\,;51{,}8), P2=(7 ;75,4)P_2=(7\,;75{,}4)
  • b) a=4,72a=4{,}72
  • c) y=4,72x+42,36y=4{,}72x+42{,}36
  • d) P1P_1 et P2P_2 vérifient l'équation ✓

a) Les données sont déjà ordonnées selon xx. Le premier groupe rassemble les cinq premières valeurs, x=0,1,2,3,4x=0,1,2,3,4, dont les notes sont 4242, 4848, 5151, 5858 et 6060. Sa moyenne en xx vaut 0+1+2+3+45=105=2\dfrac{0+1+2+3+4}{5}=\dfrac{10}{5}=2 et sa moyenne en yy vaut 42+48+51+58+605=2595=51,8\dfrac{42+48+51+58+60}{5}=\dfrac{259}{5}=51{,}8. Donc P1=(2;51,8)P_1=(2;51{,}8). Le second groupe rassemble x=5,6,7,8,9x=5,6,7,8,9, de notes 6767, 7171, 7474, 8080 et 8585. Ses moyennes valent 355=7\dfrac{35}{5}=7 et 3775=75,4\dfrac{377}{5}=75{,}4. Donc P2=(7;75,4)P_2=(7;75{,}4).

b) La pente se calcule comme pour n'importe quelle droite passant par deux points : a=y2−y1x2−x1=75,4−51,87−2=23,65=4,72a=\dfrac{y_2-y_1}{x_2-x_1}=\dfrac{75{,}4-51{,}8}{7-2}=\dfrac{23{,}6}{5}=4{,}72. Interprétation immédiate, et c'est elle qui rapporte les points en examen : chaque heure de révision supplémentaire est associée à une hausse d'environ 4,74{,}7 points à l'examen.

c) On part de la forme point-pente avec P1P_1 : y−51,8=4,72(x−2)y-51{,}8=4{,}72(x-2), donc y=4,72x−9,44+51,8y=4{,}72x-9{,}44+51{,}8, soit y=4,72x+42,36y=4{,}72x+42{,}36. L'ordonnée à l'origine, 42,3642{,}36, s'interprète comme la note que le modèle prévoit pour un élève n'ayant pas révisé du tout. C'est ici une valeur plausible, puisque x=0x=0 fait bien partie des données observées, ce qui n'est pas toujours le cas.

d) Contrôle avec P1P_1 : 4,72(2)+42,36=9,44+42,36=51,84{,}72(2)+42{,}36=9{,}44+42{,}36=51{,}8 ✓. Contrôle avec P2P_2 : 4,72(7)+42,36=33,04+42,36=75,44{,}72(7)+42{,}36=33{,}04+42{,}36=75{,}4 ✓. La droite passe exactement par les deux points moyens, ce qui est la définition même de la méthode de Mayer. Faire cette double vérification est essentiel : elle attrape aussi bien une erreur de pente qu'une erreur d'ordonnée à l'origine, alors qu'un seul contrôle laisserait passer une droite de pente fausse ajustée sur un point.

Exercice 4 : Interpoler, extrapoler et connaître les limites

On utilise la droite de Mayer trouvée à l'exercice 3 : y=4,72x+42,36y=4{,}72x+42{,}36, où xx est le nombre d'heures de révision et yy la note sur 100100.

Les données observées vont de 00 à 99 heures. Retenez cet intervalle : c'est lui qui décide de la fiabilité de chaque prévision.

  • a) Estimez la note d'un élève ayant révisé 4,54{,}5 heures. S'agit-il d'une interpolation ou d'une extrapolation ?
  • b) Estimez la note d'un élève ayant révisé 1515 heures. Commentez le résultat.
  • c) À partir de combien d'heures le modèle prévoit-il une note supérieure à 100100 ?
  • d) Un élève affirme : « d'après ce modèle, en révisant 2525 heures j'aurai 160160 ». Que répondre ?

Tape tes réponses, la page te dit juste ou faux 0/6

a)
b)
c)
d)
Voir la correction

Réponses

  • a) 63,663{,}6 : interpolation
  • b) 113,16113{,}16 : extrapolation invalide
  • c) Au-delà de ≈12,21\approx 12{,}21 heures
  • d) Extrapolation extrême, note impossible au-delà de 100100

a) y=4,72(4,5)+42,36=21,24+42,36=63,6y=4{,}72(4{,}5)+42{,}36=21{,}24+42{,}36=63{,}6. La note estimée est d'environ 63,663{,}6. Comme 4,54{,}5 se situe à l'intérieur de l'intervalle observé [0;9][0;9], il s'agit d'une INTERPOLATION. C'est le cas fiable : le modèle a été construit sur des données qui encadrent cette valeur, on peut raisonnablement s'y fier.

b) y=4,72(15)+42,36=70,8+42,36=113,16y=4{,}72(15)+42{,}36=70{,}8+42{,}36=113{,}16. Le modèle prévoit une note de 113113 sur 100100, ce qui est IMPOSSIBLE. Comme 1515 dépasse largement l'intervalle observé, il s'agit d'une EXTRAPOLATION, et elle est ici manifestement invalide. Le modèle linéaire suppose que chaque heure rapporte toujours 4,724{,}72 points, alors qu'en réalité les gains ralentissent : à partir d'un certain point, l'élève maîtrise déjà la matière et réviser davantage n'ajoute plus rien. C'est ce qu'on appelle un rendement décroissant, et aucune droite ne peut le représenter.

c) On résout 4,72x+42,36>1004{,}72x+42{,}36>100, soit 4,72x>57,644{,}72x>57{,}64, donc x>57,644,72≈12,21x>\dfrac{57{,}64}{4{,}72}\approx 12{,}21. Au-delà d'environ 12,212{,}2 heures de révision, le modèle prévoit une note supérieure à 100100. Cette valeur est très utile : elle donne la BORNE au-delà de laquelle le modèle produit à coup sûr des absurdités, et donc une limite claire à ne jamais dépasser lorsqu'on s'en sert pour prédire.

d) Le calcul de l'élève est arithmétiquement juste, 4,72(25)+42,36=118+42,36=160,364{,}72(25)+42{,}36=118+42{,}36=160{,}36, mais sa conclusion ne l'est pas. Trois objections à formuler. Premièrement, une note ne peut pas dépasser 100100 : le résultat est hors du domaine de la variable dépendante. Deuxièmement, 2525 heures est presque le triple de la plus grande valeur observée, donc l'extrapolation est extrême et rien ne garantit que la relation reste linéaire si loin. Troisièmement, et c'est l'objection de fond, un modèle statistique décrit ce qu'on a OBSERVÉ, il ne promet rien au-delà. La bonne formulation serait : « sur l'intervalle de 00 à 99 heures, chaque heure supplémentaire est associée à environ 4,74{,}7 points de plus », et rien de plus.

Exercice 5 : Lire une droite de régression

Dans une école, on a relevé pour huit élèves le nombre d'absences dans un cours et la note finale. La droite de régression obtenue est y=−2,5x+95y=-2{,}5x+95, tracée sur la figure avec le nuage.

Ici on ne calcule pas la droite, on la LIT : chaque coefficient a un sens concret qu'il faut savoir énoncer.

2468101214165060708090100absencesnote
  • a) Interprétez la pente dans le contexte.
  • b) Interprétez l'ordonnée à l'origine dans le contexte.
  • c) Quelle note le modèle prévoit-il pour un élève ayant 88 absences ?
  • d) À partir de combien d'absences le modèle prévoit-il une note inférieure à 6060 ?

Tape tes réponses, la page te dit juste ou faux 0/4

a)
b)
c)
d)
Voir la correction

Réponses

  • a) Chaque absence est associée à 2,52{,}5 points de moins
  • b) 9595 : note prévue sans absence
  • c) 7575
  • d) x>14x>14 : 1515 absences ou plus

a) La pente vaut −2,5-2{,}5. Elle est NÉGATIVE, ce qui traduit une corrélation négative : plus les absences augmentent, plus la note diminue. Concrètement, chaque absence supplémentaire est associée à une baisse d'environ 2,52{,}5 points de la note finale. La formulation compte : on dit « est associée à », et non « fait perdre », parce qu'une droite de régression ne démontre aucune causalité, ce que l'exercice 6 développe.

b) L'ordonnée à l'origine vaut 9595. C'est la valeur prévue par le modèle quand x=0x=0, c'est-à-dire la note attendue pour un élève n'ayant AUCUNE absence : environ 9595 sur 100100. Cette lecture est ici légitime, car x=0x=0 figure parmi les données observées, le nuage contenant bien un point d'abscisse 00. Lorsque x=0x=0 est hors de l'intervalle observé, l'ordonnée à l'origine n'est qu'un artefact de calcul et ne s'interprète pas.

c) On remplace : y=−2,5(8)+95=−20+95=75y=-2{,}5(8)+95=-20+95=75. Le modèle prévoit une note d'environ 7575. Le point observé correspondant est (8;74)(8;74), très proche de la prévision, ce qui confirme visuellement la qualité de l'ajustement.

d) On résout l'inéquation −2,5x+95<60-2{,}5x+95<60, soit −2,5x<−35-2{,}5x<-35. En divisant par −2,5-2{,}5, un nombre NÉGATIF, le sens de l'inégalité s'inverse : x>14x>14. Comme un nombre d'absences est un entier, la réponse concrète est 1515 absences ou plus. Vérification aux bornes : pour x=14x=14, y=−35+95=60y=-35+95=60, exactement à la limite et donc pas strictement inférieur ; pour x=15x=15, y=−37,5+95=57,5y=-37{,}5+95=57{,}5, bien en dessous de 6060 ✓.

Partie B : Niveau examen (/50)

Exercice 6 : Corrélation n'est pas causalité

Chacune des situations suivantes présente une corrélation statistique bien réelle. Pour chacune, dites si l'on peut conclure à une relation de cause à effet, et si non, proposez une explication.

Une réponse complète nomme la VARIABLE CONFONDANTE, c'est-à-dire le facteur caché qui influence les deux variables observées à la fois.

  • a) Dans une ville, les ventes de crème glacée et le nombre de noyades sont fortement corrélées positivement.
  • b) Plus il y a de pompiers dépêchés sur un incendie, plus les dégâts sont importants.
  • c) Chez les enfants de 55 à 1212 ans, la pointure de chaussure est fortement corrélée au niveau de lecture.
  • d) Dans une école, le nombre d'heures de sommeil la veille d'un examen est corrélé positivement à la note obtenue.

Tape tes réponses, la page te dit juste ou faux 0/4

a)
b)
c)
d)
Voir la correction

Réponses

  • a) Non : la température
  • b) Non : la taille du sinistre
  • c) Non : l'âge
  • d) Causalité plausible, mais non prouvée par la corrélation

a) Non, on ne peut pas conclure que manger de la crème glacée provoque des noyades. La variable confondante est la TEMPÉRATURE, ou plus généralement la saison. Quand il fait chaud, les gens achètent davantage de crème glacée ET vont davantage se baigner, ce qui augmente mécaniquement le nombre d'accidents. Les deux variables observées montent ensemble parce qu'elles dépendent toutes deux d'une troisième, sans avoir la moindre influence l'une sur l'autre.

b) Non, envoyer plus de pompiers n'aggrave évidemment pas l'incendie. La variable confondante est la TAILLE DU SINISTRE. Un grand incendie cause beaucoup de dégâts et mobilise beaucoup de pompiers ; un feu de poubelle fait peu de dégâts et mobilise une seule équipe. C'est la gravité initiale qui détermine les deux quantités. On remarquera que cet exemple a la même structure que le a), mais qu'il est plus troublant, parce que la corrélation y semble suggérer une causalité inversée.

c) Non. La variable confondante est l'ÂGE. Un enfant de 1212 ans a de plus grands pieds qu'un enfant de 55 ans, et il lit aussi beaucoup mieux, parce qu'il a plusieurs années de scolarité supplémentaires. Les deux variables croissent avec l'âge, d'où une corrélation forte, alors que la taille du pied n'a strictement aucun effet sur la lecture. Détail révélateur : si l'on étudiait uniquement des enfants de 88 ans, la corrélation disparaîtrait presque entièrement, ce qui est le test classique pour démasquer une variable confondante.

d) Ici, contrairement aux trois autres, une relation causale est PLAUSIBLE : un sommeil suffisant améliore réellement la concentration et la mémoire, et il existe des expériences contrôlées qui l'établissent. Mais la corrélation seule ne suffit toujours pas à le prouver, et deux réserves subsistent. D'une part, il peut y avoir causalité inverse ou circulaire : un élève qui maîtrise bien sa matière est moins anxieux, donc dort mieux. D'autre part, une variable confondante reste possible, par exemple l'organisation générale du travail, qui fait à la fois mieux dormir et mieux réviser. La conclusion de méthode à retenir vaut pour les quatre cas : seule une expérience contrôlée, où l'on fait varier une variable en maintenant les autres constantes, peut établir une causalité. Une corrélation, si forte soit-elle, ne fait que la suggérer.

Exercice 7 : L'effet d'une donnée aberrante

On étudie huit couples de données : xx vaut 11 à 88, et les valeurs correspondantes de yy sont 33, 55, 44, 77, 88, 1010, 99 et 1212.

On veut mesurer à quel point une SEULE donnée fausse peut déformer un modèle.

  • a) Déterminez la droite de Mayer de ces données.
  • b) Par erreur de saisie, la dernière valeur est enregistrée comme 3030 au lieu de 1212. Déterminez la nouvelle droite de Mayer.
  • c) Comparez les deux pentes. De quel pourcentage la pente a-t-elle changé ?
  • d) Comparez les prévisions des deux modèles en x=3x=3. Quelle leçon en tirer avant de modéliser des données ?

Tape tes réponses, la page te dit juste ou faux 0/7

a)
b)
c)
d)
Voir la correction

Réponses

  • a) y=1,25x+1,625y=1{,}25x+1{,}625
  • b) y=2,375x−1,1875y=2{,}375x-1{,}1875
  • c) La pente augmente de 9090 %
  • d) 5,3755{,}375 contre 5,93755{,}9375 : tracer le nuage d'abord

a) Premier groupe, x=1,2,3,4x=1,2,3,4 avec y=3,5,4,7y=3,5,4,7 : moyennes 1+2+3+44=2,5\dfrac{1+2+3+4}{4}=2{,}5 et 3+5+4+74=194=4,75\dfrac{3+5+4+7}{4}=\dfrac{19}{4}=4{,}75, donc P1=(2,5;4,75)P_1=(2{,}5;4{,}75). Second groupe, x=5,6,7,8x=5,6,7,8 avec y=8,10,9,12y=8,10,9,12 : moyennes 264=6,5\dfrac{26}{4}=6{,}5 et 394=9,75\dfrac{39}{4}=9{,}75, donc P2=(6,5;9,75)P_2=(6{,}5;9{,}75). La pente vaut 9,75−4,756,5−2,5=54=1,25\dfrac{9{,}75-4{,}75}{6{,}5-2{,}5}=\dfrac{5}{4}=1{,}25. L'équation est y−4,75=1,25(x−2,5)y-4{,}75=1{,}25(x-2{,}5), soit y=1,25x+1,625y=1{,}25x+1{,}625.

b) Le premier groupe est inchangé, donc P1=(2,5;4,75)P_1=(2{,}5;4{,}75). Seul le second bouge : les valeurs deviennent 88, 1010, 99 et 3030, de moyenne 574=14,25\dfrac{57}{4}=14{,}25, donc P2′=(6,5;14,25)P_2'=(6{,}5;14{,}25). La nouvelle pente vaut 14,25−4,754=9,54=2,375\dfrac{14{,}25-4{,}75}{4}=\dfrac{9{,}5}{4}=2{,}375, et l'équation devient y=2,375x−1,1875y=2{,}375x-1{,}1875, puisque 4,75−2,375(2,5)=4,75−5,9375=−1,18754{,}75-2{,}375(2{,}5)=4{,}75-5{,}9375=-1{,}1875.

c) La pente est passée de 1,251{,}25 à 2,3752{,}375, soit une augmentation de 1,1251{,}125. En pourcentage : 1,1251,25=0,9\dfrac{1{,}125}{1{,}25}=0{,}9, c'est-à-dire 9090 %. La pente a donc presque DOUBLÉ à cause d'une seule valeur sur huit. L'ordonnée à l'origine, elle, a basculé du positif au négatif, passant de 1,6251{,}625 à −1,1875-1{,}1875. Le modèle est méconnaissable.

d) Le premier modèle prévoit 1,25(3)+1,625=3,75+1,625=5,3751{,}25(3)+1{,}625=3{,}75+1{,}625=5{,}375. Le second prévoit 2,375(3)−1,1875=7,125−1,1875=5,93752{,}375(3)-1{,}1875=7{,}125-1{,}1875=5{,}9375. L'écart est de 0,56250{,}5625, soit environ 1010 % : modeste au centre du nuage, parce que les deux droites y passent près l'une de l'autre. Mais l'écart se creuse dès qu'on s'éloigne : en x=8x=8, les prévisions valent 11,62511{,}625 et 17,812517{,}8125, soit 5353 % de différence. Leçon de méthode : il faut TOUJOURS tracer le nuage de points AVANT de calculer quoi que ce soit. Un simple coup d'œil aurait révélé que le point (8;30)(8;30) ne ressemble à aucun autre, alors qu'aucune formule ne le signale, la méthode de Mayer avalant sans broncher une valeur absurde. C'est aussi pourquoi une valeur aberrante se vérifie à la source avant d'être ni supprimée ni conservée aveuglément.

Exercice 8 : Quand la droite ne convient pas

On observe les couples suivants : pour xx allant de 11 à 88, les valeurs de yy sont 11, 44, 99, 1616, 2525, 3636, 4949 et 6464.

La droite de Mayer de ces données est y=9x−15y=9x-15, tracée sur la figure. Un coefficient de corrélation élevé ne garantit pas qu'une droite soit le bon modèle : ce sont les RÉSIDUS qui tranchent.

123456789-20-1010203040506070
  • a) Vérifiez la droite de Mayer en calculant les deux points moyens.
  • b) Calculez le résidu (valeur observée moins valeur prévue) pour chacune des huit données.
  • c) Décrivez la structure des résidus. Que révèle-t-elle ?
  • d) Quel type de modèle conviendrait mieux ? Justifiez à partir des données brutes.

Tape tes réponses, la page te dit juste ou faux 0/7

a)
b)
c)
d)
Voir la correction

Réponses

  • a) P1=(2,5 ;7,5)P_1=(2{,}5\,;7{,}5), P2=(6,5 ;43,5)P_2=(6{,}5\,;43{,}5), y=9x−15y=9x-15 ✓
  • b) +7+7, +1+1, −3-3, −5-5, −5-5, −3-3, +1+1, +7+7
  • c) Résidus en U : courbure
  • d) Modèle quadratique : y=x2y=x^2

a) Premier groupe, x=1,2,3,4x=1,2,3,4 avec y=1,4,9,16y=1,4,9,16 : moyennes 2,52{,}5 et 304=7,5\dfrac{30}{4}=7{,}5, donc P1=(2,5;7,5)P_1=(2{,}5;7{,}5). Second groupe, x=5,6,7,8x=5,6,7,8 avec y=25,36,49,64y=25,36,49,64 : moyennes 6,56{,}5 et 1744=43,5\dfrac{174}{4}=43{,}5, donc P2=(6,5;43,5)P_2=(6{,}5;43{,}5). Pente : 43,5−7,54=364=9\dfrac{43{,}5-7{,}5}{4}=\dfrac{36}{4}=9. Équation : y−7,5=9(x−2,5)y-7{,}5=9(x-2{,}5), soit y=9x−22,5+7,5=9x−15y=9x-22{,}5+7{,}5=9x-15 ✓.

b) On calcule la prévision puis le résidu pour chaque point. En x=1x=1 : prévu −6-6, observé 11, résidu +7+7. En x=2x=2 : prévu 33, observé 44, résidu +1+1. En x=3x=3 : prévu 1212, observé 99, résidu −3-3. En x=4x=4 : prévu 2121, observé 1616, résidu −5-5. En x=5x=5 : prévu 3030, observé 2525, résidu −5-5. En x=6x=6 : prévu 3939, observé 3636, résidu −3-3. En x=7x=7 : prévu 4848, observé 4949, résidu +1+1. En x=8x=8 : prévu 5757, observé 6464, résidu +7+7.

c) La suite des résidus est +7+7, +1+1, −3-3, −5-5, −5-5, −3-3, +1+1, +7+7. Elle n'est pas du tout aléatoire : elle est positive aux deux extrémités, négative au milieu, et parfaitement symétrique. C'est la signature d'une COURBURE que la droite ne peut pas suivre. Un bon ajustement linéaire produirait des résidus dispersés sans ordre apparent, alternant le signe au hasard ; ici ils dessinent un U net. Remarquez aussi l'absurdité que la droite produit en x=1x=1 : elle prévoit −6-6 alors que toutes les données observées sont positives.

d) Un modèle QUADRATIQUE conviendrait, et il est même exact. Les données brutes le disent d'elles-mêmes : 11, 44, 99, 1616, 2525, 3636, 4949, 6464 sont précisément 121^2, 222^2, 323^2, et ainsi de suite. La relation est donc y=x2y=x^2, sans le moindre écart. Autre indice décisif, accessible sans reconnaître les carrés : les DIFFÉRENCES successives valent 33, 55, 77, 99, 1111, 1313, 1515, elles ne sont pas constantes, ce qui exclut une droite. En revanche, les différences de ces différences valent toutes 22, et une différence seconde constante caractérise exactement une fonction du second degré. C'est un test qu'on peut mener en trente secondes sur n'importe quel tableau de données, et il faut le faire avant de sortir une droite de régression.

Exercice 9 : Problème : température et consommation d'électricité

Une municipalité relève, sur six journées d'hiver, la température moyenne extérieure en degrés Celsius et la consommation d'électricité d'un bâtiment en kilowattheures.

Menez l'analyse complète : modèle, interprétation, prévision et limites.

Température (°C)0510152025
Consommation (kWh)827465584942
  • a) Décrivez le sens et l'intensité de la corrélation.
  • b) Déterminez la droite de Mayer.
  • c) Interprétez la pente, puis estimez la consommation à 1212 °C.
  • d) Que prévoit le modèle à 6060 °C ? Commentez, en distinguant deux raisons de rejeter cette prévision.

Tape tes réponses, la page te dit juste ou faux 0/6

a)
b)
c)
d)
Voir la correction

Réponses

  • a) Négative et très forte
  • b) y≈−1,6x+81,67y\approx -1{,}6x+81{,}67
  • c) −1,6-1{,}6 kWh par degré ; ≈62,47\approx 62{,}47 kWh à 1212 °C
  • d) ≈−14,33\approx -14{,}33 kWh : impossible et hors domaine

a) La corrélation est NÉGATIVE : quand la température monte, la consommation baisse, ce qui est cohérent avec un bâtiment chauffé en hiver. Son intensité est TRÈS FORTE : les baisses successives valent 88, 99, 77, 99 et 77 kWh pour des hausses régulières de 55 °C, donc environ 88 kWh à chaque palier. Une telle régularité place ∣r∣|r| au-dessus de 0,990{,}99, et le nuage est pratiquement une droite.

b) Premier groupe, températures 00, 55 et 1010 avec consommations 8282, 7474 et 6565 : moyennes 153=5\dfrac{15}{3}=5 et 2213≈73,67\dfrac{221}{3}\approx 73{,}67, donc P1≈(5;73,67)P_1\approx(5;73{,}67). Second groupe, températures 1515, 2020 et 2525 avec consommations 5858, 4949 et 4242 : moyennes 603=20\dfrac{60}{3}=20 et 1493≈49,67\dfrac{149}{3}\approx 49{,}67, donc P2≈(20;49,67)P_2\approx(20;49{,}67). Pente : 49,67−73,6720−5=−2415=−1,6\dfrac{49{,}67-73{,}67}{20-5}=\dfrac{-24}{15}=-1{,}6. Équation : y−73,67=−1,6(x−5)y-73{,}67=-1{,}6(x-5), soit y=−1,6x+8+73,67y=-1{,}6x+8+73{,}67, c'est-à-dire y≈−1,6x+81,67y\approx -1{,}6x+81{,}67. Contrôle avec P2P_2 : −1,6(20)+81,67=−32+81,67=49,67-1{,}6(20)+81{,}67=-32+81{,}67=49{,}67 ✓.

c) La pente −1,6-1{,}6 signifie que chaque degré Celsius supplémentaire est associé à une baisse d'environ 1,61{,}6 kWh de consommation quotidienne. C'est parfaitement interprétable : il fait moins froid, donc le chauffage tourne moins. Pour 1212 °C : y=−1,6(12)+81,67=−19,2+81,67=62,47y=-1{,}6(12)+81{,}67=-19{,}2+81{,}67=62{,}47 kWh. Comme 1212 se situe dans l'intervalle observé [0;25][0;25], c'est une interpolation, et l'estimation d'environ 62,562{,}5 kWh est fiable.

d) Pour 6060 °C : y=−1,6(60)+81,67=−96+81,67=−14,33y=-1{,}6(60)+81{,}67=-96+81{,}67=-14{,}33 kWh. Deux raisons distinctes de rejeter cette prévision. La première est MATHÉMATIQUE et immédiate : une consommation d'électricité négative n'a aucun sens, la valeur sort du domaine possible de la variable. Le modèle traverse d'ailleurs zéro à x=81,671,6≈51,0x=\dfrac{81{,}67}{1{,}6}\approx 51{,}0 °C, borne au-delà de laquelle il ne produit plus que des absurdités. La seconde raison est PHYSIQUE et plus profonde : à 6060 °C, non seulement le chauffage serait éteint, mais la climatisation fonctionnerait à plein régime, et la consommation REPARTIRAIT À LA HAUSSE. La vraie relation n'est donc pas décroissante partout, elle est en forme de U, minimale autour de la température de confort. Les données recueillies ne couvrent qu'une seule branche de cette courbe, la branche hivernale, et aucune droite ajustée sur ce seul morceau ne peut décrire ce qui se passe de l'autre côté. C'est l'illustration la plus nette du principe du chapitre : un modèle ne vaut que sur le domaine où il a été construit.

Exercice 10 : Synthèse : rédiger une conclusion défendable

On revient une dernière fois aux données des exercices 1, 3 et 4 : heures de révision et notes de dix élèves, modélisées par y=4,72x+42,36y=4{,}72x+42{,}36 sur l'intervalle observé [0;9][0;9].

L'enjeu de cet exercice n'est pas de calculer, c'est de dire ce que le modèle autorise à affirmer, et ce qu'il n'autorise pas.

  • a) Estimez la note d'un élève ayant révisé 6,56{,}5 heures, et précisez la fiabilité de cette estimation.
  • b) Combien d'heures faudrait-il, selon le modèle, pour viser 9090 ? Cette réponse est-elle utilisable ?
  • c) Le directeur veut écrire dans le journal de l'école : « réviser une heure de plus fait gagner 4,7 points ». Corrigez cette phrase.
  • d) Rédigez en trois phrases la conclusion statistique complète de cette étude.

Tape tes réponses, la page te dit juste ou faux 0/4

a)
b)
c)
Voir la correction

Réponses

  • a) ≈73\approx 73 : interpolation fiable
  • b) ≈10,09\approx 10{,}09 h : extrapolation modérée, avec prudence
  • c) « Chaque heure de plus s'accompagnait en moyenne d'environ 4,74{,}7 points de plus »
  • d) Constat, modèle interprété, limites (domaine et causalité)

a) y=4,72(6,5)+42,36=30,68+42,36=73,04y=4{,}72(6{,}5)+42{,}36=30{,}68+42{,}36=73{,}04. L'estimation est d'environ 7373. Comme 6,56{,}5 appartient à l'intervalle observé [0;9][0;9], il s'agit d'une interpolation et l'estimation est FIABLE. On l'annoncerait avec une marge, autour de 7373 plus ou moins quelques points, plutôt que comme un chiffre exact : un modèle statistique donne une tendance, pas une prédiction individuelle.

b) On résout 4,72x+42,36=904{,}72x+42{,}36=90, soit 4,72x=47,644{,}72x=47{,}64, donc x=47,644,72≈10,09x=\dfrac{47{,}64}{4{,}72}\approx 10{,}09 heures. La réponse est utilisable avec PRUDENCE, et il faut le dire explicitement : 10,0910{,}09 dépasse la plus grande valeur observée, 99 heures, il s'agit donc d'une extrapolation. Elle reste modérée, à peine plus d'une heure au-delà des données, ce qui la rend nettement plus défendable que les 1515 ou 2525 heures de l'exercice 4. La formulation honnête serait : « environ 1010 heures, en supposant que la tendance observée se prolonge un peu au-delà de 99 heures ».

c) La phrase du directeur commet deux fautes. D'abord, elle affirme une CAUSALITÉ, « fait gagner », alors que l'étude n'établit qu'une association : les élèves qui ont révisé davantage ont obtenu de meilleures notes, mais ils sont peut-être aussi ceux qui étaient déjà les plus motivés ou les mieux organisés, ce qui serait une variable confondante classique. Ensuite, elle présente le résultat comme UNIVERSEL, alors qu'il ne vaut que pour ces dix élèves, sur cet examen, et dans l'intervalle de 00 à 99 heures. Une formulation correcte : « dans notre relevé, chaque heure de révision supplémentaire s'accompagnait en moyenne d'environ 4,74{,}7 points de plus ».

d) Conclusion en trois phrases. Premièrement, on observe une corrélation linéaire positive très forte entre le nombre d'heures de révision et la note obtenue, pour ces dix élèves. Deuxièmement, la droite de Mayer y=4,72x+42,36y=4{,}72x+42{,}36 modélise bien cette relation sur l'intervalle observé de 00 à 99 heures, où chaque heure supplémentaire correspond en moyenne à environ 4,74{,}7 points de plus. Troisièmement, ce modèle ne doit pas être extrapolé au-delà de 99 heures, puisqu'il prévoit des notes supérieures à 100100 dès 12,212{,}2 heures, et il n'établit aucune relation de cause à effet, seule une expérience contrôlée pourrait le faire. C'est exactement le type de rédaction attendu en question à développement : un constat, un modèle chiffré et interprété, et ses limites.

Partie C : La droite médiane-médiane et le tableau à double entrée (/40)

Exercice 11 : La droite médiane-médiane, la méthode complète

Une ville a relevé, sur onze chutes de neige, la quantité tombée xx en centimètres et le nombre d'heures yy consacrées au déneigement. Les données sont déjà ordonnées selon xx.

La droite médiane-médiane partage les données en TROIS groupes, prend le point médian de chacun, trace la droite qui joint le premier au troisième, puis la translate du tiers de la distance qui la sépare du deuxième.

Neige (cm)24579111214161821
Heures35689121215161921
2468101214161820222424681012141618202224neige (cm)heures
  • a) Formez les trois groupes. Comme 1111 n'est pas un multiple de 33, dites quelle répartition s'impose et pourquoi.
  • b) Calculez les trois points médians M1M_1, M2M_2 et M3M_3.
  • c) Donnez l'équation de la droite passant par M1M_1 et M3M_3.
  • d) Translatez cette droite du tiers de sa distance verticale à M2M_2, puis vérifiez le résultat par le point moyen des trois médianes.

Tape tes réponses, la page te dit juste ou faux 0/9

a)
b)
c)
d)
Voir la correction

Réponses

  • a) 44-33-44
  • b) M1=(4,5 ;5,5)M_1=(4{,}5\,;5{,}5), M2=(11 ;12)M_2=(11\,;12), M3=(17 ;17,5)M_3=(17\,;17{,}5)
  • c) y=0,96x+1,18y=0{,}96x+1{,}18
  • d) y≈0,96x+1,27y\approx 0{,}96x+1{,}27

a) Les groupes se forment sur les xx ORDONNÉS, jamais sur les yy. Avec 1111 données, la division par 33 donne 33 et il reste 22 : la règle veut alors que les deux groupes EXTRÊMES prennent chacun une donnée de plus, ce qui donne 4−3−44-3-4. On retient la logique plutôt que la règle : le groupe du milieu ne sert qu'à la translation finale, alors que les deux groupes extrêmes fixent la pente, et c'est donc eux qu'il faut nourrir en priorité. Le premier groupe est x=2,4,5,7x=2,4,5,7, le deuxième x=9,11,12x=9,11,12, le troisième x=14,16,18,21x=14,16,18,21.

b) On calcule la médiane des xx et la médiane des yy SÉPARÉMENT dans chaque groupe. Premier groupe, quatre données : la médiane des xx est la moyenne des deux valeurs centrales, 4+52=4,5\dfrac{4+5}{2}=4{,}5, et celle des yy vaut 5+62=5,5\dfrac{5+6}{2}=5{,}5, donc M1=(4,5 ; 5,5)M_1=(4{,}5\ ;\ 5{,}5). Deuxième groupe, trois données : les valeurs centrales sont 1111 et 1212, donc M2=(11 ; 12)M_2=(11\ ;\ 12). Troisième groupe : 16+182=17\dfrac{16+18}{2}=17 et 16+192=17,5\dfrac{16+19}{2}=17{,}5, donc M3=(17 ; 17,5)M_3=(17\ ;\ 17{,}5). Voici le piège qui coûte le plus de points à ce chapitre : M1M_1 vaut (4,5 ; 5,5)(4{,}5\ ;\ 5{,}5) alors qu'AUCUN des onze couples relevés ne vaut (4,5 ; 5,5)(4{,}5\ ;\ 5{,}5). Un point médian n'est pas une donnée, c'est un repère construit, exactement comme le point moyen de la méthode de Mayer.

c) La pente se calcule sur M1M_1 et M3M_3 seulement : a=17,5−5,517−4,5=1212,5=0,96a=\dfrac{17{,}5-5{,}5}{17-4{,}5}=\dfrac{12}{12{,}5}=0{,}96. En passant par M1M_1 : y−5,5=0,96(x−4,5)y-5{,}5=0{,}96(x-4{,}5), donc y=0,96x−4,32+5,5y=0{,}96x-4{,}32+5{,}5, soit y=0,96x+1,18y=0{,}96x+1{,}18. Contrôle sur M3M_3 : 0,96(17)+1,18=16,32+1,18=17,50{,}96(17)+1{,}18=16{,}32+1{,}18=17{,}5 ✓. Interprétation de la pente, toujours exigible : chaque centimètre de neige supplémentaire est associé à environ une heure de déneigement de plus, très précisément 0,960{,}96 heure.

d) On évalue la droite au xx de M2M_2, c'est-à-dire en x=11x=11 : 0,96(11)+1,18=10,56+1,18=11,740{,}96(11)+1{,}18=10{,}56+1{,}18=11{,}74. Le point M2M_2 est à la hauteur 1212, donc l'écart vertical vaut 12−11,74=0,2612-11{,}74=0{,}26, et on en remonte le TIERS, soit 0,263≈0,0867\dfrac{0{,}26}{3}\approx 0{,}0867. La pente ne bouge pas, seule l'ordonnée à l'origine change : b=1,18+0,0867≈1,2667b=1{,}18+0{,}0867\approx 1{,}2667. La droite médiane-médiane est donc y≈0,96x+1,27y\approx 0{,}96x+1{,}27. Vérification, et c'est elle qu'il faut écrire en examen parce qu'elle vaut démonstration : la droite finale doit passer par le point moyen des trois médianes. Ce point vaut (4,5+11+173 ; 5,5+12+17,53)=(32,53 ; 353)≈(10,833 ; 11,667)\left(\dfrac{4{,}5+11+17}{3}\ ;\ \dfrac{5{,}5+12+17{,}5}{3}\right)=\left(\dfrac{32{,}5}{3}\ ;\ \dfrac{35}{3}\right)\approx(10{,}833\ ;\ 11{,}667), et le modèle y donne 0,96(10,833)+1,2667=10,4+1,2667=11,6670{,}96(10{,}833)+1{,}2667=10{,}4+1{,}2667=11{,}667 ✓. Les deux formulations de la méthode, la translation du tiers et le passage par le point moyen des médianes, sont donc la même chose : si vos deux calculs ne concordent pas, l'un des deux est faux.

Exercice 12 : Mayer contre médiane-médiane : l'effet d'un loyer aberrant

Un courtier relève la superficie xx, en mètres carrés, et le loyer mensuel yy, en dollars, de douze appartements d'un même quartier. Le douzième vient d'être entièrement rénové.

On veut prédire le loyer d'un appartement de 6060 mètres carrés. Deux méthodes, deux réponses.

Superficie303540455055606570758085
Loyer700760800870900950101010601120116012201900
  • a) Calculez la droite de Mayer, puis sa prévision pour 6060 mètres carrés.
  • b) Calculez la droite médiane-médiane, puis sa prévision pour 6060 mètres carrés.
  • c) Le loyer observé à 6060 mètres carrés vaut 10101010 dollars. Comparez les deux prévisions et expliquez, en une phrase sur les MOYENNES et les MÉDIANES, d'où vient l'écart.
  • d) Si l'appartement rénové s'était loué 12701270 dollars, dans la tendance des autres, quelle serait la droite de Mayer ? Que faut-il en conclure sur la méthode à privilégier ?

Tape tes réponses, la page te dit juste ou faux 0/7

a)
b)
c)
d)
Voir la correction

Réponses

  • a) y≈13,83x+242,08y\approx 13{,}83x+242{,}08 ; ≈1 072\approx 1\ 072 dollars
  • b) y≈10,25x+393,96y\approx 10{,}25x+393{,}96 ; ≈1 009\approx 1\ 009 dollars
  • c) Erreurs 6262 et 11 dollar : la médiane ignore la valeur du 1 9001\ 900
  • d) y≈10,33x+390,83y\approx 10{,}33x+390{,}83 ; ≈1 011\approx 1\ 011 dollars : médiane-médiane si valeur extrême

a) Les données sont ordonnées selon xx et l'effectif est pair : Mayer coupe en deux groupes de six. Premier groupe, x=30x=30 à 5555 : moyenne des xx =2556=42,5=\dfrac{255}{6}=42{,}5, moyenne des y=700+760+800+870+900+9506=49806=830y=\dfrac{700+760+800+870+900+950}{6}=\dfrac{4980}{6}=830, donc P1=(42,5 ; 830)P_1=(42{,}5\ ;\ 830). Second groupe, x=60x=60 à 8585 : moyenne des x=4356=72,5x=\dfrac{435}{6}=72{,}5, moyenne des y=1010+1060+1120+1160+1220+19006=74706=1245y=\dfrac{1010+1060+1120+1160+1220+1900}{6}=\dfrac{7470}{6}=1245, donc P2=(72,5 ; 1245)P_2=(72{,}5\ ;\ 1245). Pente : 1245−83072,5−42,5=41530≈13,833\dfrac{1245-830}{72{,}5-42{,}5}=\dfrac{415}{30}\approx 13{,}833. Ordonnée : b=830−13,833(42,5)≈830−587,92=242,08b=830-13{,}833(42{,}5)\approx 830-587{,}92=242{,}08. Donc y≈13,83x+242,08y\approx 13{,}83x+242{,}08, et pour x=60x=60 : 13,833(60)+242,08=830+242,08≈107213{,}833(60)+242{,}08=830+242{,}08\approx 1072 dollars.

b) Douze données se partagent exactement en 4−4−44-4-4. Premier groupe, x=30,35,40,45x=30,35,40,45 : médiane des x=35+402=37,5x=\dfrac{35+40}{2}=37{,}5, médiane des y=760+8002=780y=\dfrac{760+800}{2}=780, donc M1=(37,5 ; 780)M_1=(37{,}5\ ;\ 780). Deuxième groupe, x=50,55,60,65x=50,55,60,65 : 55+602=57,5\dfrac{55+60}{2}=57{,}5 et 950+10102=980\dfrac{950+1010}{2}=980, donc M2=(57,5 ; 980)M_2=(57{,}5\ ;\ 980). Troisième groupe, x=70,75,80,85x=70,75,80,85 : 75+802=77,5\dfrac{75+80}{2}=77{,}5 et 1160+12202=1190\dfrac{1160+1220}{2}=1190, donc M3=(77,5 ; 1190)M_3=(77{,}5\ ;\ 1190). C'est ici que tout se joue : le loyer de 19001900 dollars est la plus grande valeur de son groupe, donc il n'entre pas dans le calcul de la médiane, qui ne retient que les deux valeurs centrales. Pente : 1190−78077,5−37,5=41040=10,25\dfrac{1190-780}{77{,}5-37{,}5}=\dfrac{410}{40}=10{,}25. Droite par M1M_1 : b13=780−10,25(37,5)=780−384,375=395,625b_{13}=780-10{,}25(37{,}5)=780-384{,}375=395{,}625. Écart vertical à M2M_2 : 10,25(57,5)+395,625=589,375+395,625=98510{,}25(57{,}5)+395{,}625=589{,}375+395{,}625=985, contre 980980 observé, donc un écart de −5-5 dont on prend le tiers, −1,667-1{,}667. Ainsi b=395,625−1,667≈393,96b=395{,}625-1{,}667\approx 393{,}96 et y≈10,25x+393,96y\approx 10{,}25x+393{,}96. Pour x=60x=60 : 615+393,96≈1009615+393{,}96\approx 1009 dollars.

c) Le loyer réel vaut 10101010 dollars. La médiane-médiane annonce 10091009, soit une erreur de 11 dollar ; Mayer annonce 10721072, soit une erreur de 6262 dollars, plus de soixante fois pire. L'explication tient en une phrase : une MOYENNE additionne les valeurs, donc le 19001900 entre en entier dans le point moyen du second groupe et tire la droite vers le haut, alors qu'une MÉDIANE ne dépend que du RANG des valeurs, et le 19001900 y compte exactement autant que si l'appartement se louait 12501250 dollars, puisqu'il reste dans les deux cas le plus cher de son groupe. C'est la propriété qui définit une méthode dite robuste. Attention à ne pas en tirer la mauvaise leçon : la médiane-médiane ne CORRIGE pas la donnée aberrante et ne la fait pas disparaître, elle refuse simplement de la laisser décider. Repérer l'aberration et se demander POURQUOI elle existe, ici une rénovation complète, reste le travail du statisticien.

d) Avec 12701270 dollars à la place de 19001900, la moyenne du second groupe devient 1010+1060+1120+1160+1220+12706=68406=1140\dfrac{1010+1060+1120+1160+1220+1270}{6}=\dfrac{6840}{6}=1140. Le premier groupe ne change pas. Pente : 1140−83030=31030≈10,333\dfrac{1140-830}{30}=\dfrac{310}{30}\approx 10{,}333, et b=830−10,333(42,5)≈390,83b=830-10{,}333(42{,}5)\approx 390{,}83, donc y≈10,33x+390,83y\approx 10{,}33x+390{,}83. Pour x=60x=60 : 620+390,83≈1011620+390{,}83\approx 1011 dollars. Voilà le résultat qui vaut la peine d'être retenu : la droite de Mayer PRIVÉE de la donnée aberrante donne 10111011 dollars, et la droite médiane-médiane calculée AVEC elle donnait 10091009 dollars. Les deux tombent à deux dollars l'une de l'autre. Autrement dit, la médiane-médiane obtient sans intervention le résultat que Mayer n'obtient qu'après qu'on a repéré et écarté l'aberration à la main. C'est la règle de choix à écrire en examen : nuage régulier, Mayer suffit et se calcule plus vite ; nuage comportant une valeur extrême, la médiane-médiane, et on le JUSTIFIE en nommant la donnée en cause.

Exercice 13 : Le tableau à double entrée, forme condensée d'un nuage

Une école a demandé à ses 120120 élèves de secondaire 4 combien d'heures par semaine ils occupent un emploi rémunéré, puis a croisé la réponse avec leur moyenne générale. Les deux caractères sont quantitatifs et ont été regroupés en classes.

Un tableau à double entrée n'est rien d'autre qu'un nuage de points où l'on aurait compté les points au lieu de les dessiner.

Heures d'emploiMoyenne [50, 65[[65, 80[[80, 95[Total
[0, 5[21026?
[5, 10[51815?
[10, 15[10164?
[15, 20[941?
Total????
  • a) Complétez les totaux marginaux et vérifiez l'effectif total par les deux sommes.
  • b) Quel pourcentage des élèves qui travaillent au moins 1515 heures ont une moyenne inférieure à 6565 ? Et quel pourcentage des élèves ayant une moyenne inférieure à 6565 travaillent au moins 1515 heures ? Pourquoi ces deux nombres diffèrent-ils ?
  • c) Décrivez le sens et l'intensité de l'association, en vous appuyant sur la position des effectifs dans le tableau.
  • d) Peut-on tracer la droite médiane-médiane à partir de ce tableau ? Dites précisément ce que le regroupement en classes a fait perdre.

Tape tes réponses, la page te dit juste ou faux 0/7

a)
b)
c)
d)
Voir la correction

Réponses

  • a) Lignes 3838, 3838, 3030, 1414 ; colonnes 2626, 4848, 4646 ; total 120120
  • b) 914≈64,3\dfrac{9}{14}\approx 64{,}3 % et 926≈34,6\dfrac{9}{26}\approx 34{,}6 %
  • c) Négative, moyenne à forte
  • d) Non : les couples individuels sont perdus, seule une approximation par centres de classes

a) Les totaux de LIGNE s'obtiennent en sommant chaque rangée : 2+10+26=382+10+26=38, 5+18+15=385+18+15=38, 10+16+4=3010+16+4=30, 9+4+1=149+4+1=14. Les totaux de COLONNE s'obtiennent en sommant chaque colonne : 2+5+10+9=262+5+10+9=26, 10+18+16+4=4810+18+16+4=48, 26+15+4+1=4626+15+4+1=46. On additionne ensuite les quatre totaux de ligne, 38+38+30+14=12038+38+30+14=120, puis les trois totaux de colonne, 26+48+46=12026+48+46=120. Les deux sommes doivent donner le MÊME nombre, et c'est le seul contrôle d'erreur dont on dispose sur un tableau à double entrée : si elles diffèrent, une case a été mal lue ou mal additionnée, et il est inutile de continuer.

b) Premier pourcentage : parmi les 1414 élèves qui travaillent au moins 1515 heures, 99 ont une moyenne inférieure à 6565, soit 914≈0,643\dfrac{9}{14}\approx 0{,}643, c'est-à-dire 64,3 %64{,}3\ \%. Second pourcentage : parmi les 2626 élèves dont la moyenne est inférieure à 6565, 99 travaillent au moins 1515 heures, soit 926≈0,346\dfrac{9}{26}\approx 0{,}346, c'est-à-dire 34,6 %34{,}6\ \%. Le NUMÉRATEUR est le même, 99 élèves, la case commune aux deux conditions ; c'est le DÉNOMINATEUR qui change, parce qu'on ne pose pas la même question. Le premier pourcentage se lit sur le total de la ligne et répond à « parmi ceux qui travaillent beaucoup, combien réussissent mal », le second se lit sur le total de la colonne et répond à « parmi ceux qui réussissent mal, combien travaillent beaucoup ». Confondre les deux est l'erreur la plus fréquente du chapitre, et elle est grave : elle fait dire au tableau l'inverse de ce qu'il dit. Retenir la règle de repérage : le mot qui suit « parmi » désigne le total à mettre au dénominateur.

c) L'association est NÉGATIVE : plus le nombre d'heures d'emploi augmente, plus la moyenne tend à baisser. On le lit sans aucun calcul, à la position des gros effectifs, qui se rangent le long de la diagonale allant du coin supérieur DROIT au coin inférieur GAUCHE. Dans la première ligne, 2626 élèves sur 3838, soit 68 %68\ \%, sont dans la classe la plus forte ; dans la dernière, 99 sur 1414, soit 64 %64\ \%, sont dans la plus faible, et un seul atteint 8080. L'intensité est MOYENNE à FORTE, et il faut dire pourquoi elle n'est pas parfaite : aucune case n'est vide, il reste 44 élèves qui travaillent 1010 à 1515 heures avec une moyenne d'au moins 8080, et 22 qui ne travaillent pas du tout et restent sous 6565. La tendance est nette, elle n'est pas une loi.

d) Non, pas exactement. La droite médiane-médiane, comme la droite de Mayer et comme le coefficient de corrélation, exige les COUPLES individuels (xi ; yi)(x_i\ ;\ y_i), et le tableau ne les contient plus : on sait que 1818 élèves travaillent entre 55 et 1010 heures avec une moyenne entre 6565 et 8080, mais on ignore lesquels et on ignore leurs valeurs exactes. Le regroupement en classes a converti chaque point du nuage en un jeton déposé dans une case, et l'opération ne se renverse pas. Ce qu'on peut faire, et qui est souvent demandé, c'est REMPLACER chaque classe par son centre, 2,52{,}5, 7,57{,}5, 12,512{,}5, 17,517{,}5 pour les heures et 57,557{,}5, 72,572{,}5, 87,587{,}5 pour les moyennes, puis traiter les 120120 jetons comme s'ils étaient placés au centre de leur case. Le résultat est une APPROXIMATION, et il faut le dire dans la réponse : la droite obtenue n'est pas celle qu'on aurait calculée sur les données brutes. La leçon du chapitre s'applique une fois de plus : le tableau à double entrée gagne en lisibilité ce qu'il perd en précision, et le choix entre les deux formes dépend de la question posée, pas d'une préférence.

Exercice 14 : Situation d'application : le budget de déneigement

Une municipalité doit déposer son budget de déneigement. Elle dispose de treize années de relevés : la neige totale tombée xx, en centimètres, et le coût du déneigement yy, en milliers de dollars. La septième année, une tempête de verglas a imposé un déblaiement d'urgence.

Les météorologues annoncent 260260 centimètres pour l'hiver qui vient. Le conseil vous demande le montant à inscrire au budget, le modèle qui le justifie, et la limite de validité de votre prévision. Rédigez une solution complète : c'est le raisonnement écrit qui est évalué, pas seulement le nombre final.

Neige (cm)180195205215230240250260275285295305330
Coût (milliers)410430450470495510700555575600620660690
150200250300350400450500550600650700750neige (cm)coût (milliers)
Voir la correction

Réponses

  • 1) Médiane-médiane, 44-55-44 : M1=(200 ;440)M_1=(200\,;440), M2=(250 ;555)M_2=(250\,;555), M3=(300 ;640)M_3=(300\,;640)
  • 2) y=2x+45y=2x+45
  • 3) 565 000565\ 000 dollars à 260260 cm, plus une réserve pour événement exceptionnel

Étape 1, choisir la méthode et le DIRE. Le nuage monte régulièrement, sauf un point isolé très au-dessus des autres : 700700 milliers de dollars pour 250250 centimètres, alors que l'année suivante coûte 555555 pour 260260 centimètres, soit davantage de neige pour moins cher. C'est l'année du verglas, et c'est une donnée aberrante dont on connaît la cause. On écarte donc la droite de Mayer, dont les points moyens intégreraient ce 700700 en entier, et on retient la droite MÉDIANE-MÉDIANE, qui ne dépend que du rang des valeurs. On ne SUPPRIME pas la donnée : la supprimer reviendrait à décider que le verglas n'existe pas, alors qu'il peut revenir.

Étape 2, former les trois groupes. Il y a 1313 données et 13=3×4+113=3\times 4+1 : il reste UNE donnée, et c'est le groupe du MILIEU qui la prend, d'où la répartition 4−5−44-5-4. On retient les deux cas ensemble : quand il reste une donnée elle va au centre, quand il en reste deux elles vont aux extrêmes, et dans les deux cas les groupes extrêmes restent de même taille, ce qui est la vraie exigence de la méthode. Premier groupe : x=180,195,205,215x=180,195,205,215. Deuxième : x=230,240,250,260,275x=230,240,250,260,275. Troisième : x=285,295,305,330x=285,295,305,330.

Étape 3, les trois points médians. Premier groupe : médiane des xx =195+2052=200=\dfrac{195+205}{2}=200, médiane des y=430+4502=440y=\dfrac{430+450}{2}=440, donc M1=(200 ; 440)M_1=(200\ ;\ 440). Deuxième groupe, cinq données : la médiane des xx est 250250 ; pour les yy, il faut les ORDONNER avant de prendre la valeur centrale. Les cinq valeurs relevées sont 495495, 510510, 700700, 555555 et 575575, qu'on range en 495495, 510510, 555555, 575575, 700700, dont la valeur centrale vaut 555555. Donc M2=(250 ; 555)M_2=(250\ ;\ 555). C'est le cœur de la méthode : le 700700 se retrouve à l'extrémité de la liste ordonnée et n'influence pas plus la médiane qu'un 600600 ne l'aurait fait. Troisième groupe : 295+3052=300\dfrac{295+305}{2}=300 et 620+6602=640\dfrac{620+660}{2}=640, donc M3=(300 ; 640)M_3=(300\ ;\ 640).

Étape 4, la droite. Pente sur M1M_1 et M3M_3 : a=640−440300−200=200100=2a=\dfrac{640-440}{300-200}=\dfrac{200}{100}=2. Droite provisoire : b=440−2(200)=40b=440-2(200)=40, soit y=2x+40y=2x+40. En x=250x=250 elle donne 540540, alors que M2M_2 est à 555555 : l'écart vaut 1515, on en prend le tiers, 55, et l'ordonnée devient b=40+5=45b=40+5=45. La droite médiane-médiane est donc y=2x+45y=2x+45. Contrôle par le point moyen des médianes : (200+250+3003 ; 440+555+6403)=(250 ; 545)\left(\dfrac{200+250+300}{3}\ ;\ \dfrac{440+555+640}{3}\right)=(250\ ;\ 545), et 2(250)+45=5452(250)+45=545 ✓.

Étape 5, la réponse et sa limite. Pour 260260 centimètres : y=2(260)+45=520+45=565y=2(260)+45=520+45=565, soit un budget de 565 000565\,000 dollars. La pente s'interprète et cette phrase rapporte des points : chaque centimètre de neige supplémentaire coûte environ 20002000 dollars à la municipalité. La prévision est une INTERPOLATION, puisque 260260 appartient à l'intervalle observé [180 ; 330][180\ ;\ 330], et elle est donc fiable ; le coût réellement observé à 260260 centimètres fut de 555555 milliers, ce qui confirme le modèle à 1010 milliers près. Deux réserves à écrire pour que la solution soit complète. D'abord, le modèle ne vaut plus au-delà de 330330 centimètres : à 400400 centimètres il annoncerait 845845 milliers, alors que rien ne garantit que le coût reste linéaire quand il faut louer de l'équipement supplémentaire et transporter la neige plus loin. Ensuite, le modèle décrit une année ORDINAIRE : il n'intègre pas le risque de verglas, précisément parce qu'on a choisi une méthode qui neutralise cette année-là. La recommandation complète est donc 565 000565\,000 dollars au budget régulier, ASSORTIS d'une réserve pour événement exceptionnel, dont l'ordre de grandeur se lit sur la donnée aberrante elle-même : 700−510≈190700-510\approx 190 milliers de dollars de dépassement cette année-là.

Partie D : les classiques (/50)

Exercice 15 : Quatre tableaux, quatre corrélations

Chaque ligne du tableau donne les valeurs de yy d'une série à deux variables, pour les mêmes valeurs de xx, de 11 à 66. On ne trace rien et on ne calcule aucun coefficient : on LIT le tableau.

Pour chaque série, décrivez le sens et l'intensité de la corrélation, et choisissez le coefficient le plus plausible parmi 0,990{,}99, 0,750{,}75, 00 et −0,75-0{,}75.

x123456
y (a)2458912
y (b)201518121611
y (c)592837
y (d)25911925
  • a) Série (a).
  • b) Série (b).
  • c) Série (c).
  • d) Série (d).
  • e) Pour la série (d), le coefficient de corrélation vaut exactement 00. Peut-on en conclure que yy ne dépend pas de xx ?

Tape tes réponses, la page te dit juste ou faux 0/8

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) Positive, forte : 0,990{,}99
  • b) Négative, moyenne à forte : −0,75-0{,}75
  • c) Nulle : 00
  • d) Nuage en U : 00
  • e) Non : y=(2x−7)2y=(2x-7)^2, relation parfaite mais non linéaire

a) Les valeurs 22, 44, 55, 88, 99, 1212 montent à chaque pas, par sauts de 11 à 33 : la corrélation est POSITIVE et FORTE, le nuage est presque aligné. Coefficient plausible : 0,990{,}99.

b) Les valeurs 2020, 1515, 1818, 1212, 1616, 1111 baissent globalement de 2020 à 1111, mais en dents de scie : deux remontées sur cinq pas. La corrélation est NÉGATIVE et MOYENNE à FORTE, le nuage descend mais reste épais. Coefficient plausible : −0,75-0{,}75. Le signe se lit sur la tendance d'ensemble, pas sur chaque pas.

c) Les valeurs 55, 99, 22, 88, 33, 77 montent et descendent sans tendance : le début et la fin du tableau sont au même niveau, et les grandes et petites valeurs alternent. La corrélation est NULLE, ou très faible. Coefficient plausible : 00 (le calcul exact donne environ −0,04-0{,}04).

d) Les valeurs 2525, 99, 11, 11, 99, 2525 descendent puis remontent symétriquement : le nuage dessine un U. Il n'y a ni tendance croissante ni tendance décroissante, donc la corrélation LINÉAIRE est nulle. Coefficient : 00.

e) Non. Les valeurs de (d) sont exactement (2x−7)2(2x-7)^2 : yy dépend PARFAITEMENT de xx, par une relation du second degré. Le coefficient de corrélation ne mesure que l'alignement sur une DROITE ; une relation courbe symétrique donne un coefficient nul. Un coefficient proche de 00 signifie « pas de relation linéaire », jamais « pas de relation ». C'est pourquoi on regarde toujours le nuage avant de conclure, comme à l'exercice 8.

Exercice 16 : Construire un tableau à double entrée

Un garagiste relève l'âge, en années, et le kilométrage, en milliers de kilomètres, de quinze voitures d'occasion. Les couples (âge ; kilométrage) sont : (1 ;25)(1\,;25), (2 ;40)(2\,;40), (3 ;90)(3\,;90), (2 ;30)(2\,;30), (5 ;70)(5\,;70), (6 ;110)(6\,;110), (5 ;95)(5\,;95), (7 ;150)(7\,;150), (4 ;85)(4\,;85), (9 ;170)(9\,;170), (10 ;140)(10\,;140), (11 ;210)(11\,;210), (8 ;180)(8\,;180), (3 ;55)(3\,;55) et (9 ;120)(9\,;120).

On regroupe l'âge en classes [0 ;4[[0\,;4[, [4 ;8[[4\,;8[, [8 ;12[[8\,;12[ et le kilométrage en classes [0 ;80[[0\,;80[, [80 ;160[[80\,;160[, [160 ;240[[160\,;240[. Chaque classe contient sa borne de gauche et exclut celle de droite.

Âge (ans)[0 ; 80[[80 ; 160[[160 ; 240[Total
[0 ; 4[????
[4 ; 8[????
[8 ; 12[????
Total????
  • a) Construisez le tableau à double entrée des effectifs, l'âge en lignes et le kilométrage en colonnes.
  • b) Complétez les totaux de lignes et de colonnes, et vérifiez l'effectif total.
  • c) Quel pourcentage des voitures de 8 ans ou plus ont au moins 160 000 km ? Quel pourcentage des voitures d'au moins 160 000 km ont 8 ans ou plus ?
  • d) Décrivez le sens et l'intensité de l'association entre l'âge et le kilométrage.

Tape tes réponses, la page te dit juste ou faux 0/10

a)
b)
c)
d)
Voir la correction

Réponses

  • a) Lignes : 44, 11, 00 ; 11, 44, 00 ; 00, 22, 33
  • b) Lignes 55, 55, 55 ; colonnes 55, 77, 33 ; total 1515
  • c) 6060 % et 100100 %
  • d) Positive et forte

a) On place chaque couple dans sa case, en surveillant les bornes. Âge [0 ;4[[0\,;4[ : (1 ;25)(1\,;25), (2 ;40)(2\,;40), (2 ;30)(2\,;30) et (3 ;55)(3\,;55) vont dans [0 ;80[[0\,;80[, et (3 ;90)(3\,;90) dans [80 ;160[[80\,;160[, d'où la ligne 44, 11, 00. Âge [4 ;8[[4\,;8[ : (5 ;70)(5\,;70) va dans [0 ;80[[0\,;80[, et (6 ;110)(6\,;110), (5 ;95)(5\,;95), (7 ;150)(7\,;150) et (4 ;85)(4\,;85) dans [80 ;160[[80\,;160[, d'où 11, 44, 00. La voiture de 44 ans appartient à [4 ;8[[4\,;8[ : la borne de gauche est incluse. Âge [8 ;12[[8\,;12[ : (10 ;140)(10\,;140) et (9 ;120)(9\,;120) vont dans [80 ;160[[80\,;160[, et (9 ;170)(9\,;170), (11 ;210)(11\,;210) et (8 ;180)(8\,;180) dans [160 ;240[[160\,;240[, d'où 00, 22, 33.

b) Totaux de lignes : 4+1+0=54+1+0=5, 1+4+0=51+4+0=5, 0+2+3=50+2+3=5. Totaux de colonnes : 4+1+0=54+1+0=5, 1+4+2=71+4+2=7, 0+0+3=30+0+3=3. Les deux sommes donnent 1515 : 5+5+5=155+5+5=15 et 5+7+3=155+7+3=15 ✓, chaque voiture a été placée une fois et une seule.

c) Parmi les 55 voitures de 88 ans ou plus, 33 ont au moins 160 000160\ 000 km : 35=60\dfrac{3}{5}=60 %. Parmi les 33 voitures d'au moins 160 000160\ 000 km, les 33 ont 88 ans ou plus : 33=100\dfrac{3}{3}=100 %. Même numérateur, dénominateurs différents : le mot qui suit « parmi » désigne le total de ligne ou de colonne à utiliser.

d) L'association est POSITIVE : les effectifs se rangent le long de la diagonale qui va du coin supérieur gauche (jeunes voitures, faible kilométrage) au coin inférieur droit (vieilles voitures, fort kilométrage), et les deux coins opposés sont vides. Elle est FORTE, sans être parfaite : 11 voiture de 44 à 88 ans roule encore peu, et 22 voitures de 88 ans ou plus restent sous 160 000160\ 000 km. Plus une voiture est âgée, plus elle a tendance à avoir roulé, ce qui est attendu.

Exercice 17 : Lire une règle de régression donnée par la calculatrice

Pour 4040 adultes dont la taille va de 150150 cm à 195195 cm, une calculatrice donne la droite de régression de la pointure européenne yy en fonction de la taille xx, en centimètres : y=0,25x−3y=0{,}25x-3, avec un coefficient de corrélation r≈0,82r\approx 0{,}82.

  • a) Interprétez la pente, avec ses unités. De combien la pointure prévue augmente-t-elle pour 20 cm de plus ?
  • b) Que prévoit le modèle pour une taille de 0 cm ? Cette valeur a-t-elle un sens ?
  • c) Quelle pointure le modèle prévoit-il pour une personne de 172 cm ?
  • d) Quelle taille le modèle associe-t-il à une pointure de 44 ? S'agit-il d'une interpolation ?
  • e) Un ami affirme : « r=0,82r=0{,}82, donc 82 % des gens suivent la droite. » Corrigez cette phrase.

Tape tes réponses, la page te dit juste ou faux 0/8

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) 0,250{,}25 pointure par cm ; +5+5 pointures pour 2020 cm
  • b) −3-3 : aucun sens, hors domaine
  • c) Pointure 4040
  • d) 188188 cm : interpolation
  • e) rr mesure l'intensité de la liaison linéaire, pas un pourcentage

a) La pente vaut 0,250{,}25 pointure par centimètre : chaque centimètre de taille supplémentaire est associé, en moyenne, à un quart de pointure de plus, soit une pointure pour 44 cm. Pour 2020 cm de plus : 20×0,25=520\times 0{,}25=5 pointures. On dit « est associé à », parce que la droite décrit une tendance sur ces 4040 adultes, pas une loi individuelle.

b) y=0,25×0−3=−3y=0{,}25\times 0-3=-3. Cette valeur n'a AUCUN sens : une pointure négative n'existe pas, et surtout x=0x=0 est très loin de l'intervalle observé [150 ;195][150\,;195]. L'ordonnée à l'origine sert à écrire la règle ; elle ne s'interprète que si x=0x=0 fait partie des données, ce qui n'est pas le cas ici, contrairement à l'exercice 5.

c) y=0,25×172−3=43−3=40y=0{,}25\times 172-3=43-3=40. Le modèle prévoit une pointure 4040. C'est une interpolation, 172172 étant dans [150 ;195][150\,;195].

d) On résout 0,25x−3=440{,}25x-3=44 : 0,25x=470{,}25x=47, donc x=188x=188 cm. Comme 188188 appartient à [150 ;195][150\,;195], c'est une INTERPOLATION, et l'estimation est raisonnable. On utilise ici la droite « à l'envers », pour retrouver xx à partir de yy, ce qui est permis tant qu'on reste dans le domaine observé.

e) La phrase est fausse. Le coefficient rr n'est pas un pourcentage de personnes : il mesure l'INTENSITÉ de la liaison linéaire entre les deux variables, sur une échelle de −1-1 à 11. Avec 0,820{,}82, la liaison est forte et positive : les points forment un nuage allongé autour de la droite, mais presque aucun n'est exactement dessus. Formulation correcte : « la taille et la pointure sont fortement corrélées positivement ».

Exercice 18 : Problème : les records du 100 mètres

Le tableau donne l'année de quelques records du monde masculins du 100 mètres et le temps réalisé, en secondes (valeurs arrondies, chronométrage manuel pour les deux premières). On note xx le nombre d'années écoulées depuis 1900 et yy le temps.

Année19121936196819831991199920052009
Temps (s)10,610,29,959,939,869,799,779,58
  • a) Décrivez le sens et l'intensité de la corrélation.
  • b) Déterminez la droite de Mayer. Donnez la pente à quatre décimales et l'ordonnée à l'origine au centième.
  • c) Interprétez la pente, en secondes par décennie.
  • d) Quel record le modèle prévoit-il pour l'année 2030 ?
  • e) En quelle année le modèle prévoit-il un record de 9 secondes ? Et un temps de 0 seconde ? Commentez.

Tape tes réponses, la page te dit juste ou faux 0/8

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) Négative et forte (r≈−0,97r\approx -0{,}97)
  • b) y≈−0,0082x+10,58y\approx -0{,}0082x+10{,}58
  • c) ≈−0,082\approx -0{,}082 s par décennie
  • d) ≈9,51\approx 9{,}51 s
  • e) 99 s vers 20922092 ; 00 s vers 31913191 : extrapolation absurde

a) Les temps diminuent à chaque nouveau record, et de façon assez régulière dans le temps : la corrélation est NÉGATIVE et FORTE. Le coefficient vaut environ −0,97-0{,}97. La régularité n'est pas parfaite : les records progressent par à-coups, et le 9,589{,}58 de 2009 est un saut exceptionnel.

b) Avec xx : 1212, 3636, 6868, 8383, 9191, 9999, 105105 et 109109. Premier groupe, les quatre premiers : moyenne des xx =1994=49,75=\dfrac{199}{4}=49{,}75, moyenne des y=10,6+10,2+9,95+9,934=40,684=10,17y=\dfrac{10{,}6+10{,}2+9{,}95+9{,}93}{4}=\dfrac{40{,}68}{4}=10{,}17, donc P1=(49,75 ;10,17)P_1=(49{,}75\,;10{,}17). Second groupe : moyenne des xx =4044=101=\dfrac{404}{4}=101, moyenne des y=9,86+9,79+9,77+9,584=394=9,75y=\dfrac{9{,}86+9{,}79+9{,}77+9{,}58}{4}=\dfrac{39}{4}=9{,}75, donc P2=(101 ;9,75)P_2=(101\,;9{,}75). Pente : 9,75−10,17101−49,75=−0,4251,25≈−0,0082\dfrac{9{,}75-10{,}17}{101-49{,}75}=\dfrac{-0{,}42}{51{,}25}\approx -0{,}0082. Ordonnée : b=10,17+0,0081951×49,75≈10,58b=10{,}17+0{,}0081951\times 49{,}75\approx 10{,}58. Droite : y≈−0,0082x+10,58y\approx -0{,}0082x+10{,}58. On garde la pente complète dans les calculs suivants, l'arrondi à quatre décimales suffisant à fausser le centième.

c) La pente vaut environ −0,0082-0{,}0082 seconde par année, soit −0,082-0{,}082 seconde par décennie : sur la période observée, le record a baissé en moyenne d'un peu moins d'un dixième de seconde tous les dix ans.

d) L'année 2030 correspond à x=130x=130 : y≈10,5777−0,0081951×130≈10,5777−1,0654≈9,51y\approx 10{,}5777-0{,}0081951\times 130\approx 10{,}5777-1{,}0654\approx 9{,}51 secondes. C'est une EXTRAPOLATION, modérée : 130130 dépasse de 2121 ans la dernière donnée.

e) Pour 99 secondes : 10,5777−0,0081951x=910{,}5777-0{,}0081951x=9, donc x=1,57770,0081951≈192,5x=\dfrac{1{,}5777}{0{,}0081951}\approx 192{,}5, soit vers l'année 20922092 ou 20932093. Pour 00 seconde : x=10,57770,0081951≈1 290,7x=\dfrac{10{,}5777}{0{,}0081951}\approx 1\ 290{,}7, soit vers l'an 31913191. Ce dernier résultat est ABSURDE : aucun être humain ne courra 100100 mètres en zéro seconde. Le modèle linéaire suppose que le record baisse indéfiniment au même rythme, alors que les performances humaines ont une limite physiologique et que les gains se font de plus en plus petits. Une droite ne vaut que sur la période où elle a été construite ; même la prévision de 99 secondes, à près d'un siècle de la dernière donnée, n'a guère de valeur.

Exercice 19 : Problème : la température et le chant des grillons

Les grillons stridulent plus vite quand il fait chaud. Un naturaliste relève, sur huit soirées, le nombre de stridulations par minute d'un grillon et la température de l'air, en degrés Celsius.

Il veut s'en servir comme d'un thermomètre : estimer la température en comptant les stridulations.

Stridulations par minute80100120140160180200220
Température (°C)1518202326283133
  • a) Laquelle des deux variables influence l'autre ? Laquelle le naturaliste doit-il pourtant placer en abscisse pour son usage ?
  • b) Déterminez la droite de Mayer donnant la température en fonction du nombre de stridulations.
  • c) Interprétez la pente : de combien la température estimée augmente-t-elle pour 10 stridulations de plus ? Combien de stridulations de plus correspondent à 1 degré ?
  • d) Estimez la température un soir où le grillon stridule 150 fois par minute.
  • e) Que prévoit le modèle pour un grillon silencieux ? Et combien de stridulations annonce-t-il à 40 °C ? Commentez.

Tape tes réponses, la page te dit juste ou faux 0/9

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) La température influence le chant ; les stridulations en abscisse pour prédire
  • b) y=0,13125x+4,5625y=0{,}13125x+4{,}5625
  • c) ≈1,31\approx 1{,}31 °C pour 1010 stridulations ; ≈7,62\approx 7{,}62 stridulations par degré
  • d) 24,2524{,}25 °C
  • e) ≈4,56\approx 4{,}56 °C et 270270 stridulations : extrapolations sans valeur

a) C'est la TEMPÉRATURE qui influence le chant : un grillon, animal à sang froid, s'active quand il fait chaud, et non l'inverse. Mais le naturaliste veut PRÉDIRE la température à partir de ce qu'il mesure, les stridulations. Il place donc les stridulations en abscisse et la température en ordonnée. Le choix de la variable en abscisse dépend de la question posée ; il ne dit rien du sens de la causalité.

b) Premier groupe, 8080 à 140140 stridulations : moyenne des xx =4404=110=\dfrac{440}{4}=110, moyenne des y=15+18+20+234=764=19y=\dfrac{15+18+20+23}{4}=\dfrac{76}{4}=19, donc P1=(110 ;19)P_1=(110\,;19). Second groupe, 160160 à 220220 : 7604=190\dfrac{760}{4}=190 et 26+28+31+334=1184=29,5\dfrac{26+28+31+33}{4}=\dfrac{118}{4}=29{,}5, donc P2=(190 ;29,5)P_2=(190\,;29{,}5). Pente : 29,5−19190−110=10,580=0,13125\dfrac{29{,}5-19}{190-110}=\dfrac{10{,}5}{80}=0{,}13125. Ordonnée : b=19−0,13125×110=19−14,4375=4,5625b=19-0{,}13125\times 110=19-14{,}4375=4{,}5625. Droite : y=0,13125x+4,5625y=0{,}13125x+4{,}5625. Contrôle avec P2P_2 : 0,13125×190+4,5625=24,9375+4,5625=29,50{,}13125\times 190+4{,}5625=24{,}9375+4{,}5625=29{,}5 ✓.

c) Chaque stridulation par minute de plus est associée à 0,131250{,}13125 °C de plus, donc 1010 stridulations à environ 1,311{,}31 °C. À l'inverse, 11 °C correspond à 10,13125≈7,62\dfrac{1}{0{,}13125}\approx 7{,}62 stridulations par minute de plus.

d) y=0,13125×150+4,5625=19,6875+4,5625=24,25y=0{,}13125\times 150+4{,}5625=19{,}6875+4{,}5625=24{,}25 °C. C'est une interpolation, 150150 appartenant à [80 ;220][80\,;220] : l'estimation est fiable.

e) Pour x=0x=0 : le modèle annonce 4,564{,}56 °C. Cette valeur n'a pas de sens : un grillon cesse de chanter bien avant, par temps frais, et un grillon silencieux peut aussi bien dormir par 2525 °C. Pour 4040 °C : 0,13125x+4,5625=400{,}13125x+4{,}5625=40 donne x=35,43750,13125=270x=\dfrac{35{,}4375}{0{,}13125}=270 stridulations par minute, loin au-delà des 220220 observées : c'est une extrapolation, et rien ne garantit qu'un grillon puisse accélérer ainsi, ni même qu'il survive à cette chaleur. Le thermomètre à grillon ne fonctionne que dans la plage de températures où il a été étalonné.

Chapitre précédent La géométrie analytique : droites et distances

Ce chapitre resservira dans

Les chapitres qui le réclament en amont, plus tard dans l'année ou dans les années suivantes.

© Ahmed Squalli Houssaini. Série publiée sur www.letuteurscientifique.ca/exercices/sn4-statistique-correlation. Libre pour l'usage personnel et en classe ; sa republication ailleurs demande une autorisation écrite (mentions légales).

Voir aussi

Vous cherchez un tuteur en math SN4 à Montréal ?

Contactez-moi pour une première séance. On travaille sur des exercices du niveau réel des évaluations de secondaire 4, jusqu'à l'épreuve du Ministère.

Site par Studio Squalli