Statistiques avancées 201-337 • Complément québécois et cégep à Montréal

Fiche de révision : corrélation et régression linéaire (201-337)

La régression est le chapitre où la calculatrice donne toujours une réponse, y compris quand la question n'a pas de sens. Elle ajuste une droite à un nuage courbé, elle calcule un coefficient sur onze points dont un seul décide de tout, et elle ne signale rien.

Cette fiche rassemble ce que la machine ne fait pas : regarder le nuage avant, lire les résidus après, refuser d'extrapoler, et distinguer une association d'une cause. Ce sont exactement les questions notées à l'examen.

Le fil du chapitre

Un coefficient de corrélation ne se lit jamais seul : il faut le nuage AVANT de le calculer, les résidus APRÈS l'avoir calculé, et la question de la causalité reste entière dans tous les cas.

Ce chapitre fait partie de Statistiques avancées, 201-337

Avant ce chapitre

Cette fiche suppose ces notions acquises. Si une méthode ci-dessous reste opaque, c'est presque toujours l'une d'elles qui manque, pas la fiche.

Remonter plus loin : la chaîne complète (4 chapitres) ↓

Le chemin de remédiation, du plus ancien au plus proche. Un élève qui reprend ce chapitre de zéro le reprend dans cet ordre.

  1. 1Nuage de points, corrélation et régressionSecondaire 4 SN4
  2. 2Les statistiques descriptives
  3. 3Probabilités et lois de distribution
  4. 4Estimation et tests d'hypothèse

L'essentiel

Le nuage d'abord, le calcul ensuite

  • On regarde toujours la FORME du nuage avant de calculer : linéarité, courbure, valeurs isolées, dispersion constante ou non.
  • Un coefficient calculé sur un nuage non linéaire n'a aucune signification, même s'il est élevé.
  • Deux nuages de formes complètement différentes peuvent donner exactement le même rr et la même droite.
nuage vraiment linéairenuage courbér = 0,82r = 0,82
Deux nuages de même coefficient r=0,82r=0{,}82 et de même droite : à gauche la relation est linéaire, à droite elle est nettement courbée et le modèle ne convient pas.

Cette règle est la seule du chapitre qui ne se contourne pas : la calculatrice renvoie un nombre dans tous les cas, y compris là où la régression linéaire est hors de propos.

Les sommes de travail et la droite

  • Sxy=xy(x)(y)nS_{xy}=\sum xy-\dfrac{(\sum x)(\sum y)}{n}, Sxx=x2(x)2nS_{xx}=\sum x^{2}-\dfrac{(\sum x)^{2}}{n}, Syy=y2(y)2nS_{yy}=\sum y^{2}-\dfrac{(\sum y)^{2}}{n}.
  • r=SxySxxSyyr=\dfrac{S_{xy}}{\sqrt{S_{xx}S_{yy}}}, toujours entre 1-1 et 11 : le SIGNE donne le sens, la VALEUR ABSOLUE la force.
  • Droite des moindres carrés y=a+bxy=a+bx : b=SxySxxb=\dfrac{S_{xy}}{S_{xx}} puis a=ybxa=\overline{y}-b\overline{x}.
  • Elle passe TOUJOURS par le point moyen (x;y)(\overline{x}\,;\,\overline{y}), ce qui donne un contrôle gratuit.

« Moindres carrés » désigne la somme des carrés des écarts VERTICAUX. C'est pour cela que la droite de yy sur xx n'est pas celle de xx sur yy : les écarts minimisés ne sont pas les mêmes.

r, r au carré, et ce que chacun mesure

  • r2r^{2} est la proportion de la variation de yy expliquée par la relation linéaire avec xx, exprimée en pourcentage.
  • r=0,80r=0{,}80 donne r2=0,64r^{2}=0{,}64 : 64%64\,\% de la variation expliquée, pas 80%80\,\%.
  • Résidus ei=yiyi^e_{i}=y_{i}-\hat{y_{i}} : leur somme est nulle par construction, donc elle ne prouve rien. C'est leur GRAPHIQUE qui informe.
  • Erreur type de l'estimation : se=ei2n2s_{e}=\sqrt{\dfrac{\sum e_{i}^{2}}{n-2}}, avec ei2=Syy(1r2)\sum e_{i}^{2}=S_{yy}(1-r^{2}).

La significativité de rr se teste par t=rn21r2t=\dfrac{r\sqrt{n-2}}{\sqrt{1-r^{2}}} à n2n-2 degrés de liberté. Un même r=0,50r=0{,}50 n'est pas significatif sur 1010 individus et l'est sur 3030.

Les quatre explications d'une corrélation

  • xx cause yy ; ou yy cause xx ; ou une troisième variable CONFONDANTE cause les deux ; ou c'est le hasard sur un petit échantillon.
  • Aucune de ces quatre n'est écartée par le calcul : seule une expérience avec répartition au hasard permet de conclure à une cause.
  • EXTRAPOLER, c'est-à-dire prédire hors de l'intervalle des xx observés, n'est jamais justifié par le modèle.

La question de causalité vaut souvent autant de points que toute la régression. Nommer une variable confondante plausible et concrète rapporte davantage qu'une phrase générale sur la prudence.

Les pièges qui coûtent des points

Les erreurs ci-dessous sont celles que je corrige le plus souvent en séance. Chacune coûte des points sur une copie, même quand le raisonnement est juste.

1. Calculer un coefficient sans avoir regardé le nuage

3 points, toute la question repose sur ce diagnostic

Ce qu'il ne faut pas écrire

« r=0,82r=0{,}82, donc la relation entre les deux variables est forte et linéaire. »

Ce qu'il faut écrire

« Le nuage est nettement courbé : le coefficient 0,820{,}82 ne décrit pas la relation, il faut linéariser ou changer de modèle. »

Pourquoi : Le coefficient mesure l'alignement, pas l'existence d'une relation. Une parabole parfaite peut donner rr nul alors que la liaison est totale.

2. Lire r comme un pourcentage

1,5 point, à chaque interprétation demandée

Ce qu'il ne faut pas écrire

« r=0,80r=0{,}80, donc 80%80\,\% de la variation de yy est expliquée par xx. »

Ce qu'il faut écrire

« C'est r2=0,64r^{2}=0{,}64 qui s'interprète en pourcentage : 64%64\,\% de la variation de yy est expliquée. »

Pourquoi : Seul le carré du coefficient a une lecture en proportion de variance. L'écart est d'autant plus grand que rr est moyen : 0,50{,}5 n'explique que 25%25\,\%.

3. Prédire hors de la plage observée

1,5 point, et c'est souvent la dernière question du problème

Ce qu'il ne faut pas écrire

« La droite donne y^=2x\hat{y}=2x, donc pour x=50x=50 on prévoit 100100. »

Ce qu'il faut écrire

« Les xx observés vont de 11 à 66 : au-delà, le modèle n'a rien à dire, et la prédiction n'est pas justifiée. »

Pourquoi : Rien ne garantit que la relation se prolonge : les droites d'ajustement décrivent un domaine, elles ne prédisent pas le monde. Une croissance linéaire finit toujours par buter sur une limite physique.

4. Tirer une cause d'une corrélation

2 points, et c'est la question la mieux notée du chapitre

Ce qu'il ne faut pas écrire

« Les ventes de crème glacée et les noyades sont corrélées, donc la crème glacée favorise les noyades. »

Ce qu'il faut écrire

« Une troisième variable, la température, explique les deux : c'est une variable confondante, et la corrélation n'établit aucune cause. »

Pourquoi : Quatre explications restent possibles après le calcul, et la régression ne les départage pas. Seule une expérience avec répartition au hasard le pourrait.

5. Supprimer le point qui dérange

2 points de méthode, et la copie perd toute crédibilité

Ce qu'il ne faut pas écrire

« Ce point fait chuter r2r^{2} de 0,990{,}99 à 0,650{,}65 : je le retire et je recalcule. »

Ce qu'il faut écrire

« J'enquête sur son origine, puis je publie l'analyse AVEC et SANS ce point, en signalant l'écart. »

trait plein : sans le point de levierpointillé : avec, la pente s'effondrele point de levier
Les huit points alignés donnent une pente proche de 11 ; le seul point éloigné en xx la fait chuter de moitié, sans que le nuage central ait changé.

Pourquoi : Un point éloigné en xx, dit de levier, peut diviser la pente par deux en laissant rr élevé. Il peut être une erreur de saisie comme l'observation la plus informative du jeu de données.

6. Échanger les rôles de x et de y

1,5 point, et une prédiction fausse dans le sens inverse

Ce qu'il ne faut pas écrire

« La droite de yy sur xx est y=2xy=2x, donc celle de xx sur yy est x=y2x=\dfrac{y}{2}. »

Ce qu'il faut écrire

« Ce sont deux régressions différentes : la première minimise les écarts verticaux, la seconde les écarts horizontaux, et leurs pentes ne sont inverses que si r2=1r^{2}=1. »

Pourquoi : La variable expliquée est celle dont on minimise les écarts. Choisir laquelle est en xx n'est donc pas une convention d'écriture, c'est une décision de modèle.

7. Se fier au coefficient sans regarder les résidus

2 points, et le modèle proposé est le mauvais

Ce qu'il ne faut pas écrire

« r2=0,92r^{2}=0{,}92, donc le modèle linéaire est bon. »

Ce qu'il faut écrire

« Le graphique des résidus dessine une courbe nette : la relation n'est pas linéaire, malgré un r2r^{2} élevé. »

résidus contre x : une courbe nettele modèle linéaire n'est pas le bon, malgré un r élevé
Les résidus dessinent une parabole au lieu d'un nuage sans forme : le modèle linéaire rate systématiquement les extrémités et le centre, en sens contraires.

Pourquoi : Un nuage de résidus doit être sans structure. Une courbure signale une relation non linéaire, un entonnoir une dispersion qui change avec xx : deux défauts qu'aucun coefficient ne révèle.

8. Oublier que la droite passe par le point moyen

2 points quand l'erreur passe, zéro quand le contrôle est fait

Ce qu'il ne faut pas écrire

« b=2b=2 et a=1,5a=1{,}5, je passe à la question suivante. »

Ce qu'il faut écrire

« Contrôle : y^(x)=a+bx\hat{y}(\overline{x})=a+b\overline{x} doit valoir y\overline{y}. Ici 1,5+2×3,5=8,571{,}5+2\times 3{,}5=8{,}5\neq 7, donc aa est faux. »

Pourquoi : L'ordonnée à l'origine se déduit du point moyen : le contrôle est donc exactement l'opération inverse de son calcul, et il attrape toutes les erreurs de signe.

9. Confondre la force d'une relation et la solidité de la preuve

2 points sur la question de test

Ce qu'il ne faut pas écrire

« r=0,50r=0{,}50 sur 1010 individus : la relation est significative, elle est moyenne. »

Ce qu'il faut écrire

« Sur 1010 individus, t=0,5080,751,63t=\dfrac{0{,}50\sqrt{8}}{\sqrt{0{,}75}}\approx 1{,}63 : non significatif. Sur 3030, le même rr le devient. »

Pourquoi : La significativité dépend de nn autant que de rr. Elle dit si la relation est établie, jamais si elle est forte, et encore moins si elle est utile.

Quelle méthode choisir

Que faire selon l'allure du nuage

On décrit le nuage en une phrase avant de toucher à la calculatrice.

  • Si les points s'alignent sans structure résiduelle régression linéaire ordinaire, puis rr, r2r^{2} et les résidus

    Exemple : y^=2x\hat{y}=2x avec r2=0,95r^{2}=0{,}95

  • Si la croissance s'accélère et les écarts grandissent avec yy modèle exponentiel y=aebxy=ae^{bx} : régresser lny\ln y sur xx, en semi-logarithmique

    Exemple : population, capital placé, décroissance radioactive

  • Si la relation semble une puissance, sans échelle privilégiée modèle y=axby=ax^{b} : régresser lny\ln y sur lnx\ln x, la pente donnant directement l'exposant

    Exemple : loi d'échelle entre masse et métabolisme

  • Si un point est isolé, très éloigné en xx recalculer avec et sans, comparer les deux pentes, enquêter sur son origine

    Exemple : une pente qui passe de 1,01{,}0 à 0,50{,}5

  • Si les points forment plusieurs groupes distincts ne pas régresser sur l'ensemble : la droite globale ne décrit aucun des groupes

    Exemple : deux ateliers réglés différemment

Toutes les linéarisations transforment yy, donc le r2r^{2} obtenu porte sur les données TRANSFORMÉES. Comparer un r2r^{2} semi-log à un r2r^{2} brut n'a pas de sens.

Lire un graphique des résidus

On trace les résidus contre xx et on regarde s'il reste une forme.

  • Si nuage sans structure, dispersé également de part et d'autre de zéro le modèle linéaire convient, on peut interpréter r2r^{2}

    Exemple : des résidus dispersés au hasard de part et d'autre de zéro

  • Si les résidus dessinent une courbe la relation n'est pas linéaire : linéariser ou changer de modèle

    Exemple : résidus négatifs au centre, positifs aux extrémités

  • Si les résidus s'ouvrent en entonnoir quand xx grandit la dispersion n'est pas constante : les intervalles de prédiction ne valent plus

    Exemple : des revenus dont l'écart croît avec le niveau

  • Si un résidu écrase tous les autres valeur aberrante : enquêter, puis publier avec et sans

    Exemple : un résidu de 88 quand les autres tiennent dans ±1\pm 1

La somme des résidus est nulle par construction : l'annoncer comme preuve de qualité du modèle est une erreur classique, elle ne prouve que l'exactitude du calcul de aa.

La rédaction attendue

Le correcteur coche des étapes. Les voici dans l'ordre, avec la phrase de conclusion qu'il attend mot pour mot.

Rédiger une régression complète

Quand l'utiliser : L'énoncé donne un tableau de couples et demande la droite, le coefficient et une prédiction.

  1. 1 Décrire le nuage en une phrase : forme, sens, présence ou non de points isolés.
  2. 2 Écrire les trois sommes de travail SxyS_{xy}, SxxS_{xx}, SyyS_{yy} avec leurs valeurs numériques.
  3. 3 Calculer bb, puis aa à partir du point moyen, et écrire l'équation avec les unités du contexte.
  4. 4 Donner rr, puis r2r^{2} en pourcentage, en précisant que c'est le carré qui s'interprète.
  5. 5 Prédire seulement à l'intérieur de la plage observée, et écrire cette réserve.

Phrase de conclusion

« b=3517,5=2b=\dfrac{35}{17{,}5}=2 et a=72×3,5=0a=7-2\times 3{,}5=0, donc y^=2x\hat{y}=2x ; r=0,97r=0{,}97 et r2=0,95r^{2}=0{,}95 : 95%95\,\% de la variation de yy est expliquée par la relation linéaire. »

Le piège : Donner la prédiction avant d'avoir vérifié que le xx demandé est dans la plage observée.

Barème : 1 point la description du nuage, 2 points les sommes, 1 point l'équation, 1 point l'interprétation de r2r^{2}, 1 point la réserve sur la prédiction.

Rédiger une conclusion sur la causalité

Quand l'utiliser : L'énoncé demande si une variable « cause » l'autre, ou de commenter une affirmation de journal.

  1. 1 Rappeler ce que le calcul établit : une association linéaire, avec sa force.
  2. 2 Énumérer les explications concurrentes, en NOMMANT une variable confondante plausible du contexte.
  3. 3 Dire ce qu'il faudrait pour conclure à une cause : une expérience avec répartition au hasard.
  4. 4 Conclure sans nier la relation ni la transformer en cause.

Phrase de conclusion

« Les données établissent une association forte, mais la température peut expliquer à la fois les ventes et les noyades : seule une expérience contrôlée permettrait de conclure à un lien de cause à effet. »

Le piège : Écrire « corrélation n'est pas causalité » sans nommer de variable confondante : la phrase générale ne rapporte pas le point.

Barème : 1 point l'association, 1 point la variable confondante nommée, 1 point la condition d'une conclusion causale.

Vérifier avant de rendre

Cinq minutes de vérification récupèrent plus de points qu'un exercice de plus commencé à la hâte.

L'exercice type décortiqué

Une régression complète, du nuage à la prédiction

On relève six couples : (1;2)(1\,;2), (2;3)(2\,;3), (3;7)(3\,;7), (4;9)(4\,;9), (5;9)(5\,;9) et (6;12)(6\,;12).

Établir la droite des moindres carrés, interpréter le coefficient de détermination et prédire la valeur pour x=4,5x=4{,}5.

123456782468101214point moyen (3,5 ; 7)droite : y = 2x
Le nuage est franchement linéaire et croissant ; la droite ajustée passe exactement par le point moyen (3,5;7)(3{,}5\,;7).

Étape 1

x=21\sum x=21, y=42\sum y=42, xy=182\sum xy=182, x2=91\sum x^{2}=91, y2=368\sum y^{2}=368, donc x=3,5\overline{x}=3{,}5 et y=7\overline{y}=7.

Pourquoi

Les cinq sommes se calculent une fois pour toutes : tout le reste en découle, et une erreur ici se propage partout. Les recopier au propre vaut le point de méthode.

Étape 2

Sxy=18221×426=35S_{xy}=182-\dfrac{21\times 42}{6}=35, Sxx=912126=17,5S_{xx}=91-\dfrac{21^{2}}{6}=17{,}5, Syy=3684226=74S_{yy}=368-\dfrac{42^{2}}{6}=74.

Pourquoi

Ces trois quantités sont des variations, donc toujours positives pour SxxS_{xx} et SyyS_{yy}. Un SxxS_{xx} négatif signale une somme de carrés mal calculée.

Étape 3

b=3517,5=2b=\dfrac{35}{17{,}5}=2 puis a=72×3,5=0a=7-2\times 3{,}5=0, donc y^=2x\hat{y}=2x.

Pourquoi

L'ordonnée à l'origine se déduit du point moyen : c'est ce qui garantit que la droite y passe, et c'est le contrôle à faire aussitôt.

Étape 4

r=3517,5×740,973r=\dfrac{35}{\sqrt{17{,}5\times 74}}\approx 0{,}973, donc r20,946r^{2}\approx 0{,}946.

Pourquoi

On donne les deux, mais on n'interprète que le carré : 94,6%94{,}6\,\% de la variation de yy est expliquée par la relation linéaire avec xx.

Étape 5

Résidus : 0,1,1,1,1,00,\,-1,\,1,\,1,\,-1,\,0. Somme nulle, e2=4\sum e^{2}=4, et se=462=1s_{e}=\sqrt{\dfrac{4}{6-2}}=1.

Pourquoi

Les résidus ne montrent aucune structure et restent dans ±1\pm 1 : le modèle linéaire tient, ce qu'aucun coefficient seul ne permettait d'affirmer.

Étape 6

Prédiction : y^(4,5)=9\hat{y}(4{,}5)=9, valeur intérieure à la plage [1;6][1\,;6] des xx observés.

Pourquoi

La réserve sur la plage doit être écrite AVANT le nombre. Pour x=50x=50, la même droite ne dirait rien de fiable, et la phrase est attendue par le correcteur.

Étape 7

Contrôle : Syy(1r2)=74×0,054=4=e2S_{yy}(1-r^{2})=74\times 0{,}054=4=\sum e^{2}.

Pourquoi

Cette identité relie le coefficient et les résidus : les deux voies de calcul se valident l'une l'autre en dix secondes.

Conclusion rédigée

« La droite des moindres carrés est y^=2x\hat{y}=2x, avec r=0,97r=0{,}97 et r2=0,95r^{2}=0{,}95 : 95%95\,\% de la variation de yy s'explique par la relation linéaire avec xx. Pour x=4,5x=4{,}5, valeur située dans la plage observée, on prédit y^=9\hat{y}=9. »

L'erreur classique sur cet exercice : Annoncer que 97%97\,\% de la variation est expliquée : c'est rr et non r2r^{2} qui vaut 0,970{,}97.

À savoir par cœur

  • On REGARDE le nuage avant de calculer : un rr sur un nuage courbé ne veut rien dire.
  • b=SxySxxb=\dfrac{S_{xy}}{S_{xx}}, puis a=ybxa=\overline{y}-b\overline{x} : la droite passe TOUJOURS par le point moyen.
  • rr donne le sens et la force ; seul r2r^{2} se lit en pourcentage de variation expliquée.
  • Les moindres carrés minimisent les écarts VERTICAUX : la droite de yy sur xx n'est pas celle de xx sur yy.
  • La somme des résidus est nulle par construction : c'est leur GRAPHIQUE qui juge le modèle.
  • Un point de levier peut diviser la pente par deux en laissant rr élevé. On enquête, on ne supprime pas.
  • Exponentiel : lny\ln y contre xx. Puissance : lny\ln y contre lnx\ln x, la pente donnant l'exposant.
  • Corrélation n'est pas causalité : nommer la variable confondante, sinon la phrase ne rapporte rien.

Questions fréquentes

Quelle différence entre r et r au carré ?

Le coefficient de corrélation donne le sens de la relation par son signe et sa force par sa valeur absolue, entre moins un et un. Son carré, le coefficient de détermination, se lit en pourcentage : c'est la part de la variation de la variable expliquée par la relation linéaire. Un coefficient de zéro virgule huit correspond ainsi à soixante-quatre pour cent, pas à quatre-vingts.

Pourquoi faut-il regarder le nuage avant de calculer ?

Parce que le coefficient mesure l'alignement et rien d'autre. Une relation parfaitement déterministe mais courbe peut donner un coefficient faible, et deux nuages de formes très différentes peuvent donner exactement le même. La calculatrice renvoie toujours un nombre, y compris là où la droite n'a aucun sens.

Peut-on supprimer un point aberrant ?

Non, pas sans enquête. Un point éloigné peut être une erreur de saisie, mais aussi l'observation la plus informative du jeu de données. La démarche attendue est d'en chercher l'origine, puis de présenter l'analyse avec et sans ce point en signalant l'écart, plutôt que de le faire disparaître.

Que montre le graphique des résidus ?

Ce que le coefficient cache. Un nuage de résidus sans forme valide le modèle linéaire. Une courbure signale que la relation n'est pas une droite. Un élargissement en entonnoir signale une dispersion qui augmente avec la variable explicative, ce qui invalide les intervalles de prédiction même si l'ajustement paraît bon.

Une corrélation forte prouve-t-elle une cause ?

Jamais. Quatre explications restent possibles : la première variable cause la seconde, la seconde cause la première, une troisième variable cause les deux, ou le hasard sur un petit échantillon. Seule une expérience où l'on répartit les individus au hasard entre les conditions permet de conclure à un lien de cause à effet.

Passer à la pratique

Exercices corrigés : Corrélation et régression linéaire

Une méthode se prouve sur une copie, pas sur une fiche. La série du même chapitre reprend chacun de ces pièges dans un exercice, avec le corrigé rédigé étape par étape.

  • 10 exercices corrigés
  • 100 points
  • 150 minutes
Faire les exercices
Fiche précédente Estimation et tests d'hypothèse

Voir aussi

Vous cherchez un tuteur en statistiques 201-337 à Montréal ?

Contactez-moi pour une première séance. La régression est le chapitre le plus utile du cours pour la suite des études : on y travaille autant le calcul que l'interprétation.

Site par Studio Squalli