Seconde, programme français à Montréal • Exercices corrigés

Exercices corrigés : tableaux croisés et fréquences conditionnelles (Seconde)

Voici une série d'exercices corrigés sur les tableaux croisés et les fréquences conditionnelles, pour la classe de Seconde, programme français. Elle suit la section « Croisement de deux variables qualitatives » du programme entré en vigueur à la rentrée 2026, et s'adresse aux élèves des lycées français, dont le Lycée Marie de France et le Collège Stanislas à Montréal.

Le fil de la série tient en une phrase : avant de diviser, écrivez la population dans laquelle vous comptez, le total de la ligne, de la colonne ou du tableau. Tout le reste en découle. Une même case donne trois fréquences différentes selon ce total, une fréquence conditionnelle n'est pas symétrique, et un effectif plus grand ne dit rien sans le total dont il est tiré.

Les données sont vraisemblables et arrondies pour les besoins du calcul : elles ne décrivent pas un territoire réel, sauf la base de pays de l'exercice 5, qui est exacte. Les probabilités conditionnelles, qui prolongent ce chapitre, ont leur série à part.

Faites chaque exercice au complet avant d'ouvrir la correction : c'est en cherchant qu'on apprend, pas en lisant la solution.

Série autocorrigée Tape tes réponses sous chaque question : la page te dit juste ou faux avant d'ouvrir la correction. Avec un compte, chaque bonne réponse du premier coup rapporte des points.

Ce chapitre fait partie de Mathématiques en Seconde
Avant de commencer Fiche de révision : les pièges et la méthode de ce chapitre

Avant ce chapitre

Ces notions sont supposées acquises ici. Si le premier exercice résiste, le blocage vient presque toujours de l'une d'elles, pas du chapitre lui-même.

Remonter plus loin : la chaîne complète (8 chapitres) ↓

Le chemin de remédiation, du plus ancien au plus proche. Un élève qui reprend ce chapitre de zéro le reprend dans cet ordre.

  1. 1Fractions et proportionnalitéSixième
  2. 2Proportionnalité et pourcentagesCinquième
  3. 3Statistiques et probabilitésCinquième
  4. 4Proportionnalité, pourcentages et vitessesQuatrième
  5. 5Statistiques et probabilitésQuatrième
  6. 6Moyenne, médiane, quartiles et étendueTroisième
  7. 7Pourcentages et évolutions
  8. 8Les statistiques descriptives

Rappel de cours

  • • Un TABLEAU CROISÉ d'effectifs range chaque individu d'une population dans une case, selon deux caractères qualitatifs. Chaque ligne et chaque colonne a son total, et le total général est l'effectif de la population.
  • • Une variable qualitative est NOMINALE si ses modalités n'ont pas d'ordre (espèce, profession, région), ORDINALE si elles en ont un (niveau d'études, satisfaction, tranche d'âge).
  • • FRÉQUENCE MARGINALE d'une modalité : son total de ligne ou de colonne divisé par le total général. On ignore l'autre variable.
  • • FRÉQUENCE CONDITIONNELLE de AA parmi BB : fB(A)=effectif de A et Beffectif de Bf_{B}(A)=\dfrac{\text{effectif de } A \text{ et } B}{\text{effectif de } B}. On compte à l'intérieur de la sous-population BB.
  • • Une même case donne TROIS fréquences : divisée par le total de sa ligne, par le total de sa colonne, ou par le total général. On nomme la population AVANT de diviser.
  • • fB(A)f_{B}(A) et fA(B)f_{A}(B) ont le même numérateur mais pas le même dénominateur : en général elles sont DIFFÉRENTES.
  • • Dans une phrase de presse, le groupe qui suit « parmi » ou « des » est la population de référence : son total va au dénominateur.
  • • Pour COMPLÉTER un tableau : une ligne ou une colonne à une seule inconnue se complète par soustraction ; une fréquence conditionnelle multipliée par l'effectif de SA population redonne une case.
  • • La fréquence d'ensemble est la moyenne des fréquences des sous-groupes PONDÉRÉE par leurs parts, jamais leur moyenne simple.
  • • En Python, un filtre ET remplit une case, un filtre OU compte chaque individu une seule fois, et la négation de « A et B » est « non A OU non B ».

Partie A : les bases (/50)

Exercice 1 : Un tableau croisé, trois totaux possibles

Une enquête de santé publique interroge 1 6001\,600 adultes sur leur niveau d'activité physique habituel, classé en trois niveaux : faible, modéré, élevé. Chaque personne est aussi rangée dans une tranche d'âge. Le tableau croise ces deux caractères.

Dans chaque question, écrivez d'abord la population dans laquelle vous comptez, puis le total par lequel vous divisez.

FaibleModéréeÉlevéeTotal
18 à 34 ans100180120400
35 à 54 ans245315140700
55 ans et plus22520075500
Total5706953351 600
  • a) Quelle est la population étudiée ? Les deux variables sont-elles nominales ou ordinales ? Donnez la fréquence marginale de l'activité faible et celle de la tranche « 55 ans et plus ».
  • b) Calculez la fréquence de l'activité faible parmi les adultes de chaque tranche d'âge.
  • c) Calculez la fréquence des « 55 ans et plus » parmi les adultes dont l'activité est faible. Comparez avec le résultat de b) pour la même case.
  • d) Un article affirme : « C'est chez les 35 à 54 ans que l'activité physique faible est la plus répandue : ils sont 245245, contre 225225 chez les 55 ans et plus. » Qu'en pensez-vous ?

Tape tes réponses, la page te dit juste ou faux 0/8

a)
b)
c)
d)
Voir la correction

Réponses

  • a) Population : les 1 6001\,600 adultes ; deux variables ordinales ; 35,625 %35{,}625\ \% et 31,25 %31{,}25\ \%
  • b) 25 %25\ \%, 35 %35\ \% et 45 %45\ \%
  • c) 225570≈39,5 %\dfrac{225}{570}\approx 39{,}5\ \%, contre 45 %45\ \% en b) : même case, autre total
  • d) Faux : 245245 est un effectif ; la fréquence la plus haute est chez les 55 ans et plus, 45 %45\ \%

a) La population est l'ensemble des 1 6001\,600 adultes interrogés, et chacun est décrit par deux caractères. Les deux variables sont ORDINALES : les tranches d'âge se rangent de la plus jeune à la plus âgée, et les niveaux d'activité de faible à élevé. Une variable comme la région de résidence, elle, serait nominale : ses modalités n'ont pas d'ordre. La fréquence MARGINALE d'une modalité se lit dans la marge du tableau, rapportée au total général : pour l'activité faible, 5701 600=0,356 25\dfrac{570}{1\,600}=0{,}356\,25, soit 35,625 %35{,}625\ \%, environ 35,6 %35{,}6\ \%. Pour les 55 ans et plus, 5001 600=0,312 5\dfrac{500}{1\,600}=0{,}312\,5, soit 31,25 %31{,}25\ \%. « Marginale » veut dire qu'on ignore complètement l'autre variable : on lit la ligne ou la colonne Total.

b) Cette fois on compte À L'INTÉRIEUR de chaque tranche d'âge, donc on divise par le total de la LIGNE. Parmi les 18 à 34 ans : 100400=25 %\dfrac{100}{400}=25\ \%. Parmi les 35 à 54 ans : 245700=35 %\dfrac{245}{700}=35\ \%. Parmi les 55 ans et plus : 225500=45 %\dfrac{225}{500}=45\ \%. Ce sont trois fréquences CONDITIONNELLES : la fréquence de l'activité faible parmi une sous-population. On la note fB(A)=effectif de A et Beffectif de Bf_{B}(A)=\dfrac{\text{effectif de } A \text{ et } B}{\text{effectif de } B}, où BB est la sous-population dans laquelle on compte. La lecture est nette : plus on avance en âge, plus l'activité faible est fréquente, ce que la variable ordinale permet justement de dire.

c) La population de référence change : on compte parmi les 570570 adultes d'activité faible, donc on divise par le total de la COLONNE : 225570≈0,394 7\dfrac{225}{570}\approx 0{,}394\,7, soit environ 39,5 %39{,}5\ \%. La case est la même qu'en b), 225225 personnes, mais le total n'est plus le même, et la réponse passe de 45 %45\ \% à 39,5 %39{,}5\ \%. Ce sont deux questions différentes : « parmi les 55 ans et plus, combien ont une activité faible ? » et « parmi les personnes d'activité faible, combien ont 55 ans ou plus ? ». Une fréquence conditionnelle n'est PAS symétrique, et l'erreur la plus fréquente du chapitre consiste à échanger les deux.

d) L'affirmation est fausse, et c'est exactement le piège du chapitre : elle compare deux EFFECTIFS, 245245 et 225225, sans regarder dans quelle population ils sont comptés. Les 35 à 54 ans sont simplement plus nombreux dans l'enquête, 700700 contre 500500. Rapportés à leur total, 245245 sur 700700 font 35 %35\ \% quand 225225 sur 500500 font 45 %45\ \% : l'activité faible est donc plus RÉPANDUE chez les 55 ans et plus. La phrase correcte est : « C'est parmi les 55 ans et plus que la fréquence de l'activité faible est la plus élevée, 45 %45\ \% ; les 35 à 54 ans sont les plus nombreux à avoir une activité faible parce que leur tranche est la plus nombreuse. » Un effectif plus grand ne dit rien sans son total.

Coche ici les exercices faits ou à revoir : un compte gratuit, sans mot de passe, retient tes coches d'une visite à l'autre et te dit quel chapitre attaquer ensuite. Crée ton espace, un courriel suffit.

Exercice 2 : « Parmi », « des … sont … » : traduire la phrase avant de calculer

Une enquête sur l'emploi porte sur 2 0002\,000 personnes actives de 25 à 64 ans. On relève leur plus haut diplôme, variable ordinale à trois modalités, et leur situation : en emploi ou au chômage.

Les médias résument ce genre de tableau en une phrase. Pour chacune des phrases ci-dessous, nommez la population dans laquelle elle compte, calculez, puis dites si elle est vraie.

En emploiAu chômageTotal
Sans diplôme25545300
Diplôme du secondaire84654900
Diplôme du supérieur77624800
Total1 8771232 000
  • a) « 15 %15\ \% des actifs sans diplôme sont au chômage. »
  • b) « 15 %15\ \% des chômeurs sont sans diplôme. »
  • c) « Les diplômés du supérieur représentent 40 %40\ \% des actifs. »
  • d) « Les diplômés du secondaire sont les plus touchés par le chômage : ils forment le plus gros groupe de chômeurs. »
  • e) Écrivez deux phrases correctes, avec le mot « parmi », qui exploitent la case des 2424 chômeurs diplômés du supérieur : l'une avec le total de sa ligne, l'autre avec le total de sa colonne.

Tape tes réponses, la page te dit juste ou faux 0/10

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) Population : les 300300 sans diplôme ; 45300=15 %\dfrac{45}{300}=15\ \% : vraie
  • b) Population : les 123123 chômeurs ; 45123≈36,6 %\dfrac{45}{123}\approx 36{,}6\ \% : fausse
  • c) Population : les 2 0002\,000 actifs ; 8002 000=40 %\dfrac{800}{2\,000}=40\ \% : vraie
  • d) Fausse : 43,9 %43{,}9\ \% des chômeurs, mais un taux de chômage de 6 %6\ \% seulement, contre 15 %15\ \% sans diplôme
  • e) Parmi les diplômés du supérieur, 3 %3\ \% sont au chômage ; parmi les chômeurs, 19,5 %19{,}5\ \% sont diplômés du supérieur

La méthode est la même pour chaque phrase : le groupe qui suit « des » ou « parmi » est la population dans laquelle on compte, et c'est SON total qui va au dénominateur. Le groupe qui suit « sont » est ce qu'on compte, et c'est la case qui va au numérateur.

a) « Des actifs sans diplôme » : on compte parmi les 300300 sans diplôme, total de la ligne. 45300=0,15\dfrac{45}{300}=0{,}15, soit 15 %15\ \%. La phrase est VRAIE. On l'appelle aussi le taux de chômage des sans-diplôme : c'est une fréquence conditionnelle.

b) « Des chômeurs » : on compte cette fois parmi les 123123 chômeurs, total de la colonne. 45123≈0,366\dfrac{45}{123}\approx 0{,}366, soit environ 36,6 %36{,}6\ \%. La phrase est FAUSSE : elle a gardé le pourcentage de a) en échangeant les deux groupes. Les mêmes 4545 personnes pèsent 15 %15\ \% d'un groupe et 36,6 %36{,}6\ \% de l'autre, parce que les deux groupes n'ont pas la même taille. Ce retournement de phrase est la faute que les médias commettent le plus souvent.

c) « Des actifs » tout court : la population est l'ensemble, donc on divise par le total général. 8002 000=0,4\dfrac{800}{2\,000}=0{,}4, soit 40 %40\ \%. VRAIE : c'est une fréquence marginale, lue dans la colonne Total.

d) La seconde moitié est exacte : les diplômés du secondaire sont 5454 chômeurs sur 123123, soit 54123≈43,9 %\dfrac{54}{123}\approx 43{,}9\ \% des chômeurs, le plus gros groupe. Mais « les plus touchés » parle du RISQUE d'être au chômage dans chaque groupe, donc d'une fréquence parmi chaque diplôme : 54900=6 %\dfrac{54}{900}=6\ \% pour le secondaire, contre 15 %15\ \% sans diplôme et 24800=3 %\dfrac{24}{800}=3\ \% pour le supérieur. Les plus touchés sont les sans-diplôme. Le secondaire fournit le plus de chômeurs simplement parce que c'est le groupe le plus nombreux, 900900 actifs sur 2 0002\,000. La phrase est donc FAUSSE. La figure ci-dessous montre les deux lectures d'une même ligne de cases, avec deux classements qui n'ont rien à voir.

e) Avec le total de la ligne : « Parmi les diplômés du supérieur, 3 %3\ \% sont au chômage » (24800=0,03\dfrac{24}{800}=0{,}03). Avec le total de la colonne : « Parmi les chômeurs, 19,5 %19{,}5\ \% sont diplômés du supérieur » (24123≈0,195\dfrac{24}{123}\approx 0{,}195). On pourrait en écrire une troisième, avec le total général : « 1,2 %1{,}2\ \% des actifs sont des chômeurs diplômés du supérieur » (242 000=0,012\dfrac{24}{2\,000}=0{,}012). Une case, trois totaux, trois phrases : c'est tout le chapitre.

sans diplôme15 %secondaire6 %supérieur3 %part des chômeurs dans chaque groupesans diplôme36,6 %secondaire43,9 %supérieur19,5 %part de chaque groupe parmi les chômeurs

Exercice 3 : Compléter un tableau par raisonnement sur les effectifs

Un institut agronomique suit 480480 parcelles de blé cultivées avec trois variétés, A, B et C. À la récolte, le rendement de chaque parcelle est classé faible, moyen ou élevé : c'est une variable ordinale.

Le tableau a été abîmé et plusieurs cases sont illisibles. Tout ce qui manque se retrouve pourtant par soustraction, à condition de choisir le bon ordre.

FaibleMoyenÉlevéTotal
Variété A30?40160
Variété B?100?200
Variété C10???
Total90240150480
  • a) Complétez le tableau. Pour chaque case, écrivez l'égalité qui la donne, dans un ordre où chaque calcul n'utilise que des cases déjà connues.
  • b) Calculez la fréquence du rendement élevé parmi les parcelles de chaque variété.
  • c) Un technicien affirme : « La variété B a donné plus de parcelles à rendement élevé que la variété A, 5050 contre 4040 : elle est donc plus performante. » Commentez.
  • d) Parmi les parcelles à rendement élevé, quelle est la fréquence de celles de la variété C ? Comparez avec la part de la variété C dans l'ensemble des parcelles.
  • e) La variable étant ordinale, on peut regrouper « moyen » et « élevé ». Calculez, parmi chaque variété, la fréquence d'un rendement au moins moyen.

Tape tes réponses, la page te dit juste ou faux 0/13

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) Moyen A =90=90, total C =120=120, faible B =50=50, moyen C =50=50, élevé C =60=60, élevé B =50=50
  • b) 25 %25\ \% pour A, 25 %25\ \% pour B, 50 %50\ \% pour C
  • c) Faux : B a plus de parcelles en tout ; rapportée à son total, sa fréquence est la même que celle de A, 25 %25\ \%
  • d) 40 %40\ \% des rendements élevés, pour 25 %25\ \% des parcelles : C est surreprésentée
  • e) 81,25 %81{,}25\ \% pour A, 75 %75\ \% pour B, environ 91,7 %91{,}7\ \% pour C

a) Une ligne ou une colonne dont une seule case manque se complète par soustraction à partir de son total. On cherche donc, à chaque étape, une ligne ou une colonne qui n'a plus qu'une inconnue. Ligne A : moyen A =160−30−40=90=160-30-40=90. Colonne Total : total C =480−160−200=120=480-160-200=120. Colonne Faible : faible B =90−30−10=50=90-30-10=50. Colonne Moyen, qui n'a plus qu'une inconnue depuis le premier calcul : moyen C =240−90−100=50=240-90-100=50. Ligne C : élevé C =120−10−50=60=120-10-50=60. Enfin élevé B =150−40−60=50=150-40-60=50. Contrôle obligatoire, par la ligne B qu'on n'a pas utilisée pour la dernière case : 50+100+50=20050+100+50=200, c'est bien le total annoncé. Commencer par la ligne B serait une impasse : elle a deux inconnues, et aucune égalité seule ne les sépare.

b) On compte parmi les parcelles de chaque variété, donc on divise par le total de la LIGNE. A : 40160=25 %\dfrac{40}{160}=25\ \%. B : 50200=25 %\dfrac{50}{200}=25\ \%. C : 60120=50 %\dfrac{60}{120}=50\ \%. La variété C est nettement devant, alors qu'elle occupe le moins de parcelles.

c) L'affirmation compare deux EFFECTIFS, 5050 et 4040, sans leurs totaux. Or la variété B a été semée sur 200200 parcelles et la variété A sur 160160 : il est normal qu'elle compte plus de rendements élevés. Rapportées à leur total, les deux fréquences sont ÉGALES, 25 %25\ \% : sur ce critère, B ne fait pas mieux que A. Un effectif plus grand ne dit rien sans son total, et c'est la seule conclusion honnête que le tableau autorise.

d) La population de référence est maintenant celle des 150150 parcelles à rendement élevé, total de la COLONNE : 60150=0,4\dfrac{60}{150}=0{,}4, soit 40 %40\ \%. Dans l'ensemble, la variété C ne représente que 120480=25 %\dfrac{120}{480}=25\ \% des parcelles, fréquence marginale. Elle fournit donc 40 %40\ \% des bons rendements pour 25 %25\ \% des parcelles : elle est surreprésentée parmi les rendements élevés, ce qui confirme la lecture de b) par l'autre sens du tableau. Attention à ne pas confondre les deux nombres : 50 %50\ \% des parcelles C ont un rendement élevé, et 40 %40\ \% des rendements élevés viennent de C.

e) « Au moins moyen » regroupe les modalités moyen et élevé, ce qui n'a de sens que parce que la variable est ordonnée : on ne regrouperait pas ainsi des espèces ou des régions. A : 90+40160=130160=81,25 %\dfrac{90+40}{160}=\dfrac{130}{160}=81{,}25\ \%. B : 100+50200=75 %\dfrac{100+50}{200}=75\ \%. C : 50+60120=110120≈91,7 %\dfrac{50+60}{120}=\dfrac{110}{120}\approx 91{,}7\ \%. Ce regroupement fait apparaître ce que b) cachait : A et B ont la même fréquence de rendement élevé, mais A a moins de rendements faibles, 30160≈18,8 %\dfrac{30}{160}\approx 18{,}8\ \% contre 50200=25 %\dfrac{50}{200}=25\ \% pour B.

Exercice 4 : Compléter un tableau à partir de fréquences conditionnelles

Un fournisseur d'énergie interroge 1 5001\,500 clients après un contact avec son service client. Il relève le canal utilisé, agence, téléphone ou messagerie en ligne, et le degré de satisfaction, variable ordinale : insatisfait, satisfait, très satisfait. Le rapport ne donne que des pourcentages :

20 %20\ \% des clients interrogés sont passés par une agence, 50 %50\ \% par le téléphone, les autres par la messagerie. Parmi les clients passés par une agence, 10 %10\ \% sont insatisfaits et 45 %45\ \% très satisfaits. Parmi les clients passés par le téléphone, 24 %24\ \% sont insatisfaits et 40 %40\ \% très satisfaits. Au total, 17 %17\ \% des clients interrogés sont insatisfaits et 40 %40\ \% très satisfaits.

  • a) Calculez le nombre de clients de chaque canal.
  • b) Complétez les lignes « agence » et « téléphone » du tableau croisé canal par satisfaction.
  • c) Complétez la ligne « messagerie » en utilisant les totaux des colonnes.
  • d) Calculez la fréquence des insatisfaits parmi les clients de la messagerie, puis la fréquence des clients passés par le téléphone parmi les insatisfaits.
  • e) Pour chaque canal, calculez la fréquence des clients au moins satisfaits. Quel canal le fournisseur doit-il améliorer en priorité ?

Tape tes réponses, la page te dit juste ou faux 0/14

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) 300300 en agence, 750750 au téléphone, 450450 par messagerie
  • b) Agence : 3030, 135135, 135135 ; téléphone : 180180, 270270, 300300
  • c) Messagerie : 4545 insatisfaits, 240240 satisfaits, 165165 très satisfaits
  • d) 10 %10\ \% parmi la messagerie ; 180255≈70,6 %\dfrac{180}{255}\approx 70{,}6\ \% des insatisfaits sont passés par le téléphone
  • e) 90 %90\ \%, 76 %76\ \% et 90 %90\ \% : le téléphone

a) Les trois premiers pourcentages sont des fréquences MARGINALES, rapportées aux 1 5001\,500 clients : agence 0,20×1 500=3000{,}20\times 1\,500=300, téléphone 0,50×1 500=7500{,}50\times 1\,500=750, messagerie 1 500−300−750=4501\,500-300-750=450, soit les 30 %30\ \% restants.

b) « Parmi les clients passés par une agence » : la population de référence est la ligne agence, 300300 clients. Donc 0,10×300=300{,}10\times 300=30 insatisfaits, 0,45×300=1350{,}45\times 300=135 très satisfaits, et 300−30−135=135300-30-135=135 satisfaits. De même pour le téléphone, sur 750750 clients : 0,24×750=1800{,}24\times 750=180 insatisfaits, 0,40×750=3000{,}40\times 750=300 très satisfaits, 750−180−300=270750-180-300=270 satisfaits. Le geste est toujours le même : une fréquence conditionnelle multipliée par l'effectif de SA population redonne une case. Multiplier 10 %10\ \% par 1 5001\,500 donnerait 150150, un nombre qui n'a aucun sens ici.

c) Les deux derniers pourcentages portent sur l'ensemble : 0,17×1 500=2550{,}17\times 1\,500=255 insatisfaits et 0,40×1 500=6000{,}40\times 1\,500=600 très satisfaits. Les colonnes donnent alors la ligne manquante : insatisfaits de la messagerie 255−30−180=45255-30-180=45, très satisfaits 600−135−300=165600-135-300=165, et satisfaits 450−45−165=240450-45-165=240. Contrôle par la colonne des satisfaits : 135+270+240=645135+270+240=645, et 255+645+600=1 500255+645+600=1\,500.

d) Parmi les 450450 clients de la messagerie : 45450=10 %\dfrac{45}{450}=10\ \% d'insatisfaits, autant qu'en agence. Parmi les 255255 insatisfaits : 180255≈0,706\dfrac{180}{255}\approx 0{,}706, soit environ 70,6 %70{,}6\ \% sont passés par le téléphone. Les deux nombres ne répondent pas à la même question : le premier mesure la qualité d'un canal, le second dit d'où viennent les mécontents, et il dépend aussi du fait que la moitié des clients passent par le téléphone.

e) La variable est ordinale, donc « au moins satisfait » regroupe satisfait et très satisfait. Agence : 135+135300=90 %\dfrac{135+135}{300}=90\ \%. Téléphone : 270+300750=76 %\dfrac{270+300}{750}=76\ \%. Messagerie : 240+165450=90 %\dfrac{240+165}{450}=90\ \%. C'est le téléphone qu'il faut améliorer : sa fréquence de clients au moins satisfaits est la plus basse, et c'est bien une comparaison de fréquences parmi chaque canal, pas d'effectifs. La figure ci-dessous représente chaque ligne en barre de 100 %100\ \% : c'est la représentation qui convient aux fréquences conditionnelles d'une variable ordinale, les modalités restant dans leur ordre.

10 %45 %45 %agence24 %36 %40 %téléphone10 %53,3 %36,7 %messagerieinsatisfaitsatisfaittrès satisfait

Exercice 5 : Filtrer des individus avec ET, OU, NON en Python

Une petite base de données décrit douze pays par deux caractères : le continent, et l'accès ou non à la mer. Chaque caractère est rangé dans une liste Python, et les trois listes sont alignées : le pays numéro i a pour continent continent[i] et pour accès à la mer mer[i].

Le programme ci-dessous parcourt les indices de 00 à 1111 et affiche les pays qui vérifient une condition. Les accents sont retirés des chaînes pour simplifier la saisie.

python
pays = ["France", "Mali", "Bolivie", "Suisse", "Senegal", "Chili"]
pays = pays + ["Autriche", "Niger", "Canada", "Portugal", "Paraguay", "Maroc"]
continent = ["Europe", "Afrique", "Amerique", "Europe", "Afrique", "Amerique"]
continent = continent + ["Europe", "Afrique", "Amerique", "Europe", "Amerique", "Afrique"]
mer = ["oui", "non", "non", "non", "oui", "oui", "non", "non", "oui", "oui", "non", "oui"]

for i in range(len(pays)):
    if continent[i] == "Afrique" and mer[i] == "non":
        print(pays[i])
  • a) Traduisez la condition en français, puis dites ce qu'affiche le programme et combien de pays il affiche.
  • b) On remplace la condition par continent[i] == "Europe" or mer[i] == "oui". Combien de pays sont affichés ? Un élève répond 4+6=104+6=10 : où est son erreur ?
  • c) Écrivez la condition qui sélectionne les pays qui ne sont pas en Amérique et qui n'ont pas accès à la mer, et donnez leur nombre. Écrivez ensuite la NÉGATION de la condition « être en Europe et avoir accès à la mer », et donnez le nombre de pays qui la vérifient.
  • d) Modifiez le programme pour qu'il compte, au lieu d'afficher, les pays d'Afrique et les pays d'Afrique ayant accès à la mer. Déduisez-en la fréquence de l'accès à la mer parmi les pays d'Afrique de la liste, puis la fréquence des pays d'Afrique parmi ceux qui ont accès à la mer.

Tape tes réponses, la page te dit juste ou faux 0/6

a)
b)
c)
d)
Voir la correction

Réponses

  • a) « en Afrique ET sans accès à la mer » : Mali et Niger, 22 pays
  • b) 88 pays ; France et Portugal vérifient les deux critères et ont été comptés deux fois : 4+6−2=84+6-2=8
  • c) not (continent[i] == "Amerique") and mer[i] == "non" : 44 pays ; la négation est « pas en Europe OU pas d'accès à la mer » : 1010 pays
  • d) 24=50 %\dfrac{2}{4}=50\ \% ; 26≈33,3 %\dfrac{2}{6}\approx 33{,}3\ \%

a) La condition se lit : « le pays est en Afrique ET il n'a pas accès à la mer ». Le mot and exige que les deux tests soient vrais pour le même indice i. Les pays d'Afrique de la liste sont le Mali, le Sénégal, le Niger et le Maroc ; parmi eux, seuls le Mali et le Niger n'ont pas de côte. Le programme affiche donc Mali puis Niger, dans l'ordre des indices : 22 pays. C'est exactement la case « Afrique, sans accès à la mer » d'un tableau croisé continent par accès à la mer : un filtre ET remplit une case.

b) Avec or, un pays est affiché dès qu'AU MOINS un des deux tests est vrai. Les pays d'Europe sont France, Suisse, Autriche et Portugal, soit 44 ; les pays ayant accès à la mer sont France, Sénégal, Chili, Canada, Portugal et Maroc, soit 66. La France et le Portugal sont dans les deux listes. Le programme, lui, examine chaque pays UNE seule fois et l'affiche une seule fois : il affiche 4+6−2=84+6-2=8 pays. L'élève a additionné deux effectifs qui se chevauchent : c'est son addition qui compte deux fois l'intersection, pas le or. Le « ou » des mathématiques est inclusif, et un pays qui vérifie les deux critères vérifie a fortiori l'un des deux.

c) « Ne pas être en Amérique » s'écrit not (continent[i] == "Amerique"), ou continent[i] != "Amerique". La condition complète est not (continent[i] == "Amerique") and mer[i] == "non". Les pays sans accès à la mer sont Mali, Bolivie, Suisse, Autriche, Niger et Paraguay ; on retire la Bolivie et le Paraguay, qui sont en Amérique : il reste Mali, Suisse, Autriche et Niger, 44 pays. Pour la négation, attention : le contraire de « A et B » n'est PAS « non A et non B », mais « non A OU non B ». La condition s'écrit not (continent[i] == "Europe" and mer[i] == "oui"), ou continent[i] != "Europe" or mer[i] != "oui". Seuls la France et le Portugal vérifient « en Europe et accès à la mer », donc la négation est vérifiée par 12−2=1012-2=10 pays. La fausse négation « ni en Europe, ni accès à la mer » ne retiendrait que Mali, Bolivie, Niger et Paraguay : 44 pays, un tout autre ensemble.

d) On remplace l'affichage par deux compteurs initialisés à 00 (voir le programme ci-dessous). Le premier vaut 44, le second 22. La fréquence de l'accès à la mer PARMI les pays d'Afrique divise par le nombre de pays d'Afrique : 24=50 %\dfrac{2}{4}=50\ \%. La fréquence des pays d'Afrique PARMI ceux qui ont accès à la mer divise par ces 66 pays : 26≈33,3 %\dfrac{2}{6}\approx 33{,}3\ \%. Le numérateur est le même filtre ET, seul le dénominateur change : c'est lui qu'il faut choisir en premier, et c'est lui qui décide du compteur à écrire. Ces fréquences décrivent cette liste de douze pays, pas le monde : un échantillon choisi à la main ne représente que lui-même.

python
n_afrique = 0
n_afrique_mer = 0
for i in range(len(pays)):
    if continent[i] == "Afrique":
        n_afrique = n_afrique + 1
        if mer[i] == "oui":
            n_afrique_mer = n_afrique_mer + 1
print(n_afrique_mer / n_afrique)

Partie B : problèmes et raisonnement (/50)

Exercice 6 : Dresser le tableau croisé à partir du fichier des individus

Le service des espaces verts d'une commune tient l'inventaire des 2020 arbres d'un parc. Chaque arbre est un individu, décrit par deux caractères : son espèce, variable nominale, et son état sanitaire, variable ordinale (bon, moyen, mauvais). Le fichier est rangé dans deux listes alignées : l'arbre numéro i est de l'espèce espece[i] et dans l'état etat[i].

Le programme compte, pour chaque couple (espèce, état), le nombre d'arbres correspondants. La fonction freq_cond, incomplète, doit renvoyer la fréquence de l'état s parmi les arbres de l'espèce e.

python
espece = ["platane", "erable", "tilleul", "platane", "platane", "erable", "tilleul", "platane", "erable", "tilleul"]
espece = espece + ["platane", "erable", "tilleul", "platane", "erable", "tilleul", "platane", "erable", "tilleul", "platane"]
etat = ["bon", "mauvais", "bon", "moyen", "bon", "moyen", "mauvais", "bon", "mauvais", "moyen"]
etat = etat + ["mauvais", "bon", "bon", "bon", "moyen", "moyen", "moyen", "mauvais", "bon", "bon"]

especes = ["platane", "tilleul", "erable"]
etats = ["bon", "moyen", "mauvais"]
for e in especes:
    for s in etats:
        n = 0
        for i in range(len(espece)):
            if espece[i] == e and etat[i] == s:
                n = n + 1
        print(e, s, n)

def freq_cond(e, s):
    n_e = 0
    n_es = 0
    for i in range(len(espece)):
        if espece[i] == e:
            n_e = n_e + 1
            if ... :
                n_es = n_es + 1
    return ...
  • a) Dressez à la main le tableau croisé espèce par état sanitaire, avec ses totaux, en lisant les deux listes.
  • b) Combien de lignes le programme affiche-t-il ? Donnez les trois premières. Combien de fois le test de la ligne if est-il évalué au total ?
  • c) Complétez les deux pointillés de freq_cond, puis donnez la valeur renvoyée par freq_cond("erable", "mauvais") et par freq_cond("platane", "mauvais").
  • d) Un élève termine sa fonction par return n_es / len(espece). Que renvoie alors l'appel freq_cond("erable", "mauvais"), et quelle fréquence a-t-il calculée en réalité ?
  • e) Le responsable annonce : « 60 %60\ \% des arbres en mauvais état sont des érables. » Vérifiez, et dites pourquoi freq_cond ne permet pas de calculer ce nombre directement.

Tape tes réponses, la page te dit juste ou faux 0/10

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) Platane : 55, 22, 11 ; tilleul : 33, 22, 11 ; érable : 11, 22, 33 ; totaux 99, 66, 55 et 2020
  • b) 99 lignes : platane bon 5, platane moyen 2, platane mauvais 1 ; 3×3×20=1803\times 3\times 20=180 tests
  • c) etat[i] == s et n_es / n_e ; 0,50{,}5 et 0,1250{,}125
  • d) 0,150{,}15 : la fréquence de « érable et mauvais » dans tout l'inventaire, pas parmi les érables
  • e) Vrai : 35=60 %\dfrac{3}{5}=60\ \% ; il faut compter parmi les arbres en mauvais état, donc filtrer sur l'état d'abord

a) On parcourt les vingt couples (espece[i], etat[i]) et l'on fait un bâton dans la bonne case. Platane : bon 55, moyen 22, mauvais 11, total 88. Tilleul : bon 33, moyen 22, mauvais 11, total 66. Érable : bon 11, moyen 22, mauvais 33, total 66. Totaux des colonnes : bon 99, moyen 66, mauvais 55, et 2020 en tout. Contrôle : 8+6+6=208+6+6=20 et 9+6+5=209+6+5=20. Chaque arbre tombe dans UNE case et une seule, c'est ce qui garantit que les totaux se recoupent.

b) Les deux boucles extérieures parcourent 33 espèces et 33 états : le programme affiche 3×3=93\times 3=9 lignes, une par case du tableau. Les trois premières sont « platane bon 5 », « platane moyen 2 » et « platane mauvais 1 », puisque la boucle sur les états tourne à l'intérieur de celle sur les espèces. Pour chacune de ces 99 cases, la boucle intérieure relit les 2020 arbres : le test est évalué 9×20=1809\times 20=180 fois. C'est la version la plus simple, pas la plus rapide : un seul passage sur le fichier suffirait avec neuf compteurs, mais celle-ci se lit comme la définition, une case égale un filtre ET.

c) Le premier pointillé est la seconde moitié du filtre : if etat[i] == s. Comme ce test est placé À L'INTÉRIEUR du test sur l'espèce, n_es compte les arbres de l'espèce e ET dans l'état s, tandis que n_e compte tous les arbres de l'espèce e. Le second pointillé est return n_es / n_e : on divise par l'effectif de la population dans laquelle on compte, ici l'espèce. Pour l'érable en mauvais état : 36=0,5\dfrac{3}{6}=0{,}5. Pour le platane : 18=0,125\dfrac{1}{8}=0{,}125. Un érable sur deux est en mauvais état, contre un platane sur huit.

d) Avec len(espece), qui vaut 2020, l'appel renvoie 320=0,15\dfrac{3}{20}=0{,}15. C'est la fréquence de la case « érable et mauvais » dans l'inventaire TOUT ENTIER, pas une fréquence conditionnelle. Le programme ne signale aucune erreur, et le nombre obtenu a l'air plausible : c'est ce qui rend la faute dangereuse. Le dénominateur se décide avant d'écrire la ligne return, en nommant la population : « parmi les érables », donc n_e.

e) « Des arbres en mauvais état » : on compte parmi les 55 arbres en mauvais état, dont 33 érables. 35=60 %\dfrac{3}{5}=60\ \% : l'annonce est exacte. Mais freq_cond(e, s) compte toujours PARMI une espèce, et renvoie une fréquence de l'état ; ici les rôles sont inversés, on compte parmi un état. Il faudrait une seconde fonction qui filtre d'abord sur etat[i] == s, puis compte l'espèce. Les deux nombres sur la même case, 50 %50\ \% des érables sont en mauvais état et 60 %60\ \% des arbres en mauvais état sont des érables, n'ont aucune raison d'être égaux.

python
def freq_cond(e, s):
    n_e = 0
    n_es = 0
    for i in range(len(espece)):
        if espece[i] == e:
            n_e = n_e + 1
            if etat[i] == s:
                n_es = n_es + 1
    return n_es / n_e

Exercice 7 : Un classement qui se retourne

Deux départements comparent la létalité de leurs accidents de la route, c'est-à-dire la fréquence des accidents corporels ayant fait au moins un mort. Le département A est surtout rural, le département B surtout urbain. On distingue le réseau : en agglomération ou hors agglomération.

Le tableau donne le nombre d'accidents corporels de l'année ; la figure donne, pour chaque réseau et chaque département, la fréquence des accidents mortels.

En agglomérationHors agglomérationTotal
Département A2008001 000
Département B1 5005002 000
en agglomérationhors agglomérationpart des accidents qui ont fait au moins un mortA2 %B3 %A6 %B7 %
  • a) Calculez le nombre d'accidents mortels dans chacune des quatre cases.
  • b) Calculez la létalité de l'ensemble des accidents de chaque département. Lequel a la létalité globale la plus faible ?
  • c) Un journal titre : « Les routes du département A sont les plus meurtrières. » Pourtant, dans chaque réseau, A fait mieux que B. Expliquez ce retournement en calculant la part des accidents hors agglomération dans chaque département.
  • d) Quelle serait la létalité globale de A si ses accidents se répartissaient entre les deux réseaux comme ceux de B ?
  • e) Pour comparer la sécurité des routes des deux départements, faut-il comparer les létalités globales ou les létalités réseau par réseau ?

Tape tes réponses, la page te dit juste ou faux 0/10

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) A : 44 et 4848 ; B : 4545 et 3535
  • b) A : 521 000=5,2 %\dfrac{52}{1\,000}=5{,}2\ \% ; B : 802 000=4 %\dfrac{80}{2\,000}=4\ \% : B
  • c) 80 %80\ \% des accidents de A sont hors agglomération, contre 25 %25\ \% pour B, et ce réseau est le plus létal
  • d) 0,75×2+0,25×6=3 %0{,}75\times 2+0{,}25\times 6=3\ \%, mieux que les 4 %4\ \% de B
  • e) Réseau par réseau : la létalité globale mélange la sécurité et la structure du réseau

a) Chaque fréquence de la figure est une fréquence conditionnelle, calculée PARMI les accidents d'un département sur un réseau : on la multiplie par l'effectif de la case correspondante. A en agglomération : 0,02×200=40{,}02\times 200=4. A hors agglomération : 0,06×800=480{,}06\times 800=48. B en agglomération : 0,03×1 500=450{,}03\times 1\,500=45. B hors agglomération : 0,07×500=350{,}07\times 500=35.

b) On compte maintenant parmi TOUS les accidents d'un département. A : 4+48=524+48=52 accidents mortels sur 1 0001\,000, soit 5,2 %5{,}2\ \%. B : 45+35=8045+35=80 sur 2 0002\,000, soit 4 %4\ \%. La létalité globale la plus faible est celle de B. On remarque au passage que B a PLUS d'accidents mortels que A, 8080 contre 5252, et pourtant une létalité plus faible : l'effectif seul ne classait rien.

c) Hors agglomération, on roule plus vite, et un accident y est bien plus souvent mortel : 6 %6\ \% ou 7 %7\ \% contre 2 %2\ \% ou 3 %3\ \%. Or ce réseau pèse très différemment : 8001 000=80 %\dfrac{800}{1\,000}=80\ \% des accidents de A ont lieu hors agglomération, contre 5002 000=25 %\dfrac{500}{2\,000}=25\ \% pour B. La létalité globale n'est pas la moyenne simple des deux létalités, c'est leur moyenne PONDÉRÉE par cette répartition : pour A, 0,2×2+0,8×6=5,20{,}2\times 2+0{,}8\times 6=5{,}2, et pour B, 0,75×3+0,25×7=40{,}75\times 3+0{,}25\times 7=4. A est pénalisé par sa structure, pas par la dangerosité de ses routes : dans chaque réseau, sa létalité est inférieure d'un point. Ce retournement porte le nom de paradoxe de Simpson. Le titre du journal confond deux questions : « où les accidents sont-ils le plus souvent mortels ? » et « où les routes sont-elles le plus dangereuses à réseau égal ? ».

d) On garde les létalités de A, 2 %2\ \% et 6 %6\ \%, mais avec les poids de B, 75 %75\ \% et 25 %25\ \% : 0,75×2+0,25×6=1,5+1,5=30{,}75\times 2+0{,}25\times 6=1{,}5+1{,}5=3, soit 3 %3\ \%. À structure égale, A passe DEVANT B, 3 %3\ \% contre 4 %4\ \%. C'est la preuve chiffrée que l'écart de b) venait de la répartition des accidents, et non de la sécurité des routes.

e) Il faut comparer réseau par réseau, c'est-à-dire des fréquences conditionnelles calculées dans des populations comparables. La létalité globale reste un bon indicateur pour décrire un département, mais elle mélange deux choses, la dangerosité de chaque réseau et la part de chaque réseau, et ne permet donc pas de comparer deux départements qui n'ont pas la même structure. Avant de diviser, on écrit la population dans laquelle on compte, et avant de comparer, on vérifie que les deux populations se ressemblent.

Exercice 8 : Cinq affirmations à corriger

Chacune des cinq affirmations ci-dessous est FAUSSE. Pour chacune, donnez un contre-exemple chiffré, pris dans les exercices précédents, puis écrivez l'énoncé correct.

Ce sont les cinq erreurs qu'on retrouve le plus souvent sur les tableaux croisés, dans les copies comme dans les journaux.

  • a) « Dans un tableau croisé, la fréquence de A parmi B est égale à la fréquence de B parmi A, puisqu'on utilise la même case. »
  • b) « Le groupe qui compte le plus d'individus concernés est celui où le phénomène est le plus fréquent. »
  • c) « La fréquence d'une modalité dans l'ensemble est la moyenne des fréquences de cette modalité dans chaque sous-groupe. »
  • d) « En Python, la condition A or B compte deux fois les individus qui vérifient à la fois A et B. »
  • e) « La négation de « le pays est en Europe et a accès à la mer » est « le pays n'est pas en Europe et n'a pas accès à la mer ». »

Tape tes réponses, la page te dit juste ou faux 0/6

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) Faux : 45 %45\ \% des 55 ans et plus ont une activité faible, mais 39,5 %39{,}5\ \% des adultes d'activité faible ont 55 ans et plus
  • b) Faux : le secondaire fournit le plus de chômeurs, avec un taux de chômage de 6 %6\ \% seulement
  • c) Faux : pour A, 2+62=4 %\dfrac{2+6}{2}=4\ \%, alors que la létalité globale vaut 5,2 %5{,}2\ \% ; c'est une moyenne pondérée
  • d) Faux : le programme affiche 88 pays et non 1010 ; c'est l'addition 4+64+6 qui compte deux fois
  • e) Faux : la négation est « pas en Europe OU pas d'accès à la mer », vérifiée par 1010 pays et non 44

a) Faux. Contre-exemple de l'exercice 1 : la case des 225225 adultes de 55 ans et plus d'activité faible donne 225500=45 %\dfrac{225}{500}=45\ \% parmi les 55 ans et plus, mais 225570≈39,5 %\dfrac{225}{570}\approx 39{,}5\ \% parmi les adultes d'activité faible. La case est la même, le TOTAL ne l'est pas. Énoncé correct : fB(A)=effectif de A et Beffectif de Bf_{B}(A)=\dfrac{\text{effectif de } A\text{ et }B}{\text{effectif de }B} et fA(B)=effectif de A et Beffectif de Af_{A}(B)=\dfrac{\text{effectif de } A\text{ et }B}{\text{effectif de }A} ont le même numérateur mais des dénominateurs différents ; elles ne sont égales que si AA et BB ont le même effectif.

b) Faux. Contre-exemple de l'exercice 2 : les diplômés du secondaire sont 5454 chômeurs, le plus gros groupe, mais leur taux de chômage est 54900=6 %\dfrac{54}{900}=6\ \%, contre 15 %15\ \% pour les sans-diplôme, qui ne sont que 4545. Énoncé correct : pour savoir où un phénomène est le plus fréquent, on compare des fréquences conditionnelles, chacune calculée parmi son groupe ; un effectif plus grand peut venir simplement d'un groupe plus nombreux.

c) Faux. Contre-exemple de l'exercice 7 : la létalité du département A vaut 2 %2\ \% en agglomération et 6 %6\ \% hors agglomération, dont la moyenne simple est 4 %4\ \% ; or sa létalité globale est 5,2 %5{,}2\ \%. Énoncé correct : la fréquence d'ensemble est la moyenne des fréquences des sous-groupes PONDÉRÉE par la part de chaque sous-groupe, ici 0,2×2+0,8×6=5,20{,}2\times 2+0{,}8\times 6=5{,}2. La moyenne simple n'est juste que si les sous-groupes ont le même effectif.

d) Faux. Contre-exemple de l'exercice 5 : avec continent[i] == "Europe" or mer[i] == "oui", la boucle examine chaque pays une seule fois et en affiche 88, pas 1010. Ce qui compte deux fois la France et le Portugal, c'est l'addition 4+64+6 des deux effectifs. Énoncé correct : un filtre OU sélectionne chaque individu au plus une fois ; l'effectif de « A ou B » vaut l'effectif de A plus celui de B MOINS celui de « A et B ».

e) Faux. La négation de « A et B » est « non A OU non B » : il suffit qu'un des deux critères manque. Contre-exemple de l'exercice 5 : seuls la France et le Portugal sont en Europe avec accès à la mer, donc la négation est vérifiée par 12−2=1012-2=10 pays, alors que la phrase proposée n'en retient que 44, le Mali, la Bolivie, le Niger et le Paraguay. La Suisse, par exemple, n'est pas « en Europe avec accès à la mer », mais elle est en Europe : la phrase proposée l'écarte à tort.

Exercice 9 : Problème : une population qui vieillit, et deux titres de presse

Une agglomération compte 250 000250\,000 habitants : 120 000120\,000 dans la ville-centre, 90 00090\,000 dans les communes de la périphérie et 40 00040\,000 dans les communes rurales. La figure donne, pour chaque zone, la répartition de ses habitants en trois tranches d'âge.

Deux journaux locaux tirent de ces chiffres des titres très différents.

22 %58 %20 %Ville-centre28 %57 %15 %Périphérie18 %50 %32 %Ruralmoins de 20 ans20 à 64 ans65 ans et plus
  • a) Dressez le tableau croisé des effectifs, zone par tranche d'âge, avec ses totaux.
  • b) Calculez la fréquence marginale des 65 ans et plus dans l'agglomération. Pourquoi n'est-elle pas la moyenne de 20 %20\ \%, 15 %15\ \% et 32 %32\ \% ?
  • c) Premier titre : « Près d'un habitant des communes rurales sur trois a 65 ans ou plus. » Second titre : « Près d'un senior sur trois vit dans une commune rurale. » Calculez la fréquence que chaque titre utilise, et dites lequel est exact.
  • d) Un élu affirme : « C'est dans les communes rurales que vivent le plus de personnes de 65 ans et plus. » Qu'en pensez-vous ?
  • e) L'agglomération recrute 100100 livreurs pour un service de repas à domicile réservé aux 65 ans et plus, répartis entre les zones en proportion du nombre de seniors. Combien en affecte-t-elle à chaque zone ?

Tape tes réponses, la page te dit juste ou faux 0/12

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) Ville-centre : 26 40026\,400, 69 60069\,600, 24 00024\,000 ; périphérie : 25 20025\,200, 51 30051\,300, 13 50013\,500 ; rural : 7 2007\,200, 20 00020\,000, 12 80012\,800 ; totaux 58 80058\,800, 140 900140\,900, 50 30050\,300
  • b) 50 300250 000=20,12 %\dfrac{50\,300}{250\,000}=20{,}12\ \% : moyenne pondérée par la taille des zones, pas moyenne simple (22,3 %22{,}3\ \%)
  • c) Premier titre : 32 %32\ \%, exact ; second : 12 80050 300≈25,4 %\dfrac{12\,800}{50\,300}\approx 25{,}4\ \%, un sur quatre et non un sur trois
  • d) Faux : la ville-centre en compte 24 00024\,000, soit 47,7 %47{,}7\ \% des seniors, contre 12 80012\,800 en zone rurale
  • e) 4848 pour la ville-centre, 2727 pour la périphérie, 2525 pour les communes rurales

a) Les pourcentages de la figure sont des fréquences conditionnelles PARMI les habitants de chaque zone : on les multiplie par l'effectif de la zone. Ville-centre : 0,22×120 000=26 4000{,}22\times 120\,000=26\,400, 0,58×120 000=69 6000{,}58\times 120\,000=69\,600, 0,20×120 000=24 0000{,}20\times 120\,000=24\,000. Périphérie : 0,28×90 000=25 2000{,}28\times 90\,000=25\,200, 0,57×90 000=51 3000{,}57\times 90\,000=51\,300, 0,15×90 000=13 5000{,}15\times 90\,000=13\,500. Rural : 0,18×40 000=7 2000{,}18\times 40\,000=7\,200, 0,50×40 000=20 0000{,}50\times 40\,000=20\,000, 0,32×40 000=12 8000{,}32\times 40\,000=12\,800. Totaux des colonnes : moins de 20 ans 58 80058\,800, 20 à 64 ans 140 900140\,900, 65 ans et plus 50 30050\,300, et 58 800+140 900+50 300=250 00058\,800+140\,900+50\,300=250\,000 : le tableau se referme.

b) 50 300250 000=0,201 2\dfrac{50\,300}{250\,000}=0{,}201\,2, soit 20,12 %20{,}12\ \%. La moyenne simple 20+15+323≈22,3 %\dfrac{20+15+32}{3}\approx 22{,}3\ \% donnerait autant de poids aux 40 00040\,000 ruraux qu'aux 120 000120\,000 habitants de la ville-centre. La vraie fréquence est une moyenne pondérée par la taille des zones : 0,48×20+0,36×15+0,16×32=20,120{,}48\times 20+0{,}36\times 15+0{,}16\times 32=20{,}12, où 0,480{,}48, 0,360{,}36 et 0,160{,}16 sont les parts des trois zones dans la population.

c) Premier titre : « des habitants des communes rurales » : on compte parmi les 40 00040\,000 ruraux, et la figure donne directement 32 %32\ \%, un peu moins d'un sur trois. Il est EXACT. Second titre : « des seniors » : on compte parmi les 50 30050\,300 personnes de 65 ans et plus, dont 12 80012\,800 vivent en zone rurale, soit 12 80050 300≈25,4 %\dfrac{12\,800}{50\,300}\approx 25{,}4\ \%, à peine plus d'un sur quatre. Le second journal a repris le « un sur trois » du premier en échangeant la population de référence : la même case, 12 80012\,800 personnes, pèse 32 %32\ \% d'une zone et 25,4 %25{,}4\ \% d'une tranche d'âge.

d) C'est faux. Les communes rurales ont la plus forte FRÉQUENCE de seniors, 32 %32\ \%, mais c'est la ville-centre qui en compte le plus grand EFFECTIF, 24 00024\,000, contre 13 50013\,500 en périphérie et 12 80012\,800 en zone rurale. La ville-centre regroupe à elle seule 24 00050 300≈47,7 %\dfrac{24\,000}{50\,300}\approx 47{,}7\ \% des seniors de l'agglomération, parce qu'elle est trois fois plus peuplée que les communes rurales. L'élu confond « où les seniors sont-ils les plus fréquents » et « où sont-ils les plus nombreux », deux questions qui ont ici deux réponses différentes.

e) Le service suit les personnes âgées, donc la bonne fréquence est celle de chaque zone PARMI les seniors, total de la colonne, et non les 20 %20\ \%, 15 %15\ \%, 32 %32\ \% de la figure. Ville-centre : 100×24 00050 300≈47,7100\times\dfrac{24\,000}{50\,300}\approx 47{,}7, soit 4848 livreurs. Périphérie : 100×13 50050 300≈26,8100\times\dfrac{13\,500}{50\,300}\approx 26{,}8, soit 2727. Rural : 100×12 80050 300≈25,4100\times\dfrac{12\,800}{50\,300}\approx 25{,}4, soit 2525. Contrôle : 48+27+25=10048+27+25=100. Répartir avec les fréquences de la figure aurait envoyé le plus de livreurs à la campagne, là où vivent le moins de seniors.

Exercice 10 : Problème : créer une entreprise, et y survivre cinq ans

Un observatoire économique suit 2 0002\,000 entreprises créées la même année dans une région. Il relève leur taille à la création, variable ordinale, et leur situation cinq ans plus tard : encore active ou fermée. La figure donne la répartition des créations selon la taille.

Le rapport annuel ajoute trois phrases : « 55 %55\ \% des entreprises créées sans salarié sont encore actives cinq ans après. » « Au total, 62,5 %62{,}5\ \% des entreprises sont encore actives. » « Parmi les entreprises qui ont fermé, 24 %24\ \% avaient été créées avec 1 à 9 salariés. »

sans salarié60 %1 à 9 salariés30 %10 salariés et plus10 %répartition des entreprises créées selon leur taille
  • a) Calculez le nombre d'entreprises de chaque taille, puis le nombre d'entreprises encore actives et le nombre d'entreprises fermées.
  • b) Dressez le tableau croisé taille par situation. Précisez, pour la troisième phrase du rapport, dans quelle population on compte.
  • c) Calculez le taux de survie à cinq ans, c'est-à-dire la fréquence des entreprises actives, parmi chaque taille. Que montre ce classement ?
  • d) Un article affirme : « 72 %72\ \% des entreprises qui ont fermé avaient été créées sans salarié : se lancer seul, c'est l'échec assuré. » Vérifiez le nombre, puis discutez la conclusion.
  • e) On choisit au hasard une entreprise parmi les 2 0002\,000, chacune ayant la même chance d'être choisie. Elle a été créée avec 1 à 9 salariés : quelle est la probabilité qu'elle soit encore active ?

Tape tes réponses, la page te dit juste ou faux 0/11

a)
b)
c)
d)
e)
Voir la correction

Réponses

  • a) 1 2001\,200, 600600 et 200200 ; 1 2501\,250 actives et 750750 fermées
  • b) Sans salarié : 660660 et 540540 ; 1 à 9 : 420420 et 180180 ; 10 et plus : 170170 et 3030. Troisième phrase : parmi les 750750 fermées
  • c) 55 %55\ \%, 70 %70\ \% et 85 %85\ \% : la survie augmente avec la taille
  • d) 540750=72 %\dfrac{540}{750}=72\ \%, exact ; mais 55 %55\ \% des entreprises créées sans salarié survivent : conclusion fausse
  • e) 420600=0,7\dfrac{420}{600}=0{,}7, la fréquence conditionnelle lue dans le tableau

a) La figure donne des fréquences marginales, rapportées aux 2 0002\,000 créations : 0,60×2 000=1 2000{,}60\times 2\,000=1\,200 sans salarié, 0,30×2 000=6000{,}30\times 2\,000=600 de 1 à 9 salariés, 0,10×2 000=2000{,}10\times 2\,000=200 de 10 salariés et plus. La deuxième phrase du rapport est aussi marginale : 0,625×2 000=1 2500{,}625\times 2\,000=1\,250 entreprises actives, donc 2 000−1 250=7502\,000-1\,250=750 fermées.

b) Première phrase, « des entreprises créées sans salarié » : on compte parmi les 1 2001\,200, donc 0,55×1 200=6600{,}55\times 1\,200=660 actives et 540540 fermées. Troisième phrase, « parmi les entreprises qui ont fermé » : on compte cette fois parmi les 750750 fermées, total de la COLONNE, et non parmi les entreprises de 1 à 9 salariés. Donc 0,24×750=1800{,}24\times 750=180 fermées de 1 à 9 salariés, et 600−180=420600-180=420 actives. Les entreprises de 10 salariés et plus se déduisent des totaux : 1 250−660−420=1701\,250-660-420=170 actives et 750−540−180=30750-540-180=30 fermées, avec le contrôle 170+30=200170+30=200. Lire « 24 %24\ \% des entreprises de 1 à 9 salariés ont fermé » donnerait 144144 : un tableau faux qui ne se refermerait plus.

c) On compte parmi chaque taille, donc on divise par le total de la ligne : 6601 200=55 %\dfrac{660}{1\,200}=55\ \%, 420600=70 %\dfrac{420}{600}=70\ \%, 170200=85 %\dfrac{170}{200}=85\ \%. La variable étant ordinale, le classement a un sens : plus l'entreprise est grande à sa création, plus elle survit souvent. Le tableau montre une association, il ne dit pas pourquoi : une entreprise qui démarre avec dix salariés a souvent plus de capital, et c'est peut-être lui qui la protège.

d) Parmi les 750750 entreprises fermées, 540540 avaient été créées sans salarié : 540750=0,72\dfrac{540}{750}=0{,}72, le nombre est exact. Mais il répond à « d'où viennent les fermetures ? », et il dépend d'abord de ce que les entreprises sans salarié sont les plus nombreuses, 60 %60\ \% des créations. On peut dire qu'elles sont surreprésentées parmi les fermetures, 72 %72\ \% contre 60 %60\ \%, ce qui va dans le sens de c). En revanche « l'échec assuré » est faux : parmi les entreprises créées sans salarié, 55 %55\ \% sont encore actives cinq ans après, plus d'une sur deux. Pour juger le risque d'une catégorie, c'est la fréquence PARMI cette catégorie qu'il faut lire.

e) Choisir au hasard avec la même chance pour chacune fait de la fréquence une probabilité. Sachant que l'entreprise a été créée avec 1 à 9 salariés, on se place dans cette sous-population de 600600 entreprises, dont 420420 actives : la probabilité vaut 420600=0,7\dfrac{420}{600}=0{,}7. C'est exactement la fréquence conditionnelle de c), et c'est ainsi que le tableau croisé mène aux probabilités conditionnelles, traitées dans la série qui leur est consacrée.

Chapitre précédent Les statistiques descriptives Chapitre suivant Probabilités conditionnelles et arbres pondérés

Ce chapitre resservira dans

Les chapitres qui le réclament en amont, plus tard dans l'année ou dans les années suivantes.

© Ahmed Squalli Houssaini. Série publiée sur www.letuteurscientifique.ca/exercices/2nde-tableaux-croises. Libre pour l'usage personnel et en classe ; sa republication ailleurs demande une autorisation écrite (mentions légales).

Voir aussi

Les tableaux croisés bloquent en Seconde à Montréal ?

Contactez-moi pour une première séance. Ce chapitre prépare directement les probabilités conditionnelles de Première et de Terminale : un élève qui ne sait pas nommer la population de référence se trompera de dénominateur pendant tout le lycée.

Site par Studio Squalli