SNT Seconde • Programme français, lycées de Montréal

Fiche de révision : les données structurées en SNT

Le thème des données structurées est le plus rentable de la SNT : les mêmes quatre opérations reviennent chaque année, et les erreurs sont toujours les mêmes cinq. Cette fiche les nomme et donne la phrase exacte à écrire pour chacune.

Le fil du chapitre

Une valeur n'est une donnée que par son DESCRIPTEUR : tant que la colonne n'est pas nommée, on n'a que des caractères, et tout calcul est prématuré.

Ce chapitre fait partie de SNT en Seconde

L'essentiel

Le vocabulaire qui décide de tout

  • Une DONNÉE est une valeur ; son DESCRIPTEUR est le nom de la colonne qui dit ce qu'elle mesure ; une MÉTADONNÉE est une donnée qui décrit une autre donnée.
  • Dans une table, une ligne est un ENREGISTREMENT et une colonne un descripteur. La ligne d'en-tête n'est pas un enregistrement.
  • SÉLECTION : on garde des lignes. PROJECTION : on garde des colonnes. Seule la projection peut créer des doublons.
  • Un fichier CSV est du TEXTE : toutes ses valeurs sont des chaînes, y compris celles qui ressemblent à des nombres.
nomvilletempS01Montréal-4,5S02Québec-9,2S03Sherbrooke-7,8en-tête, pas une donnée3 enregistrements
Le crochet de gauche sépare la ligne des descripteurs des vraies données : le fichier a quatre lignes et seulement trois enregistrements.

Les trois quarts des erreurs du chapitre viennent d'un décompte : une ligne comptée en trop, une colonne oubliée, un doublon non vu.

Trier, agréger, fusionner

  • Tri à plusieurs clés : la PREMIÈRE clé décide, la seconde ne départage que les égalités. Changer l'ordre change le résultat.
  • Un tri STABLE conserve l'ordre initial des lignes de même clé : c'est ce qui permet un tri à deux clés en deux passes, en commençant par la MOINS prioritaire.
  • Agréger un rapport : somme des numérateurs divisée par somme des dénominateurs, jamais moyenne des rapports.
  • Fusionner : la correspondance se fait par la VALEUR de la clé, jamais par la position de la ligne.

Les pièges qui coûtent des points

Les erreurs ci-dessous sont celles que je corrige le plus souvent en séance. Chacune coûte des points sur une copie, même quand le raisonnement est juste.

1. On demande combien d'enregistrements contient un fichier CSV de 500 lignes.

1 point, et toutes les moyennes calculées ensuite

Ce qu'il ne faut pas écrire

« Le fichier a 500 lignes, donc 500 enregistrements. »

Ce qu'il faut écrire

« La première ligne porte les descripteurs : le fichier contient 5001=499500 - 1 = 499 enregistrements. »

Pourquoi : L'en-tête ressemble à une ligne de données et n'en est pas une. Toute moyenne calculée sur 500 au lieu de 499 est fausse, d'un écart petit mais suffisant pour manquer le résultat attendu.

2. On additionne deux valeurs lues dans un fichier CSV.

2 points, et un message d'erreur incompréhensible en machine

Ce qu'il ne faut pas écrire

« La température vaut 7,8-7{,}8, donc je calcule 7,8+1-7{,}8 + 1. »

Ce qu'il faut écrire

« Les valeurs lues sont des chaînes de caractères : il faut les convertir en nombres avant tout calcul. »

Pourquoi : Le découpage d'une ligne ne devine aucun type. Sans conversion, une addition échoue et une comparaison donne un ordre ALPHABÉTIQUE, où « 10 » passe avant « 9 ».

3. On calcule un taux moyen sur plusieurs groupes d'effectifs différents.

3 points, tout l'exercice d'agrégation

Ce qu'il ne faut pas écrire

« Le groupe A affiche 40 pour cent, le groupe B 80 pour cent, donc la moyenne vaut 60 pour cent. »

Ce qu'il faut écrire

« Je somme les numérateurs, je somme les dénominateurs, et je divise une seule fois : le taux réel vaut 72 pour cent. »

A : 2 relevés40B : 8 relevés80moyenne des taux60taux réel72020406080
Les deux groupes affichent 40 et 80 pour cent, mais le second pèse quatre fois plus : le taux réel vaut 72 et non 60.

Pourquoi : La moyenne des taux donne le même poids à un groupe de 2 relevés et à un groupe de 8. Le poids est toujours le DÉNOMINATEUR de la grandeur moyennée.

4. On trie une table par ville, puis par température décroissante à ville égale.

2 points

Ce qu'il ne faut pas écrire

« Je trie d'abord par ville, puis par température. »

Ce qu'il faut écrire

« Avec un tri stable en deux passes, je trie d'abord par TEMPÉRATURE, la clé la moins prioritaire, puis par ville. »

Pourquoi : Dans un tri stable à deux passes, c'est le DERNIER tri qui devient le critère principal. Trier d'abord par ville puis par température range en réalité par température.

5. On fusionne deux tables reliées par un code de station.

3 points, et un résultat plausible mais entièrement faux

Ce qu'il ne faut pas écrire

« La première ligne de gauche va avec la première ligne de droite. »

Ce qu'il faut écrire

« Chaque ligne de gauche va avec la ligne de droite qui porte la MÊME VALEUR de clé, quelle que soit sa position. »

S12BeaubienS07412S07RosemontS03377S03BerriS12290S21PapineauS05158les lignes ne sont pas en face
Les flèches croisent : la station de la première ligne à gauche correspond à la troisième ligne à droite.

Pourquoi : Rien n'impose que deux tables soient triées de la même façon. Une fusion par position produit un tableau qui a l'air correct et attribue à chaque station les relevés d'une autre.

6. On demande la liste des arrondissements présents, sans répétition.

1 point

Ce qu'il ne faut pas écrire

« Je projette la table sur la colonne arrondissement, et j'ai la liste. »

Ce qu'il faut écrire

« La projection donne autant de lignes que la table ; il faut ensuite ÉLIMINER LES DOUBLONS pour obtenir les valeurs distinctes. »

Pourquoi : Projeter réduit les colonnes, jamais les lignes. Deux lignes qui différaient seulement par une colonne supprimée deviennent identiques : la projection CRÉE les doublons.

7. On juge de la sécurité d'un jeu de données publié sans les noms.

2 points, et la conclusion de l'exercice

Ce qu'il ne faut pas écrire

« Il n'y a plus de nom, donc le fichier est anonyme. »

Ce qu'il faut écrire

« Le croisement du code postal, de la date de naissance et du sexe suffit à isoler une personne dans une population de 21 400 : le fichier n'est pas anonyme. »

Pourquoi : Une donnée est identifiante par RECOUPEMENT. La question n'est jamais « y a-t-il un nom » mais « combien de personnes partagent ce profil ».

8. On calcule le temps de transfert d'un fichier sur une liaison donnée.

2 points

Ce qu'il ne faut pas écrire

« Le fichier fait 1 Go et la liaison 1 Gbit/s, donc une seconde. »

Ce qu'il faut écrire

« Un octet vaut 8 bits : le transfert demande au minimum 8×1=88 \times 1 = 8 secondes. »

Pourquoi : Un débit s'annonce en bits, un volume se compte en octets. Oublier le facteur 8 est l'erreur la plus répandue de tout le programme de SNT.

Quelle méthode choisir

Quelle opération la question demande-t-elle ?

Regarder si la question porte sur des lignes, des colonnes, un ordre ou un résumé.

  • Si La question dit « ceux qui », « uniquement les », une condition c'est une SÉLECTION : on garde des lignes, on n'enlève aucune colonne

    Exemple : Les stations de l'arrondissement Le Plateau : 2 lignes sur 6.

    Le nombre de colonnes du résultat est inchangé.

  • Si La question dit « la liste des noms », « avec seulement » c'est une PROJECTION : on garde des colonnes, toutes les lignes restent

    Exemple : La colonne ville seule : 6 lignes, dont 3 valeurs distinctes.

    Penser aux doublons : la projection peut en créer.

  • Si La question dit « classer », « du plus grand au plus petit » c'est un TRI : identifier la clé principale et l'ordre

    Exemple : Par température croissante : S02, S03, S05, S01, S04.

    S'il y a deux clés, trier d'abord sur la moins prioritaire.

  • Si La question dit « en tout », « en moyenne », « par arrondissement » c'est une AGRÉGATION : grouper, puis sommer ou moyenner

    Exemple : Taux par arrondissement : somme des vélos sur somme des bornes.

    Pour un rapport, sommer séparément le haut et le bas.

Quatre formulations, quatre opérations. Les nommer dans la copie rapporte souvent un point à elle seule.

La rédaction attendue

Le correcteur coche des étapes. Les voici dans l'ordre, avec la phrase de conclusion qu'il attend mot pour mot.

Rédiger une agrégation sur plusieurs groupes

Quand l'utiliser : Dès qu'une question demande une moyenne, un taux ou une proportion sur des groupes d'effectifs différents.

  1. 1 Écrire les totaux de chaque groupe, numérateur et dénominateur séparément.
  2. 2 Écrire le total général, en sommant chaque colonne indépendamment.
  3. 3 Diviser UNE SEULE FOIS, à la fin, et donner l'unité.
  4. 4 Comparer explicitement à la moyenne des taux, pour montrer que l'écart est compris.

Phrase de conclusion

« Le taux global vaut la somme des vélos divisée par la somme des bornes, soit 1 718/15810,871\ 718 / 158 \approx 10{,}87 trajets par borne, et non la moyenne des trois taux, qui vaudrait 10,4910{,}49 et donnerait le même poids à un arrondissement de 42 bornes et à un de 58. »

Le piège : Donner les deux valeurs sans dire laquelle est correcte. Le correcteur attend la justification, pas le choix.

Barème : 1 point pour chaque total, 1 pour la division unique, 1 pour la comparaison justifiée.

Vérifier avant de rendre

Cinq minutes de vérification récupèrent plus de points qu'un exercice de plus commencé à la hâte.

L'exercice type décortiqué

Six stations, un taux par arrondissement

Six stations réparties en trois arrondissements. Ville-Marie : 31 et 27 bornes, 418 et 236 trajets. Rosemont : 23 et 19 bornes, 184 et 97 trajets. Le Plateau : 35 et 23 bornes, 512 et 271 trajets. Donner le nombre de trajets par borne pour chaque arrondissement, puis pour la ville entière.

Étape 1

Ville-Marie : 31+27=5831 + 27 = 58 bornes et 418+236=654418 + 236 = 654 trajets.

Pourquoi

On somme SÉPARÉMENT les deux colonnes avant toute division : c'est ce geste, et lui seul, qui rend l'agrégation correcte.

Étape 2

Rosemont : 42 bornes et 281 trajets. Le Plateau : 58 bornes et 783 trajets.

Pourquoi

Même geste sur chaque groupe. Les effectifs diffèrent, 42 contre 58 : c'est déjà l'indice qu'une moyenne non pondérée sera fausse.

Étape 3

Taux : 654/5811,28654/58 \approx 11{,}28, 281/426,69281/42 \approx 6{,}69, 783/5813,50783/58 \approx 13{,}50.

Pourquoi

Une division par groupe, une seule fois chacune. On garde deux décimales : la précision de l'énoncé ne justifie pas davantage.

Étape 4

Ville entière : 654+281+783=1 718654 + 281 + 783 = 1\ 718 trajets et 58+42+58=15858 + 42 + 58 = 158 bornes, donc 1 718/15810,871\ 718 / 158 \approx 10{,}87.

Pourquoi

On repart des totaux, jamais des trois taux. C'est exactement ici que se joue le point de l'exercice.

Étape 5

La moyenne des trois taux vaudrait (11,28+6,69+13,50)/310,49(11{,}28 + 6{,}69 + 13{,}50)/3 \approx 10{,}49, valeur DIFFÉRENTE.

Pourquoi

Écrire la valeur fausse et dire pourquoi elle l'est montre au correcteur que le piège a été vu, ce qui vaut plus que le seul bon résultat.

Conclusion rédigée

Les taux valent 11,28, 6,69 et 13,50 trajets par borne, et le taux de la ville vaut 10,87, obtenu en divisant le total des trajets par le total des bornes.

L'erreur classique sur cet exercice : Donner 10,49 en moyennant les trois taux, ce qui attribue le même poids à Rosemont, qui n'a que 42 bornes, qu'au Plateau, qui en a 58.

À savoir par cœur

  • Ligne d'en-tête : jamais un enregistrement. 500 lignes font 499 données.
  • Toute valeur lue dans un CSV est du TEXTE : convertir avant de calculer.
  • Sélection : des lignes. Projection : des colonnes. Seule la projection crée des doublons.
  • Tri à deux clés en deux passes : commencer par la MOINS prioritaire.
  • Agrégation d'un rapport : somme sur somme, jamais moyenne de moyennes.
  • Fusion : correspondance par la VALEUR de la clé, jamais par la position.
  • Avant une fusion, vérifier que la clé est unique dans au moins une des deux tables.
  • 11 octet =8= 8 bits ; 11 kio =1 024= 1\ 024 octets. Un débit est en bits, un volume en octets.

Questions fréquentes

Combien d'enregistrements contient un fichier CSV de 500 lignes ?

Quatre cent quatre-vingt-dix-neuf, si la première ligne porte les noms de colonnes, ce qui est le cas habituel. Cette ligne d'en-tête décrit les données, elle n'en est pas une. Compter les 500 lignes fausse ensuite toutes les moyennes, d'un écart petit mais suffisant pour manquer la valeur attendue.

Pourquoi une moyenne de pourcentages est-elle souvent fausse ?

Parce qu'elle donne le même poids à chaque groupe, quel que soit son effectif. Si un groupe de deux relevés affiche quarante pour cent et un groupe de huit relevés quatre-vingts, la moyenne simple donne soixante alors que le taux réel vaut soixante-douze. Il faut sommer séparément les numérateurs et les dénominateurs, puis diviser une seule fois.

Comment trier une table par ville puis par température ?

Avec un tri stable, on procède en deux passes et l'on commence par la clé la moins prioritaire. On trie donc d'abord par température, puis par ville. La stabilité garantit que deux lignes de même ville conserveront l'ordre donné par le premier tri. Faire l'inverse produit un classement par température, pas par ville.

Un fichier sans nom ni prénom est-il anonyme ?

Non. Le croisement de quelques attributs banals suffit à isoler une personne : le code postal, la date de naissance et le sexe réduisent une population de vingt et un mille personnes à une trentaine, et l'ajout de la profession à une seule. La bonne question n'est pas s'il reste un nom, mais combien de personnes partagent chaque profil.

Pourquoi 1 kilooctet ne vaut-il pas 1 000 octets ?

Parce que les adresses mémoire sont binaires : les tailles naturelles d'un ordinateur sont les puissances de deux. Un kibioctet vaut donc deux puissance dix, soit mille vingt-quatre octets. Le préfixe kilo au sens strict vaut bien mille, et c'est pour lever l'ambiguïté que les préfixes kibi, mébi et gibi ont été créés.

Passer à la pratique

Exercices corrigés : Les données structurées : tables, tri, fusion et agrégation

Une méthode se prouve sur une copie, pas sur une fiche. La série du même chapitre reprend chacun de ces pièges dans un exercice, avec le corrigé rédigé étape par étape.

  • 10 exercices corrigés
  • 100 points
  • 120 minutes
Faire les exercices
Fiche précédente Les réseaux sociaux : graphes, données et recommandation Fiche suivante Localisation, cartographie et mobilité

Ce chapitre resservira dans

Les chapitres qui le réclament en amont, plus tard dans l'année ou dans les années suivantes.

Voir aussi

Vous cherchez un tuteur en SNT à Montréal ?

Contactez-moi pour une première séance. Le thème des données structurées est celui qui sert le plus longtemps : c'est le même raisonnement qu'en NSI en Première, puis en base de données en Terminale, et il se met en place en deux séances.

Site par Studio Squalli