Enseignement scientifique, Terminale • Programme français, lycées de Montréal
Fiche de révision : de la machine de Turing à l'intelligence artificielle
Cette fiche de révision accompagne le sous-thème « De la machine de Turing à l'intelligence artificielle » de l'enseignement scientifique de Terminale, programme révisé en 2023 : machine universelle, programmes et fichiers, taille d'un texte, bogues, apprentissage automatique, biais, corrélation, tableau de contingence et inférence bayésienne.
Elle ne redit pas le cours. Elle dit ce qui coûte des points dans une question sur document, ce que le correcteur attend exactement, et les contrôles à faire avant de rendre la copie. Elle s'adresse à tous les élèves de Terminale générale, avec ou sans spécialité scientifique.
Marque ici la fiche comme lue ou mets-la en favori : un compte gratuit, sans mot de passe, retient tes fiches lues et tes favoris d'une visite à l'autre et te dit quel chapitre attaquer ensuite. Crée ton espace, un courriel suffit.
Le fil du chapitre
Une machine ne sait que ce qu'on lui a donné : des instructions quand on la programme, des exemples quand elle apprend. Chaque erreur se remonte à l'une ou à l'autre, et elle se compte : un octet oublié, une borne exclue, un groupe absent des données, un dénominateur pris dans la mauvaise population.
•Une machine à tâche prédéterminée accepte des réglages mais fait toujours le même travail : le métier Jacquard ne sait que tisser, quelles que soient ses cartes.
•La MACHINE UNIVERSELLE, proposée par Turing en 1936 et construite une dizaine d'années plus tard, exécute n'importe quel programme rangé dans sa mémoire. Minimum : un processeur et une mémoire vive.
•Un programme est une DONNÉE : il se stocke, se copie, se télécharge et se traite. Un programme Python est un texte, traduit en instructions propres à chaque type de processeur ; un fichier .exe contient déjà ces instructions, pour un processeur et un système donnés.
•En ASCII, 1 caractère =1 octet =8 bits, espaces et fins de ligne compris. Page de 40 lignes de 80 caractères : 40×81=3240 octets.
•Ordres de grandeur : une page, quelques ko ; un livre, environ 1 Mo ; une photo ou une chanson, quelques Mo ; une heure de vidéo, de l'ordre du Go.
Un programme juste pour les données prévues peut échouer sur d'autres : c'est l'histoire du premier vol d'Ariane 5, en 1996.
Machines qui apprennent : les données décident
•L'IA naît en 1956. Aujourd'hui, le mot désigne surtout l'APPRENTISSAGE AUTOMATIQUE : l'algorithme améliore ses résultats à partir de DONNÉES D'ENTRAÎNEMENT, pas de règles écrites à la main.
•Une COURBE DE TENDANCE résume des données d'entraînement et estime une valeur inconnue, de confiance DANS la plage des données seulement.
•Un modèle ne vaut que pour la population que ses données représentent : c'est le BIAIS. Une moyenne globale peut cacher un groupe mal servi.
•Une CORRÉLATION n'est pas une CAUSE : facteur caché, hasard, ou causalité inverse.
•Tableau de CONTINGENCE : chaque pourcentage du fabricant se compte dans une COLONNE (malades ou sains) ; la question du patient se compte dans une LIGNE (positifs ou négatifs).
La sensibilité se lit dans la colonne ombrée des fractures : 300282=0,94. Le reste du tableau n'intervient pas.
Écrire « on compte parmi les ... » avant chaque division rapporte le point de méthode et évite la moitié des erreurs du tableau.
Les pièges qui coûtent des points
Les erreurs ci-dessous sont celles que je corrige le plus souvent en séance. Chacune coûte des points sur une copie, même quand le raisonnement est juste.
1.Prendre la sensibilité pour la probabilité d'être malade
toute la question, et souvent la conclusion
Ce qu'il ne faut pas écrire
« Le logiciel détecte 94% des fractures, donc une radio signalée a 94% de chances de montrer une fracture. »
Ce qu'il faut écrire
« On compte parmi les 486 radios signalées : 486282≈0,58. La sensibilité 300282 se compte parmi les fractures. »
Même case 282 qu'au-dessus, mais on divise par la ligne ombrée des positifs : 486282≈0,58, et non 0,94.
Pourquoi : Même case 282, deux dénominateurs. Les 204 faux positifs, pris parmi 1700 radios sans fracture, gonflent la ligne des positifs : c'est le cœur de l'inférence bayésienne.
2.Appliquer le taux d'erreur à toute la population
tout le tableau, donc 2 à 3 points
Ce qu'il ne faut pas écrire
« Spécificité 88%, donc 12% de faux positifs : 0,12×2000=240. »
Ce qu'il faut écrire
« Les 12% s'appliquent aux 1700 radios sans fracture : 0,12×1700=204 faux positifs. »
Pourquoi : La spécificité est mesurée sur les sains : chaque pourcentage s'applique à la colonne qu'il décrit, jamais au total.
3.Oublier les espaces et les fins de ligne
1 point
Ce qu'il ne faut pas écrire
« La page a 40 lignes de 80 caractères, dont 12 espaces par ligne : 40×68=2720 octets. »
Ce qu'il faut écrire
« Chaque ligne compte 80 caractères, espaces compris, plus 1 fin de ligne : 40×81=3240 octets. »
Pourquoi : Un espace est un caractère comme un autre, et la fin de ligne est un caractère invisible mais bien présent dans le fichier.
4.Compter 7 bits par caractère, ou confondre bit et octet
1 point, et un facteur 8 dans toute la suite
Ce qu'il ne faut pas écrire
« Le code ASCII tient sur 7 bits, donc la page pèse 3240×7=22680 bits. »
Ce qu'il faut écrire
« Chaque caractère occupe un octet dans le fichier : 3240×8=25920 bits, soit 3240 octets. »
Pourquoi : Le CODE tient sur 7 bits, mais le FICHIER range chaque caractère dans un octet entier. On demande la taille du fichier.
5.Prolonger une courbe de tendance loin des données
la question, et la crédibilité de la conclusion
Ce qu'il ne faut pas écrire
« Avec 10000 exemples, le modèle réussira 5,5×10+54,9=109,9% des cas. »
Ce qu'il faut écrire
« Les données s'arrêtent à 5000 exemples ; au-delà, c'est une extrapolation, et un taux ne dépasse pas 100% : la droite ne décrit plus rien. »
La droite suit les cinq points ; prolongée en pointillé, elle franchit le plafond de 100% vers 8200 exemples. L'extrapolation est absurde.
Pourquoi : Une tendance ne vaut que dans la plage où elle a été observée. Une réussite qui plafonne ne peut pas suivre une droite indéfiniment.
6.Conclure à une cause à partir d'une corrélation
toute la question d'argumentation
Ce qu'il ne faut pas écrire
« Les patients asthmatiques meurent moins de pneumonie : l'asthme protège. »
Ce qu'il faut écrire
« La corrélation s'explique par un facteur caché : les asthmatiques sont admis en soins intensifs. À soins égaux, l'asthme aggrave le risque. »
Pourquoi : Un algorithme repère des régularités sans savoir d'où elles viennent. Chercher la troisième grandeur qui commande les deux autres est le réflexe attendu.
7.Croire qu'il suffit d'ajouter des données pour supprimer un biais
1 à 2 points
Ce qu'il ne faut pas écrire
« Le modèle se trompe sur les peaux foncées : on double la base et le problème disparaît. »
Ce qu'il faut écrire
« Doubler la base garde les peaux foncées à 4% : il faut ajouter des exemples de ce groupe, puis publier les résultats groupe par groupe. »
Pourquoi : La quantité ne corrige pas la représentativité. Un déséquilibre recopié à l'identique reste un déséquilibre.
8.Écrire une inégalité stricte là où la borne est permise
la question de correction du programme
Ce qu'il ne faut pas écrire
« if v > 6 and v < 16 » pour tester une valeur comprise entre 6 et 16 inclus.
Ce qu'il faut écrire
« if v >= 6 and v <= 16 », puis tester exprès 6, 16 et leurs voisins 5 et 17.
En haut, points creux : les bornes 6 et 16 sont refusées à tort. En bas, points pleins : la version corrigée les accepte.
Pourquoi : L'erreur de borne est le bogue le plus fréquent : le programme répond juste partout sauf aux deux cas limites, qu'un test au hasard ne rencontre jamais.
9.Confondre machine programmable et machine universelle
1 point d'argumentation
Ce qu'il ne faut pas écrire
« Le métier Jacquard lit des cartes perforées, donc c'est un ordinateur. »
Ce qu'il faut écrire
« Ses cartes choisissent un motif, pas une tâche : le métier ne sait que tisser. Un ordinateur exécute n'importe quel programme rangé en mémoire. »
Pourquoi : Être commandé par une information ne suffit pas : la machine universelle change ce qu'elle fait, pas seulement la façon de faire toujours la même chose.
Quelle méthode choisir
Quelle démarche, selon ce que demande l'énoncé
Le verbe et la grandeur demandés dans la question
Si « Calculer la taille » d'un texte → Compter les caractères, espaces et fins de ligne compris, à 1 octet chacun, puis convertir
Exemple : 40×81=3240 octets, soit 3,24 ko ou 25920 bits
Si « Corriger » un programme bogué → Tester à la main les cas limites, bornes et valeurs voisines, avant les cas ordinaires
Exemple : v = 6 et v = 16 révèlent l'inégalité stricte
Si « Estimer » une valeur à partir de données → Utiliser la courbe de tendance, après avoir vérifié que la valeur est dans la plage des données
Exemple : 3000 exemples : 5,5×3+54,9=71,4%, dans la plage
Si « Probabilité d'être malade sachant le résultat » → Tableau de contingence sur l'effectif donné, puis diviser par le total de la LIGNE du résultat
Exemple : 486282≈0,58
Si Deux grandeurs varient ensemble → Chercher un facteur caché, le hasard ou le sens inverse avant de parler de cause
Exemple : asthme et soins intensifs
Si Un modèle se trompe plus sur un groupe → Regarder la part de ce groupe dans les données d'entraînement
Exemple : 400 images sur 10000, soit 4%
une moyenne globale ne suffit jamais à juger un modèle
Aucune formule de probabilité n'est exigée : un tableau de contingence bien rempli donne toutes les réponses, et il se contrôle par ses totaux.
La rédaction attendue
Le correcteur coche des étapes. Les voici dans l'ordre, avec la phrase de conclusion qu'il attend mot pour mot.
Répondre à une question de diagnostic par un tableau de contingence
Quand l'utiliser : L'énoncé donne une proportion de malades, une sensibilité et une spécificité, et demande ce que vaut un résultat
1Calculer les totaux de colonnes : malades et non-malades dans l'effectif donné.
2Appliquer la sensibilité à la colonne des malades : vrais positifs, puis faux négatifs par différence.
3Appliquer la spécificité à la colonne des non-malades : vrais négatifs, puis faux positifs par différence.
4Calculer les totaux de lignes et contrôler que tout retombe sur l'effectif.
5Écrire « on compte parmi les positifs » puis diviser la bonne case par le total de la ligne.
6Conclure par une phrase qui compare cette probabilité à la sensibilité annoncée.
Phrase de conclusion
« Sur 2000 radios, 300 montrent une fracture, dont 282 sont signalées, et 1700 n'en montrent pas, dont 204 sont signalées à tort : 486 radios sont signalées. On compte parmi elles : 486282≈0,58. Une radio signalée montre une fracture dans 58% des cas environ, bien moins que les 94% de la sensibilité. »
Le piège : Diviser par le total des malades au lieu du total des positifs : on recalcule alors la sensibilité.
Barème : 1 point pour les totaux de colonnes, 2 points pour le tableau complet et contrôlé, 1 point pour la division par le bon total, 1 point pour la phrase de conclusion.
Montrer qu'une corrélation n'est pas une causalité
Quand l'utiliser : Un document présente deux grandeurs qui varient ensemble et en tire une conclusion
1Reconnaître la corrélation, chiffres à l'appui : elle est réelle.
2Nommer un facteur caché plausible qui agit sur les deux grandeurs.
3Comparer à facteur caché égal, si le document le permet.
4Dire ce que l'on peut conclure et ce que l'on ne peut pas conclure.
Phrase de conclusion
« Les deux grandeurs sont bien corrélées, mais cette corrélation ne prouve pas que l'une cause l'autre : les deux dépendent de ..., et à ... égal, l'écart disparaît ou s'inverse. »
Le piège : Nier la corrélation au lieu de la reconnaître : elle est dans les données, c'est son interprétation qui est fausse.
Vérifier avant de rendre
Cinq minutes de vérification récupèrent plus de points qu'un exercice de plus commencé à la hâte.
Le tableau retombe sur ses totaux
Chaque ligne et chaque colonne doit retomber sur son total, et le coin en bas à droite sur l'effectif de l'énoncé.
282+18=300, 204+1496=1700, 486+1514=2000. Une case à 240 ferait dépasser 2000.
Le dénominateur est plus petit que l'effectif
Une probabilité « sachant » se calcule dans un sous-groupe : son dénominateur est une ligne ou une colonne, jamais l'effectif total.
2000282 dans une réponse « parmi les radios signalées » : le dénominateur devait être 486.
L'ordre de grandeur d'une taille de fichier
Une page de texte fait quelques ko, un livre environ 1 Mo. Un résultat de plusieurs Mo pour une page trahit un facteur 1 000 ou un facteur 8.
3240 octets pour une page : cohérent. 25920 « octets » : ce sont des bits.
La valeur estimée est dans la plage des données
Avant d'utiliser une courbe de tendance, comparer la valeur demandée à la plus petite et à la plus grande des données d'entraînement, et vérifier que le résultat reste possible.
Un taux de réussite de 109,9% signale une extrapolation hors de propos.
L'exercice type décortiqué
Un logiciel qui lit des radiographies du poignet
Un logiciel d'apprentissage automatique signale les radiographies du poignet qui montrent une fracture. Sur 2000 radiographies, 15% montrent une fracture. Le logiciel signale 94% des radios avec fracture, et laisse passer, sans les signaler, 88% des radios sans fracture.
Une radio vient d'être signalée. Quelle est la probabilité qu'elle montre réellement une fracture ? Et quelle est la fréquence des faux négatifs parmi toutes les radios ?
Étape 1
Totaux de colonnes : 0,15×2000=300 radios avec fracture, 2000−300=1700 sans.
Pourquoi
Les pourcentages du logiciel sont mesurés sur des radios dont on connaît déjà le diagnostic : il faut d'abord ces deux effectifs pour les appliquer.
Les 12% d'erreur portent sur les 1700 radios saines, pas sur les 2000 : c'est le piège qui coûte le tableau.
Étape 4
Lignes : 282+204=486 radios signalées, 18+1496=1514 non signalées ; 486+1514=2000.
Pourquoi
Le contrôle des totaux attrape toute erreur de colonne avant qu'elle ne passe dans la réponse.
Étape 5
On compte parmi les 486 radios signalées : 486282≈0,58. Faux négatifs : 200018=0,009, soit 0,9%.
Pourquoi
La question part du résultat, la radio signalée : c'est la ligne des positifs qui sert de dénominateur. On remonte de l'effet à la cause, c'est l'inférence bayésienne.
Conclusion rédigée
Une radio signalée montre une fracture dans environ 58% des cas, bien moins que les 94% de la sensibilité, parce que les 204 fausses alertes viennent d'un groupe plus de cinq fois plus nombreux. Les faux négatifs ne concernent que 0,9% des radios, mais ce sont des fractures manquées.
L'erreur classique sur cet exercice : Répondre 0,94 : c'est la probabilité d'être signalée sachant qu'il y a une fracture, pas l'inverse.
À savoir par cœur
•Machine universelle : Turing, 1936 ; premiers ordinateurs à programme enregistré, vers 1948.
•Un ordinateur, au minimum : un processeur et une mémoire vive.
•Un programme est une DONNÉE : il se stocke, se transporte, se traduit.
•ASCII : 1 caractère =1 octet =8 bits, espaces et fins de ligne COMPRIS.
•Page : quelques ko ; livre : 1 Mo ; photo, chanson : quelques Mo ; heure de vidéo : 1 Go.
•IA : née en 1956 ; aujourd'hui surtout l'apprentissage automatique, qui apprend de données.
•Courbe de tendance : on estime DANS la plage des données, pas au-delà.
•Biais : un modèle ne vaut que pour la population de ses données d'entraînement.
•Corrélation n'est pas causalité : facteur caché, hasard, sens inverse.
•Tableau de contingence : le fabricant compte en COLONNE, le patient en LIGNE.
Questions fréquentes
Comment calculer la taille d'une page de texte en ASCII ?
On compte tous les caractères de la page, espaces compris, et on ajoute un caractère de fin de ligne par ligne. En ASCII, chaque caractère occupe un octet dans le fichier. Une page de quarante lignes de quatre-vingts caractères pèse donc quarante fois quatre-vingt-un, soit 3 240 octets, environ 3 ko, ou 25 920 bits puisqu'un octet vaut huit bits.
Quelle est la différence entre corrélation et causalité en enseignement scientifique ?
Deux grandeurs sont corrélées quand elles varient ensemble. Il y a causalité quand la variation de l'une provoque celle de l'autre. Une corrélation peut venir d'un facteur caché qui agit sur les deux, du hasard, ou d'une cause qui va dans l'autre sens. Pour parler de cause, il faut une expérience contrôlée ou un mécanisme qui l'explique, pas seulement des données.
Pourquoi un test fiable à 94 % ne donne-t-il pas 94 % de chances d'être malade ?
Les 94 % se comptent parmi les malades : ils disent quelle part des malades le test détecte. La personne testée positive se trouve, elle, parmi tous les positifs, qui comprennent aussi les faux positifs venus du groupe des non-malades, souvent bien plus nombreux. On dresse un tableau de contingence et on divise les vrais positifs par le total des positifs.
Qu'est-ce qu'un biais dans les données d'une intelligence artificielle ?
C'est un déséquilibre entre les données d'entraînement et la population à laquelle le modèle sera appliqué. Un groupe peu représenté dans les exemples est moins bien traité, et une moyenne globale élevée peut le cacher. Ajouter des données du même genre ne suffit pas : il faut des exemples représentatifs et une évaluation groupe par groupe.
Qu'est-ce que la machine universelle de Turing ?
C'est une machine décrite par Alan Turing en 1936, capable d'exécuter n'importe quel programme qu'on lui fournit comme une donnée. Les machines d'avant, comme le métier Jacquard ou la tabulatrice, ne faisaient qu'une tâche. L'idée a été réalisée une dizaine d'années plus tard par les premiers ordinateurs, qui rangent leur programme dans leur mémoire.
Passer à la pratique
Exercices corrigés : De la machine de Turing à l'intelligence artificielle
Une méthode se prouve sur une copie, pas sur une fiche. La série du même chapitre reprend chacun de ces pièges dans un exercice, avec le corrigé rédigé étape par étape.
Vous cherchez un tuteur pour l'enseignement scientifique à Montréal ?
Contactez-moi pour une première séance. Ce sous-thème demande peu de calcul et beaucoup de précision dans l'argumentation : c'est exactement ce qui se travaille bien en séance.