Résumé de section

  • Le cours DSC 445 — Machine Learning I est une unité d'enseignement avancée qui introduit les concepts fondamentaux et les techniques de l'apprentissage automatique tels qu'ils sont employés en science des données et en intelligence artificielle. L'étudiant y apprend les algorithmes de classification et de partitionnement, les méthodes d'évaluation des modèles, ainsi que les considérations éthiques propres au domaine.

    Le cours suit la chaîne complète d'un projet d'apprentissage automatique. Il commence par la formulation du problème et la préparation des données — nettoyage, encodage, mise à l'échelle, ingénierie des caractéristiques — étape qui détermine en pratique la réussite d'un projet bien plus que le choix de l'algorithme. Il traite ensuite les principales familles de méthodes supervisées : plus proches voisins, classification naïve bayésienne, arbres de décision, régression logistique, machines à vecteurs de support et méthodes d'ensemble. Il aborde la réduction de dimension, puis les méthodes non supervisées de partitionnement et enfin une introduction aux réseaux de neurones.

    L'évaluation des modèles occupe une place centrale et fait l'objet d'une séance entière. L'étudiant apprend à concevoir un protocole d'évaluation honnête, à choisir des métriques adaptées à la nature du problème et au déséquilibre des classes, à distinguer performance d'entraînement et performance de généralisation, et à reconnaître les fuites de données qui invalident silencieusement un résultat.

    Le cours accorde enfin une attention explicite aux enjeux éthiques : biais présents dans les données et reproduits par les modèles, équité des décisions automatisées, confidentialité, interprétabilité et responsabilité. Ces questions ne sont pas traitées comme un supplément moral mais comme une dimension technique du travail, avec des métriques et des méthodes de diagnostic.

    La pratique est continue : chaque séance comporte un laboratoire sous Python et Scikit-Learn. Un projet appliqué, conduit sur la seconde moitié du trimestre, demande de traiter un problème réel de bout en bout, depuis les données brutes jusqu'à un modèle évalué, comparé à une référence et analysé de façon critique.

  • Voir le syllabus 

  • Voir le syllabus 

  • Voir le syllabus 

  • Voir le syllabus 

  • Référence : Géron, chapitres 1 et 2 ; ISLR, chapitre 2.

    Contenus :

    •       Qu'est-ce que l'apprentissage automatique et en quoi diffère-t-il de la programmation classique

    •       Typologie : apprentissage supervisé, non supervisé, semi-supervisé, par renforcement

    •       Classification, régression et partitionnement : nature de la variable cible

    •       Chaîne complète d'un projet d'apprentissage, de la question métier au modèle déployé

    •       Notion de généralisation et distinction entre apprendre et mémoriser

    •       Compromis biais-variance présenté intuitivement

    •       Nécessité d'une référence simple comme point de comparaison

    •       Prise en main de l'environnement : Python, Pandas, Scikit-Learn, carnets Jupyter

    •       Premier modèle de bout en bout sur un jeu de données propre

    Objectifs pédagogiques :

    •       Distinguer les grandes familles de tâches d'apprentissage

    •       Formuler une question métier sous forme de problème d'apprentissage

    •       Établir une référence simple et en comprendre le rôle

    •       Exécuter une première chaîne complète sous Scikit-Learn

  • Référence : Géron, chapitre 2 ; Tan, chapitre 2.

    Contenus :

    •       Exploration préalable et diagnostic de la qualité des données

    •       Valeurs manquantes : mécanismes, imputation et documentation des choix

    •       Valeurs aberrantes et incohérences : détection et traitement

    •       Encodage des variables qualitatives : indicatrices, encodage ordinal, variables à forte cardinalité

    •       Mise à l'échelle : normalisation, standardisation, et algorithmes qui l'exigent

    •       Ingénierie des caractéristiques à partir de la connaissance du domaine

    •       Traitement des variables temporelles et textuelles élémentaires

    •       Déséquilibre des classes : rééchantillonnage et pondération

    •       Chaînes de traitement et prévention des fuites de données

    Objectifs pédagogiques :

    •       Diagnostiquer et traiter les défauts d'un jeu de données réel

    •       Choisir un encodage et une mise à l'échelle adaptés à l'algorithme visé

    •       Concevoir des caractéristiques nouvelles pertinentes

    •       Construire une chaîne de traitement reproductible sans fuite de données

  • Référence : Tan, chapitres 3 et 4 ; ISLR, chapitre 4.

    Contenus :

    •       Notion de frontière de décision et représentation géométrique d'un classifieur

    •       Algorithme des k plus proches voisins : principe et absence de phase d'apprentissage

    •       Choix de k, choix de la distance et effet de la mise à l'échelle

    •       Coût en mémoire et en temps de prédiction

    •       Classification bayésienne naïve : théorème de Bayes appliqué à la classification

    •       Hypothèse d'indépendance conditionnelle et raisons de son efficacité pratique

    •       Variantes selon la nature des caractéristiques

    •       Application à la classification de textes

    •       Comparaison des deux méthodes sur un même jeu de données

    Objectifs pédagogiques :

    •       Expliquer et mettre en œuvre l'algorithme des k plus proches voisins

    •       Expliquer l'effet de la mise à l'échelle sur les méthodes fondées sur la distance

    •       Mettre en œuvre une classification bayésienne naïve et en expliquer l'hypothèse

    Comparer deux classifieurs selon un protocole identique

  • Référence : Tan, chapitre 3 ; ISLR, chapitres 4 et 8 ; Géron, chapitre 6.

    Contenus :

    •       Arbres de décision : construction récursive et interprétation

    •       Critères de séparation : entropie, gain d'information, indice de Gini

    •       Surapprentissage des arbres et techniques d'élagage

    •       Hyperparamètres de contrôle de la complexité

    •       Avantages des arbres : interprétabilité, absence de mise à l'échelle, variables mixtes

    •       Régression logistique : fonction logistique et rapports de cotes

    •       Estimation, régularisation et interprétation des coefficients

    •       Extension au cas multiclasse

    •       Comparaison entre un modèle interprétable et un modèle performant

    Objectifs pédagogiques :

    •       Construire un arbre de décision et expliquer le critère de séparation retenu

    •       Contrôler la complexité d'un arbre et diagnostiquer son surapprentissage

    •       Mettre en œuvre une régression logistique et interpréter ses coefficients

    •       Arbitrer entre interprétabilité et performance

  • Référence : Géron, chapitre 3 ; ISLR, chapitre 5 ; Tan, chapitre 10.

    Contenus :

    •       Partition des données : entraînement, validation, test, et rôle distinct de chacun

    •       Validation croisée : principe, variantes stratifiée et par groupes

    •       Matrice de confusion et les deux types d'erreur

    •       Exactitude, précision, rappel, mesure F et leurs domaines de pertinence

    •       Pourquoi l'exactitude est trompeuse sur des classes déséquilibrées

    •       Courbe de sensibilité, aire sous la courbe et courbe précision-rappel

    •       Choix du seuil de décision selon le coût des erreurs

    •       Calibration des probabilités prédites

    •       Réglage des hyperparamètres : recherche exhaustive, aléatoire, validation imbriquée

    •       Fuites de données : mécanismes, détection et prévention

    Objectifs pédagogiques :

    •       Concevoir un protocole d'évaluation honnête et adapté aux données

    •       Choisir et interpréter des métriques appropriées au problème

    •       Régler les hyperparamètres sans contaminer le jeu de test

    Identifier une fuite de données et en corriger la cause

  • Référence : Géron, chapitres 1 à 3 ; ISLR, chapitres 2, 4 et 5 ; Tan, chapitres 2 à 4.

    Contenus évalués :

    •       Cadrage des problèmes et typologie des tâches d'apprentissage

    •       Préparation des données et ingénierie des caractéristiques

    •       Compromis biais-variance et généralisation

    •       Algorithmes de classification étudiés

    •       Protocoles d'évaluation, métriques et réglage des hyperparamètres

    Format :

    •       Partie théorique : questions de compréhension et critique d'un protocole d'évaluation fourni

    •       Partie pratique : construction et évaluation d'un modèle sur un jeu de données inédit comportant un défaut à diagnostiquer

    •       Lancement des projets : présentation du cahier des charges, choix des sujets et validation des propositions

  • Référence : ISLR, chapitre 9 ; Géron, chapitre 5.

    Contenus :

    •       Notion de marge et principe de la marge maximale

    •       Vecteurs de support et rôle des points frontières

    •       Marge souple et paramètre de régularisation

    •       Données non linéairement séparables et astuce du noyau

    •       Noyaux usuels : linéaire, polynomial, gaussien

    •       Réglage des hyperparamètres et sensibilité du modèle

    •       Nécessité de la mise à l'échelle préalable

    •       Coût de calcul et passage à l'échelle

    •       Comparaison avec les méthodes des séances précédentes

    Objectifs pédagogiques :

    •       Expliquer le principe de la marge maximale

    •       Mettre en œuvre une machine à vecteurs de support avec noyau

    •       Régler les hyperparamètres et diagnostiquer les effets de leur variation

    •       Situer cette famille de méthodes par rapport aux autres classifieurs étudiés

  • Référence : Géron, chapitre 7 ; ISLR, chapitre 8 ; Tan, chapitre 4.

    Contenus :

    •       Principe général : combiner plusieurs modèles pour améliorer la performance

    •       Agrégation par échantillonnage et réduction de la variance

    •       Forêts aléatoires : double source d'aléa et effet sur la décorrélation des arbres

    •       Estimation hors échantillon et importance des variables

    •       Renforcement séquentiel et réduction du biais

    •       Renforcement de gradient et bibliothèques usuelles

    •       Hyperparamètres critiques : profondeur, taux d'apprentissage, nombre d'estimateurs

    •       Empilement de modèles

    •       Coût de calcul et perte d'interprétabilité

    Objectifs pédagogiques :

    •       Expliquer pourquoi l'agrégation réduit la variance et le renforcement le biais

    •       Mettre en œuvre une forêt aléatoire et un modèle de renforcement de gradient

    •       Régler les hyperparamètres principaux par une procédure documentée

    •       Interpréter avec prudence l'importance des variables

  • Référence : Géron, chapitre 8 ; ISLR, chapitre 12 ; Tan, chapitre 2.

    Contenus :

    •       Difficultés propres aux espaces de grande dimension

    •       Sélection de variables : méthodes de filtrage, enveloppantes et intégrées

    •       Analyse en composantes principales : principe, variance expliquée, choix du nombre de composantes

    •       Interprétation des composantes et lien avec le domaine

    •       Nécessité du centrage et de la réduction préalables

    •       Méthodes de projection non linéaire pour la visualisation

    •       Limites d'interprétation de ces projections

    •       Effet de la réduction de dimension sur la performance et le temps de calcul

    •       Application aux données textuelles et aux données à très nombreuses variables

    Objectifs pédagogiques :

    •       Distinguer sélection de variables et extraction de caractéristiques

    •       Mettre en œuvre une analyse en composantes principales et interpréter ses résultats

    •       Utiliser une projection non linéaire à des fins de visualisation, avec les précautions requises

    •       Mesurer l'effet de la réduction de dimension sur le modèle final

  • Référence : Tan, chapitres 7 et 8 ; Géron, chapitre 9 ; ISLR, chapitre 12.

    Contenus :

    •       Objet de l'apprentissage non supervisé et difficulté de son évaluation

    •       Algorithme des k-moyennes : principe, convergence, sensibilité à l'initialisation

    •       Choix du nombre de groupes : méthode du coude, coefficient de silhouette

    •       Classification hiérarchique ascendante et lecture d'un dendrogramme

    •       Critères de liaison et choix du niveau de coupure

    •       Partitionnement fondé sur la densité et traitement des formes non convexes

    •       Modèles de mélanges gaussiens et affectation probabiliste

    •       Évaluation d'une partition : indices internes et externes

    •       Caractérisation et interprétation métier des groupes obtenus

    •       Applications : segmentation de clientèle, regroupement de documents, détection d'anomalies

    Objectifs pédagogiques :

    •       Mettre en œuvre les principaux algorithmes de partitionnement

    •       Choisir le nombre de groupes par des méthodes convergentes

    •       Évaluer la qualité d'une partition et reconnaître l'absence de structure

    •       Interpréter les groupes obtenus dans les termes du domaine

  • Référence : Géron, chapitre 10 ; ISLR, chapitre 10 ; Tan, chapitre 10.

    Contenus :

    •       Du perceptron au réseau multicouche : principe et intuition

    •       Fonctions d'activation, fonction de perte et descente de gradient

    •       Positionnement des réseaux de neurones par rapport aux méthodes étudiées

    •       Quand un réseau de neurones est justifié et quand il ne l'est pas

    •       Sources de biais : collecte, échantillonnage, annotation, variables mandataires

    •       Mesure des écarts de performance entre sous-groupes

    •       Définitions concurrentes de l'équité et impossibilité de les satisfaire simultanément

    •       Méthodes d'atténuation : avant, pendant et après l'apprentissage

    •       Interprétabilité : modèles intrinsèquement interprétables et méthodes d'explication a posteriori

    •       Confidentialité des données, responsabilité et conditions de déploiement

    •       Étude de cas : un système de décision automatisée et ses effets

    Objectifs pédagogiques :

    •       Expliquer le principe d'un réseau de neurones et situer son usage

    •       Identifier et mesurer un biais dans un système d'apprentissage

    •       Expliquer les tensions entre différentes définitions de l'équité

    •       Produire une explication interprétable d'une décision individuelle

  • Référence : Ensemble des chapitres au programme.

    Contenus évalués :

    •       Cadrage, préparation des données et ingénierie des caractéristiques

    •       Algorithmes de classification et machines à vecteurs de support

    •       Protocoles d'évaluation, métriques et réglage des hyperparamètres

    •       Méthodes d'ensemble et réduction de dimension

    •       Apprentissage non supervisé et partitionnement

    •       Éthique, biais et interprétabilité

    Format :

    •       Partie théorique : analyse critique d'une démarche de modélisation fournie et questions de raisonnement

    •       Partie pratique : construction, évaluation et interprétation d'un modèle sur machine

    •       Soutenances de projet : présentation de douze minutes suivie des questions du jury

    •       Remise du rapport de projet et du code reproductible