Résumé de section

  • Le cours DSC 445 — Machine Learning I est une unité d'enseignement avancée qui introduit les concepts fondamentaux et les techniques de l'apprentissage automatique tels qu'ils sont employés en science des données et en intelligence artificielle. L'étudiant y apprend les algorithmes de classification et de partitionnement, les méthodes d'évaluation des modèles, ainsi que les considérations éthiques propres au domaine.

    Le cours suit la chaîne complète d'un projet d'apprentissage automatique. Il commence par la formulation du problème et la préparation des données — nettoyage, encodage, mise à l'échelle, ingénierie des caractéristiques — étape qui détermine en pratique la réussite d'un projet bien plus que le choix de l'algorithme. Il traite ensuite les principales familles de méthodes supervisées : plus proches voisins, classification naïve bayésienne, arbres de décision, régression logistique, machines à vecteurs de support et méthodes d'ensemble. Il aborde la réduction de dimension, puis les méthodes non supervisées de partitionnement et enfin une introduction aux réseaux de neurones.

    L'évaluation des modèles occupe une place centrale et fait l'objet d'une séance entière. L'étudiant apprend à concevoir un protocole d'évaluation honnête, à choisir des métriques adaptées à la nature du problème et au déséquilibre des classes, à distinguer performance d'entraînement et performance de généralisation, et à reconnaître les fuites de données qui invalident silencieusement un résultat.

    Le cours accorde enfin une attention explicite aux enjeux éthiques : biais présents dans les données et reproduits par les modèles, équité des décisions automatisées, confidentialité, interprétabilité et responsabilité. Ces questions ne sont pas traitées comme un supplément moral mais comme une dimension technique du travail, avec des métriques et des méthodes de diagnostic.

    La pratique est continue : chaque séance comporte un laboratoire sous Python et Scikit-Learn. Un projet appliqué, conduit sur la seconde moitié du trimestre, demande de traiter un problème réel de bout en bout, depuis les données brutes jusqu'à un modèle évalué, comparé à une référence et analysé de façon critique.