Résumé de section

  • Référence : Géron, chapitre 3 ; ISLR, chapitre 5 ; Tan, chapitre 10.

    Contenus :

    •       Partition des données : entraînement, validation, test, et rôle distinct de chacun

    •       Validation croisée : principe, variantes stratifiée et par groupes

    •       Matrice de confusion et les deux types d'erreur

    •       Exactitude, précision, rappel, mesure F et leurs domaines de pertinence

    •       Pourquoi l'exactitude est trompeuse sur des classes déséquilibrées

    •       Courbe de sensibilité, aire sous la courbe et courbe précision-rappel

    •       Choix du seuil de décision selon le coût des erreurs

    •       Calibration des probabilités prédites

    •       Réglage des hyperparamètres : recherche exhaustive, aléatoire, validation imbriquée

    •       Fuites de données : mécanismes, détection et prévention

    Objectifs pédagogiques :

    •       Concevoir un protocole d'évaluation honnête et adapté aux données

    •       Choisir et interpréter des métriques appropriées au problème

    •       Régler les hyperparamètres sans contaminer le jeu de test

    Identifier une fuite de données et en corriger la cause