Résumé de section
-
Référence : Géron, chapitre 3 ; ISLR, chapitre 5 ; Tan, chapitre 10.
Contenus :
• Partition des données : entraînement, validation, test, et rôle distinct de chacun
• Validation croisée : principe, variantes stratifiée et par groupes
• Matrice de confusion et les deux types d'erreur
• Exactitude, précision, rappel, mesure F et leurs domaines de pertinence
• Pourquoi l'exactitude est trompeuse sur des classes déséquilibrées
• Courbe de sensibilité, aire sous la courbe et courbe précision-rappel
• Choix du seuil de décision selon le coût des erreurs
• Calibration des probabilités prédites
• Réglage des hyperparamètres : recherche exhaustive, aléatoire, validation imbriquée
• Fuites de données : mécanismes, détection et prévention
Objectifs pédagogiques :
• Concevoir un protocole d'évaluation honnête et adapté aux données
• Choisir et interpréter des métriques appropriées au problème
• Régler les hyperparamètres sans contaminer le jeu de test
Identifier une fuite de données et en corriger la cause