Résumé de section
-
Voir le syllabus
-
Voir le syllabus
-
Voir le syllabus
-
Contenus :
- Définition de l’analyse des données ;
- Rôle des données dans la recherche, l’entreprise et la prise de décision ;
- Différence entre donnée, information, connaissance et décision ;
- Principaux objectifs de l’analyse :
- description ;
- comparaison ;
- explication ;
- prédiction ;
- Domaines d’application de l’analyse des données ;
- Étapes générales d’un projet d’analyse :
- formulation du problème ;
- définition des objectifs ;
- identification des données nécessaires ;
- collecte ou acquisition ;
- préparation ;
- exploration ;
- modélisation ;
- évaluation ;
- interprétation ;
- communication ;
- Définition de la population et de l’échantillon ;
- Notion d’unité statistique ou d’observation ;
- Identification des variables ;
- Données primaires et données secondaires ;
- Sources internes et externes de données ;
- Données structurées, semi-structurées et non structurées ;
- Études observationnelles et expérimentales ;
- Notions élémentaires d’échantillonnage ;
- Représentativité de l’échantillon ;
- Biais d’échantillonnage et biais de sélection ;
- Formulation d’une question d’analyse claire et exploitable ;
- Définition des objectifs descriptifs, explicatifs et prédictifs ;
- Documentation et reproductibilité d’une analyse.
Objectifs pédagogiques :
- Définir l’analyse des données et expliquer son utilité ;
- Distinguer les principaux objectifs d’une analyse ;
- Identifier les étapes d’une démarche analytique ;
- Formuler une question d’analyse précise ;
- Distinguer une population d’un échantillon ;
- Identifier les observations et les variables d’une étude ;
- Distinguer les données primaires des données secondaires ;
- Reconnaître les principales sources de données ;
- Comprendre l’importance de la représentativité ;
- Identifier les risques de biais dans la collecte des données ;
- Structurer une démarche cohérente à partir d’un problème donné ;
- Comprendre l’importance de la documentation et de la reproductibilité.
-
Contenus :
- Définition d’une variable statistique ;
- Variables qualitatives :
- variables nominales ;
- variables ordinales ;
- variables binaires ;
- Variables quantitatives :
- variables discrètes ;
- variables continues ;
- Échelles de mesure :
- échelle nominale ;
- échelle ordinale ;
- échelle d’intervalle ;
- échelle de rapport ;
- Différence entre une variable numérique et une catégorie codée numériquement ;
- Unités de mesure ;
- Variables explicatives et variable dépendante ;
- Variables de contrôle ;
- Variables de confusion ;
- Variables dérivées ;
- Données transversales ;
- Données temporelles ;
- Données longitudinales ;
- Format de stockage des variables ;
- Types informatiques :
- nombres entiers ;
- nombres décimaux ;
- chaînes de caractères ;
- valeurs booléennes ;
- dates et heures ;
- Dictionnaire de données ;
- Métadonnées ;
- Cohérence entre le type conceptuel et le format informatique ;
- Choix des traitements selon le type de variable ;
- Choix des statistiques descriptives adaptées ;
- Choix des visualisations selon la nature des données ;
- Conséquences d’une mauvaise classification des variables.
Objectifs pédagogiques :
- Distinguer les données qualitatives des données quantitatives ;
- Différencier les variables discrètes des variables continues ;
- Identifier les variables nominales, ordinales et binaires ;
- Distinguer les quatre principales échelles de mesure ;
- Reconnaître une catégorie codée par un nombre ;
- Identifier les variables dépendantes et explicatives ;
- Comprendre le rôle des variables de contrôle et de confusion ;
- Associer une variable à un type informatique approprié ;
- Vérifier la cohérence des unités de mesure ;
- Construire un dictionnaire élémentaire de données ;
- Sélectionner des statistiques adaptées à chaque type de variable ;
- Choisir des graphiques compatibles avec la nature des données.
-
Contenus :
- Importance de la qualité des données ;
- Dimensions de la qualité :
- exactitude ;
- complétude ;
- cohérence ;
- validité ;
- unicité ;
- actualité ;
- Importation d’un jeu de données ;
- Examen des dimensions du jeu de données ;
- Inspection des noms de variables ;
- Vérification des types et des formats ;
- Identification des valeurs manquantes ;
- Représentation des valeurs manquantes dans les fichiers ;
- Distinction entre valeur absente, valeur nulle et valeur non applicable ;
- Principes élémentaires de traitement des valeurs manquantes :
- suppression d’observations ;
- suppression de variables ;
- remplacement par une mesure centrale ;
- création d’une catégorie spécifique ;
- Limites des méthodes simples d’imputation ;
- Détection et suppression des doublons ;
- Identification des erreurs de saisie ;
- Détection des valeurs impossibles ;
- Harmonisation des libellés et des catégories ;
- Conversion des unités ;
- Traitement des dates et des heures ;
- Recodage des variables qualitatives ;
- Création de variables dérivées ;
- Transformation de variables ;
- Détection des valeurs atypiques ;
- Utilisation des quartiles et de l’écart interquartile ;
- Distinction entre valeur atypique valide et erreur ;
- Effets possibles de la suppression des observations ;
- Traçabilité des transformations ;
- Conservation d’une copie des données brutes ;
- Élaboration d’un rapport de qualité des données.
Objectifs pédagogiques :
- Examiner méthodiquement un jeu de données ;
- Identifier les problèmes de qualité ;
- Détecter les valeurs manquantes ;
- Sélectionner un traitement adapté aux données manquantes ;
- Identifier et traiter les doublons ;
- Corriger les formats et les unités incohérents ;
- Détecter les erreurs et les valeurs impossibles ;
- Recoder correctement les variables qualitatives ;
- Créer des variables dérivées pertinentes ;
- Identifier les observations atypiques ;
- Justifier la conservation ou l’exclusion d’une observation ;
- Documenter les opérations de nettoyage ;
- Produire un jeu de données cohérent et exploitable ;
- Préserver l’intégrité des données brutes.
-
Contenus :
- Rôle de la statistique descriptive ;
- Analyse univariée ;
- Effectifs et fréquences ;
- Fréquences absolues ;
- Fréquences relatives ;
- Fréquences cumulées ;
- Tableaux de distribution ;
- Mesures de tendance centrale :
- moyenne arithmétique ;
- médiane ;
- mode ;
- Choix d’une mesure de tendance centrale ;
- Influence des valeurs extrêmes ;
- Mesures de dispersion :
- étendue ;
- variance ;
- écart-type ;
- quartiles ;
- écart interquartile ;
- Notion de percentile ;
- Coefficient de variation ;
- Proportions, ratios, taux et pourcentages ;
- Forme d’une distribution ;
- Distribution symétrique ;
- Asymétrie positive et asymétrie négative ;
- Concentration et dispersion des observations ;
- Introduction à la distribution normale ;
- Règle empirique de la distribution normale ;
- Standardisation et score centré réduit ;
- Comparaison de plusieurs distributions ;
- Effet de l’unité de mesure sur les statistiques ;
- Interprétation contextualisée des résultats ;
- Limites des résumés statistiques.
Objectifs pédagogiques :
- Construire et interpréter un tableau de fréquences ;
- Calculer les principales mesures de tendance centrale ;
- Sélectionner une mesure adaptée à la distribution ;
- Calculer les principales mesures de dispersion ;
- Interpréter la moyenne, la médiane et l’écart-type ;
- Déterminer les quartiles et l’écart interquartile ;
- Comparer la position et la dispersion de plusieurs séries ;
- Identifier l’influence des valeurs extrêmes ;
- Décrire la forme d’une distribution ;
- Comprendre la notion de distribution normale ;
- Calculer et interpréter un score standardisé ;
- Utiliser correctement les proportions et les pourcentages ;
- Produire une synthèse descriptive cohérente.
-
Contenus :
- Rôle de la visualisation dans l’analyse des données ;
- Principes de lisibilité et de précision graphique ;
- Diagramme en barres ;
- Diagramme circulaire et limites de son utilisation ;
- Histogramme ;
- Polygone des fréquences ;
- Boîte à moustaches ;
- Graphique chronologique ;
- Nuage de points ;
- Comparaison graphique de plusieurs groupes ;
- Choix des axes et des échelles ;
- Titres, unités, légendes et annotations ;
- Risques liés aux graphiques trompeurs ;
- Analyse exploratoire des données ;
- Identification des tendances ;
- Détection des regroupements ;
- Identification des ruptures et des anomalies ;
- Analyse bivariée ;
- Relation entre deux variables quantitatives ;
- Direction d’une relation ;
- Intensité apparente d’une relation ;
- Relation linéaire et relation non linéaire ;
- Calcul et interprétation de la covariance ;
- Coefficient de corrélation linéaire de Pearson ;
- Corrélation positive, négative ou proche de zéro ;
- Influence des valeurs atypiques sur la corrélation ;
- Corrélation au sein de sous-groupes ;
- Variables de confusion ;
- Distinction entre corrélation et causalité ;
- Introduction au choix d’un modèle de régression.
Objectifs pédagogiques :
- Sélectionner une visualisation adaptée aux données ;
- Produire des graphiques lisibles et correctement annotés ;
- Identifier la forme générale d’une distribution ;
- Détecter graphiquement les valeurs atypiques ;
- Identifier des tendances et des regroupements ;
- Interpréter un nuage de points ;
- Distinguer une relation linéaire d’une relation non linéaire ;
- Calculer et interpréter la covariance ;
- Calculer et interpréter le coefficient de corrélation ;
- Reconnaître l’influence des observations atypiques ;
- Distinguer association statistique et causalité ;
- Identifier des variables de confusion possibles ;
- Déterminer si une relation justifie l’étude d’une régression linéaire ;
- Préparer l’étudiant à l’examen de mi-parcours.
-
Contenus évalués :
- Rôle et objectifs de l’analyse des données ;
- Étapes d’une démarche analytique ;
- Population, échantillon, observation et variable ;
- Données primaires et secondaires ;
- Biais de collecte et représentativité ;
- Variables qualitatives et quantitatives ;
- Variables discrètes et continues ;
- Échelles de mesure ;
- Variables dépendantes et explicatives ;
- Qualité des données ;
- Valeurs manquantes ;
- Doublons et incohérences ;
- Valeurs impossibles et atypiques ;
- Préparation et transformation des données ;
- Tableaux de fréquences ;
- Mesures de tendance centrale ;
- Mesures de dispersion ;
- Quartiles et écart interquartile ;
- Distribution normale et score standardisé ;
- Visualisations statistiques ;
- Analyse exploratoire ;
- Covariance et corrélation ;
- Distinction entre corrélation et causalité.
Compétences évaluées :
- Formuler une question analytique ;
- Identifier les composantes d’une étude statistique ;
- Classer correctement les variables ;
- Choisir une échelle de mesure appropriée ;
- Examiner la qualité d’un jeu de données ;
- Proposer des opérations de nettoyage cohérentes ;
- Calculer et interpréter les statistiques descriptives ;
- Sélectionner une représentation graphique adaptée ;
- Interpréter un tableau ou un graphique ;
- Calculer et interpréter une covariance ;
- Calculer et interpréter une corrélation ;
- Identifier les limites d’une analyse ;
- Justifier les méthodes et les conclusions proposées.
-
Contenus :
- Définition de la régression ;
- Objectifs de la régression :
- description ;
- explication ;
- prédiction ;
- Régression linéaire simple ;
- Variable dépendante ;
- Variable explicative ;
- Nuage de points et relation linéaire ;
- Forme générale du modèle ;
- Composante déterministe et composante aléatoire ;
- Droite de régression ;
- Constante ou ordonnée à l’origine ;
- Pente ou coefficient de régression ;
- Valeurs observées ;
- Valeurs prédites ;
- Résidus ;
- Interprétation géométrique du résidu ;
- Principe de la méthode des moindres carrés ;
- Somme des carrés des résidus ;
- Estimation de la pente ;
- Estimation de la constante ;
- Relation entre covariance, variance et pente ;
- Relation entre corrélation et régression ;
- Conditions générales d’utilisation de la régression linéaire ;
- Différence entre modèle statistique et relation déterministe ;
- Régression et causalité ;
- Limites d’un modèle à une seule variable explicative.
Objectifs pédagogiques :
- Définir la régression linéaire simple ;
- Identifier les variables dépendante et explicative ;
- Expliquer le rôle de la droite de régression ;
- Distinguer les valeurs observées et prédites ;
- Définir et interpréter un résidu ;
- Expliquer la signification de la constante et de la pente ;
- Comprendre le principe des moindres carrés ;
- Relier la pente à la covariance et à la variance ;
- Distinguer corrélation et régression ;
- Différencier une utilisation explicative d’une utilisation prédictive ;
- Reconnaître les limites d’un modèle simple ;
- Éviter les interprétations causales injustifiées.
-
Contenus :
- Sélection de la variable dépendante ;
- Choix d’une variable explicative ;
- Vérification graphique de la relation ;
- Ajustement d’un modèle linéaire ;
- Écriture de l’équation estimée ;
- Interprétation de la constante ;
- Interprétation de la pente ;
- Importance des unités de mesure ;
- Effet d’un changement d’échelle ;
- Calcul des valeurs prédites ;
- Calcul des résidus ;
- Comparaison des valeurs observées et prédites ;
- Représentation de la droite de régression ;
- Interpolation ;
- Extrapolation ;
- Domaine de validité du modèle ;
- Prévision ponctuelle ;
- Introduction à l’incertitude de prévision ;
- Influence d’une observation atypique sur la droite ;
- Analyse de situations pratiques :
- ventes et dépenses publicitaires ;
- prix et caractéristiques d’un produit ;
- consommation et température ;
- performance et charge d’un système ;
- Présentation des résultats dans un langage non technique ;
- Limites de l’interprétation de la constante ;
- Distinction entre signification statistique et importance pratique.
Objectifs pédagogiques :
- Sélectionner des variables adaptées à une régression simple ;
- Vérifier graphiquement la plausibilité d’une relation linéaire ;
- Estimer et écrire une équation de régression ;
- Interpréter correctement les coefficients ;
- Calculer une valeur prédite ;
- Calculer et interpréter un résidu ;
- Comparer les observations avec les prédictions ;
- Distinguer interpolation et extrapolation ;
- Identifier le domaine de validité du modèle ;
- Reconnaître l’influence possible d’une valeur atypique ;
- Présenter les résultats dans les unités appropriées ;
- Formuler une interprétation compréhensible et prudente.
-
Contenus :
- Notion de qualité d’ajustement ;
- Variation totale de la variable dépendante ;
- Variation expliquée par le modèle ;
- Variation résiduelle ;
- Coefficient de détermination ;
- Interprétation du coefficient de détermination ;
- Relation entre coefficient de corrélation et coefficient de détermination dans la régression simple ;
- Limites du coefficient de détermination ;
- Somme des carrés totale ;
- Somme des carrés expliquée ;
- Somme des carrés résiduelle ;
- Erreur absolue ;
- Erreur absolue moyenne ;
- Erreur quadratique ;
- Erreur quadratique moyenne ;
- Racine de l’erreur quadratique moyenne ;
- Comparaison des mesures d’erreur ;
- Interprétation des erreurs dans les unités de la variable dépendante ;
- Données d’apprentissage ;
- Données de validation ;
- Données de test ;
- Principe de séparation des données ;
- Performance d’ajustement et performance de généralisation ;
- Sous-ajustement ;
- Surajustement ;
- Comparaison de plusieurs modèles ;
- Simplicité et interprétabilité ;
- Choix d’un modèle adapté à l’objectif ;
- Présentation honnête de la performance prédictive.
Objectifs pédagogiques :
- Expliquer la variation expliquée et la variation résiduelle ;
- Calculer et interpréter le coefficient de détermination ;
- Distinguer corrélation et coefficient de détermination ;
- Calculer les principales mesures d’erreur ;
- Interpréter les erreurs dans le contexte du problème ;
- Comparer plusieurs modèles à partir de critères identiques ;
- Comprendre le rôle des données d’apprentissage et de test ;
- Distinguer ajustement et généralisation ;
- Identifier les signes de sous-ajustement et de surajustement ;
- Sélectionner un modèle en tenant compte de sa performance et de sa simplicité ;
- Présenter les performances sans en exagérer la portée.
-
Contenus :
- Rôle de l’analyse des résidus ;
- Résidus standardisés ;
- Graphique des résidus en fonction des valeurs prédites ;
- Résidus en fonction de la variable explicative ;
- Hypothèse de linéarité ;
- Signes graphiques d’une relation non linéaire ;
- Hypothèse d’indépendance des observations ;
- Dépendance temporelle ou spatiale ;
- Hypothèse de variance constante ;
- Homoscédasticité ;
- Hétéroscédasticité ;
- Formes graphiques de l’hétéroscédasticité ;
- Hypothèse de normalité des résidus ;
- Histogramme des résidus ;
- Graphique quantile-quantile ;
- Interprétation introductive de la normalité ;
- Détection des résidus élevés ;
- Observations atypiques ;
- Observations influentes ;
- Effet de levier ;
- Influence d’une observation sur les coefficients ;
- Causes possibles d’une violation des hypothèses ;
- Erreurs de données ;
- Variables omises ;
- Mauvaise forme fonctionnelle ;
- Transformation logarithmique ou autre transformation simple ;
- Ajout d’une variable pertinente ;
- Limites des corrections automatiques ;
- Effets des violations sur l’interprétation et la prédiction ;
- Présentation des diagnostics dans un rapport.
Objectifs pédagogiques :
- Expliquer le rôle des résidus ;
- Produire et interpréter les principaux graphiques de diagnostic ;
- Vérifier la plausibilité de la linéarité ;
- Comprendre l’hypothèse d’indépendance ;
- Identifier une dispersion non constante des résidus ;
- Définir l’hétéroscédasticité ;
- Examiner la normalité des résidus ;
- Identifier les observations atypiques et influentes ;
- Distinguer un problème de données d’un problème de modèle ;
- Proposer une action corrective raisonnable ;
- Évaluer les effets d’une violation des hypothèses ;
- Formuler une conclusion prudente sur la validité du modèle
-
SEMAINE 11 : Introduction à la régression multiple, projet intégrateur et communication des résultats
Contenus :
- Limites de la régression à une seule variable explicative ;
- Introduction à la régression linéaire multiple ;
- Forme générale du modèle multiple ;
- Variable dépendante et variables explicatives ;
- Interprétation conditionnelle d’un coefficient ;
- Maintien constant des autres variables ;
- Choix des variables explicatives ;
- Justification théorique et contextuelle ;
- Risque lié aux variables omises ;
- Variables catégorielles ;
- Codage indicateur ;
- Catégorie de référence ;
- Interprétation d’un coefficient associé à une catégorie ;
- Comparaison d’un modèle simple et d’un modèle multiple ;
- Coefficient de détermination ajusté ;
- Augmentation mécanique du coefficient de détermination ;
- Principe de parcimonie ;
- Variables redondantes ;
- Introduction à la multicolinéarité ;
- Effets de la multicolinéarité sur les coefficients ;
- Sélection raisonnée des variables ;
- Limites de l’interprétation causale ;
- Structure d’un rapport d’analyse :
- contexte ;
- question ;
- données ;
- préparation ;
- exploration ;
- modèle ;
- diagnostics ;
- résultats ;
- limites ;
- recommandations ;
- Présentation des tableaux et graphiques ;
- Communication à un public technique et non technique ;
- Confidentialité et protection des données ;
- Biais et représentativité ;
- Transparence des transformations ;
- Reproductibilité du code et de l’analyse ;
- Présentation honnête des limites ;
- Finalisation du projet intégrateur.
Objectifs pédagogiques :
- Expliquer l’intérêt de la régression multiple ;
- Interpréter un coefficient en maintenant les autres variables constantes ;
- Intégrer une variable catégorielle dans un modèle simple ;
- Identifier la catégorie de référence ;
- Comparer un modèle simple à un modèle multiple ;
- Interpréter le coefficient de détermination ajusté ;
- Comprendre la notion de parcimonie ;
- Définir la multicolinéarité ;
- Reconnaître les effets des variables redondantes ;
- Sélectionner des variables sur une base justifiable ;
- Structurer un rapport complet d’analyse ;
- Communiquer les résultats à différents publics ;
- Présenter les limites et les risques de manière transparente ;
- Assurer la reproductibilité de l’analyse ;
- Finaliser et présenter un projet d’analyse et de régression.
-
Contenus évalués :
- Analyse des relations entre variables ;
- Covariance et corrélation ;
- Corrélation et causalité ;
- Fondements de la régression linéaire simple ;
- Variable dépendante et variable explicative ;
- Droite de régression ;
- Constante et pente ;
- Méthode des moindres carrés ;
- Valeurs observées, valeurs prédites et résidus ;
- Construction et interprétation d’une équation de régression ;
- Interpolation et extrapolation ;
- Coefficient de détermination ;
- Variation expliquée et variation résiduelle ;
- Erreur absolue moyenne ;
- Erreur quadratique moyenne ;
- Racine de l’erreur quadratique moyenne ;
- Ensembles d’apprentissage et de test ;
- Sous-ajustement et surajustement ;
- Analyse des résidus ;
- Hypothèse de linéarité ;
- Indépendance des observations ;
- Homoscédasticité et hétéroscédasticité ;
- Normalité des résidus ;
- Valeurs atypiques et observations influentes ;
- Introduction à la régression multiple ;
- Interprétation conditionnelle des coefficients ;
- Variables catégorielles et catégories de référence ;
- Coefficient de détermination ajusté ;
- Multicolinéarité ;
- Sélection raisonnée des variables ;
- Communication et reproductibilité ;
- Confidentialité, biais et intégrité de l’analyse.
Compétences évaluées :
- Analyser la relation entre des variables ;
- Construire une régression linéaire simple ;
- Interpréter les coefficients du modèle ;
- Calculer des prédictions et des résidus ;
- Évaluer la qualité d’ajustement ;
- Calculer et interpréter les principales mesures d’erreur ;
- Comparer plusieurs modèles ;
- Interpréter les graphiques de diagnostic ;
- Identifier les violations des hypothèses ;
- Proposer des corrections ou précautions adaptées ;
- Interpréter un modèle de régression multiple élémentaire ;
- Intégrer une variable catégorielle ;
- Identifier les risques de multicolinéarité ;
- Sélectionner un modèle cohérent et parcimonieux ;
- Justifier les choix méthodologiques ;
- Communiquer les résultats et leurs limites ;
- Respecter les principes d’éthique, de transparence et de reproductibilité.