Résumé de section

  • Voir le syllabus 

  • Voir le syllabus 

  • Voir le syllabus 

  • Contenus :

    • Définition de l’analyse des données ;
    • Rôle des données dans la recherche, l’entreprise et la prise de décision ;
    • Différence entre donnée, information, connaissance et décision ;
    • Principaux objectifs de l’analyse :
      • description ;
      • comparaison ;
      • explication ;
      • prédiction ;
    • Domaines d’application de l’analyse des données ;
    • Étapes générales d’un projet d’analyse :
      • formulation du problème ;
      • définition des objectifs ;
      • identification des données nécessaires ;
      • collecte ou acquisition ;
      • préparation ;
      • exploration ;
      • modélisation ;
      • évaluation ;
      • interprétation ;
      • communication ;
    • Définition de la population et de l’échantillon ;
    • Notion d’unité statistique ou d’observation ;
    • Identification des variables ;
    • Données primaires et données secondaires ;
    • Sources internes et externes de données ;
    • Données structurées, semi-structurées et non structurées ;
    • Études observationnelles et expérimentales ;
    • Notions élémentaires d’échantillonnage ;
    • Représentativité de l’échantillon ;
    • Biais d’échantillonnage et biais de sélection ;
    • Formulation d’une question d’analyse claire et exploitable ;
    • Définition des objectifs descriptifs, explicatifs et prédictifs ;
    • Documentation et reproductibilité d’une analyse.

    Objectifs pédagogiques :

    • Définir l’analyse des données et expliquer son utilité ;
    • Distinguer les principaux objectifs d’une analyse ;
    • Identifier les étapes d’une démarche analytique ;
    • Formuler une question d’analyse précise ;
    • Distinguer une population d’un échantillon ;
    • Identifier les observations et les variables d’une étude ;
    • Distinguer les données primaires des données secondaires ;
    • Reconnaître les principales sources de données ;
    • Comprendre l’importance de la représentativité ;
    • Identifier les risques de biais dans la collecte des données ;
    • Structurer une démarche cohérente à partir d’un problème donné ;
    • Comprendre l’importance de la documentation et de la reproductibilité.
  • Contenus :

    • Définition d’une variable statistique ;
    • Variables qualitatives :
      • variables nominales ;
      • variables ordinales ;
      • variables binaires ;
    • Variables quantitatives :
      • variables discrètes ;
      • variables continues ;
    • Échelles de mesure :
      • échelle nominale ;
      • échelle ordinale ;
      • échelle d’intervalle ;
      • échelle de rapport ;
    • Différence entre une variable numérique et une catégorie codée numériquement ;
    • Unités de mesure ;
    • Variables explicatives et variable dépendante ;
    • Variables de contrôle ;
    • Variables de confusion ;
    • Variables dérivées ;
    • Données transversales ;
    • Données temporelles ;
    • Données longitudinales ;
    • Format de stockage des variables ;
    • Types informatiques :
      • nombres entiers ;
      • nombres décimaux ;
      • chaînes de caractères ;
      • valeurs booléennes ;
      • dates et heures ;
    • Dictionnaire de données ;
    • Métadonnées ;
    • Cohérence entre le type conceptuel et le format informatique ;
    • Choix des traitements selon le type de variable ;
    • Choix des statistiques descriptives adaptées ;
    • Choix des visualisations selon la nature des données ;
    • Conséquences d’une mauvaise classification des variables.

    Objectifs pédagogiques :

    • Distinguer les données qualitatives des données quantitatives ;
    • Différencier les variables discrètes des variables continues ;
    • Identifier les variables nominales, ordinales et binaires ;
    • Distinguer les quatre principales échelles de mesure ;
    • Reconnaître une catégorie codée par un nombre ;
    • Identifier les variables dépendantes et explicatives ;
    • Comprendre le rôle des variables de contrôle et de confusion ;
    • Associer une variable à un type informatique approprié ;
    • Vérifier la cohérence des unités de mesure ;
    • Construire un dictionnaire élémentaire de données ;
    • Sélectionner des statistiques adaptées à chaque type de variable ;
    • Choisir des graphiques compatibles avec la nature des données.
  • Contenus :

    • Importance de la qualité des données ;
    • Dimensions de la qualité :
      • exactitude ;
      • complétude ;
      • cohérence ;
      • validité ;
      • unicité ;
      • actualité ;
    • Importation d’un jeu de données ;
    • Examen des dimensions du jeu de données ;
    • Inspection des noms de variables ;
    • Vérification des types et des formats ;
    • Identification des valeurs manquantes ;
    • Représentation des valeurs manquantes dans les fichiers ;
    • Distinction entre valeur absente, valeur nulle et valeur non applicable ;
    • Principes élémentaires de traitement des valeurs manquantes :
      • suppression d’observations ;
      • suppression de variables ;
      • remplacement par une mesure centrale ;
      • création d’une catégorie spécifique ;
    • Limites des méthodes simples d’imputation ;
    • Détection et suppression des doublons ;
    • Identification des erreurs de saisie ;
    • Détection des valeurs impossibles ;
    • Harmonisation des libellés et des catégories ;
    • Conversion des unités ;
    • Traitement des dates et des heures ;
    • Recodage des variables qualitatives ;
    • Création de variables dérivées ;
    • Transformation de variables ;
    • Détection des valeurs atypiques ;
    • Utilisation des quartiles et de l’écart interquartile ;
    • Distinction entre valeur atypique valide et erreur ;
    • Effets possibles de la suppression des observations ;
    • Traçabilité des transformations ;
    • Conservation d’une copie des données brutes ;
    • Élaboration d’un rapport de qualité des données.

    Objectifs pédagogiques :

    • Examiner méthodiquement un jeu de données ;
    • Identifier les problèmes de qualité ;
    • Détecter les valeurs manquantes ;
    • Sélectionner un traitement adapté aux données manquantes ;
    • Identifier et traiter les doublons ;
    • Corriger les formats et les unités incohérents ;
    • Détecter les erreurs et les valeurs impossibles ;
    • Recoder correctement les variables qualitatives ;
    • Créer des variables dérivées pertinentes ;
    • Identifier les observations atypiques ;
    • Justifier la conservation ou l’exclusion d’une observation ;
    • Documenter les opérations de nettoyage ;
    • Produire un jeu de données cohérent et exploitable ; 
    • Préserver l’intégrité des données brutes. 
  • Contenus :

    • Rôle de la statistique descriptive ;
    • Analyse univariée ;
    • Effectifs et fréquences ;
    • Fréquences absolues ;
    • Fréquences relatives ;
    • Fréquences cumulées ;
    • Tableaux de distribution ;
    • Mesures de tendance centrale :
      • moyenne arithmétique ;
      • médiane ;
      • mode ;
    • Choix d’une mesure de tendance centrale ;
    • Influence des valeurs extrêmes ;
    • Mesures de dispersion :
      • étendue ;
      • variance ;
      • écart-type ;
      • quartiles ;
      • écart interquartile ;
    • Notion de percentile ;
    • Coefficient de variation ;
    • Proportions, ratios, taux et pourcentages ;
    • Forme d’une distribution ;
    • Distribution symétrique ;
    • Asymétrie positive et asymétrie négative ;
    • Concentration et dispersion des observations ;
    • Introduction à la distribution normale ;
    • Règle empirique de la distribution normale ;
    • Standardisation et score centré réduit ;
    • Comparaison de plusieurs distributions ;
    • Effet de l’unité de mesure sur les statistiques ;
    • Interprétation contextualisée des résultats ;
    • Limites des résumés statistiques.

    Objectifs pédagogiques :

    • Construire et interpréter un tableau de fréquences ;
    • Calculer les principales mesures de tendance centrale ;
    • Sélectionner une mesure adaptée à la distribution ;
    • Calculer les principales mesures de dispersion ;
    • Interpréter la moyenne, la médiane et l’écart-type ;
    • Déterminer les quartiles et l’écart interquartile ;
    • Comparer la position et la dispersion de plusieurs séries ;
    • Identifier l’influence des valeurs extrêmes ;
    • Décrire la forme d’une distribution ;
    • Comprendre la notion de distribution normale ;
    • Calculer et interpréter un score standardisé ;
    • Utiliser correctement les proportions et les pourcentages ;
    • Produire une synthèse descriptive cohérente.
  • Contenus :

    • Rôle de la visualisation dans l’analyse des données ;
    • Principes de lisibilité et de précision graphique ;
    • Diagramme en barres ;
    • Diagramme circulaire et limites de son utilisation ;
    • Histogramme ;
    • Polygone des fréquences ;
    • Boîte à moustaches ;
    • Graphique chronologique ;
    • Nuage de points ;
    • Comparaison graphique de plusieurs groupes ;
    • Choix des axes et des échelles ;
    • Titres, unités, légendes et annotations ;
    • Risques liés aux graphiques trompeurs ;
    • Analyse exploratoire des données ;
    • Identification des tendances ;
    • Détection des regroupements ;
    • Identification des ruptures et des anomalies ;
    • Analyse bivariée ;
    • Relation entre deux variables quantitatives ;
    • Direction d’une relation ;
    • Intensité apparente d’une relation ;
    • Relation linéaire et relation non linéaire ;
    • Calcul et interprétation de la covariance ;
    • Coefficient de corrélation linéaire de Pearson ;
    • Corrélation positive, négative ou proche de zéro ;
    • Influence des valeurs atypiques sur la corrélation ;
    • Corrélation au sein de sous-groupes ;
    • Variables de confusion ;
    • Distinction entre corrélation et causalité ;
    • Introduction au choix d’un modèle de régression.

    Objectifs pédagogiques :

    • Sélectionner une visualisation adaptée aux données ;
    • Produire des graphiques lisibles et correctement annotés ;
    • Identifier la forme générale d’une distribution ;
    • Détecter graphiquement les valeurs atypiques ;
    • Identifier des tendances et des regroupements ;
    • Interpréter un nuage de points ;
    • Distinguer une relation linéaire d’une relation non linéaire ;
    • Calculer et interpréter la covariance ;
    • Calculer et interpréter le coefficient de corrélation ;
    • Reconnaître l’influence des observations atypiques ;
    • Distinguer association statistique et causalité ;
    • Identifier des variables de confusion possibles ;
    • Déterminer si une relation justifie l’étude d’une régression linéaire ;
    • Préparer l’étudiant à l’examen de mi-parcours.
  • Contenus évalués :

    • Rôle et objectifs de l’analyse des données ;
    • Étapes d’une démarche analytique ;
    • Population, échantillon, observation et variable ;
    • Données primaires et secondaires ;
    • Biais de collecte et représentativité ;
    • Variables qualitatives et quantitatives ;
    • Variables discrètes et continues ;
    • Échelles de mesure ;
    • Variables dépendantes et explicatives ;
    • Qualité des données ;
    • Valeurs manquantes ;
    • Doublons et incohérences ;
    • Valeurs impossibles et atypiques ;
    • Préparation et transformation des données ;
    • Tableaux de fréquences ;
    • Mesures de tendance centrale ;
    • Mesures de dispersion ;
    • Quartiles et écart interquartile ;
    • Distribution normale et score standardisé ;
    • Visualisations statistiques ;
    • Analyse exploratoire ;
    • Covariance et corrélation ;
    • Distinction entre corrélation et causalité.

    Compétences évaluées :

    • Formuler une question analytique ;
    • Identifier les composantes d’une étude statistique ;
    • Classer correctement les variables ;
    • Choisir une échelle de mesure appropriée ;
    • Examiner la qualité d’un jeu de données ;
    • Proposer des opérations de nettoyage cohérentes ;
    • Calculer et interpréter les statistiques descriptives ;
    • Sélectionner une représentation graphique adaptée ;
    • Interpréter un tableau ou un graphique ;
    • Calculer et interpréter une covariance ;
    • Calculer et interpréter une corrélation ;
    • Identifier les limites d’une analyse ;
    • Justifier les méthodes et les conclusions proposées.
  • Contenus :

    • Définition de la régression ;
    • Objectifs de la régression :
      • description ;
      • explication ;
      • prédiction ;
    • Régression linéaire simple ;
    • Variable dépendante ;
    • Variable explicative ;
    • Nuage de points et relation linéaire ;
    • Forme générale du modèle ;
    • Composante déterministe et composante aléatoire ;
    • Droite de régression ;
    • Constante ou ordonnée à l’origine ;
    • Pente ou coefficient de régression ;
    • Valeurs observées ;
    • Valeurs prédites ;
    • Résidus ;
    • Interprétation géométrique du résidu ;
    • Principe de la méthode des moindres carrés ;
    • Somme des carrés des résidus ;
    • Estimation de la pente ;
    • Estimation de la constante ;
    • Relation entre covariance, variance et pente ;
    • Relation entre corrélation et régression ;
    • Conditions générales d’utilisation de la régression linéaire ;
    • Différence entre modèle statistique et relation déterministe ;
    • Régression et causalité ;
    • Limites d’un modèle à une seule variable explicative.

    Objectifs pédagogiques :

    • Définir la régression linéaire simple ;
    • Identifier les variables dépendante et explicative ;
    • Expliquer le rôle de la droite de régression ;
    • Distinguer les valeurs observées et prédites ;
    • Définir et interpréter un résidu ;
    • Expliquer la signification de la constante et de la pente ;
    • Comprendre le principe des moindres carrés ;
    • Relier la pente à la covariance et à la variance ;
    • Distinguer corrélation et régression ;
    • Différencier une utilisation explicative d’une utilisation prédictive ;
    • Reconnaître les limites d’un modèle simple ; 
    • Éviter les interprétations causales injustifiées. 
  • Contenus :

    • Sélection de la variable dépendante ;
    • Choix d’une variable explicative ;
    • Vérification graphique de la relation ;
    • Ajustement d’un modèle linéaire ;
    • Écriture de l’équation estimée ;
    • Interprétation de la constante ;
    • Interprétation de la pente ;
    • Importance des unités de mesure ;
    • Effet d’un changement d’échelle ;
    • Calcul des valeurs prédites ;
    • Calcul des résidus ;
    • Comparaison des valeurs observées et prédites ;
    • Représentation de la droite de régression ;
    • Interpolation ;
    • Extrapolation ;
    • Domaine de validité du modèle ;
    • Prévision ponctuelle ;
    • Introduction à l’incertitude de prévision ;
    • Influence d’une observation atypique sur la droite ;
    • Analyse de situations pratiques :
      • ventes et dépenses publicitaires ;
      • prix et caractéristiques d’un produit ;
      • consommation et température ;
      • performance et charge d’un système ;
    • Présentation des résultats dans un langage non technique ;
    • Limites de l’interprétation de la constante ;
    • Distinction entre signification statistique et importance pratique.

    Objectifs pédagogiques :

    • Sélectionner des variables adaptées à une régression simple ;
    • Vérifier graphiquement la plausibilité d’une relation linéaire ;
    • Estimer et écrire une équation de régression ;
    • Interpréter correctement les coefficients ;
    • Calculer une valeur prédite ;
    • Calculer et interpréter un résidu ;
    • Comparer les observations avec les prédictions ;
    • Distinguer interpolation et extrapolation ;
    • Identifier le domaine de validité du modèle ;
    • Reconnaître l’influence possible d’une valeur atypique ;
    • Présenter les résultats dans les unités appropriées ;
    • Formuler une interprétation compréhensible et prudente.
  • Contenus :

    • Notion de qualité d’ajustement ;
    • Variation totale de la variable dépendante ;
    • Variation expliquée par le modèle ;
    • Variation résiduelle ;
    • Coefficient de détermination ;
    • Interprétation du coefficient de détermination ;
    • Relation entre coefficient de corrélation et coefficient de détermination dans la régression simple ;
    • Limites du coefficient de détermination ;
    • Somme des carrés totale ;
    • Somme des carrés expliquée ;
    • Somme des carrés résiduelle ;
    • Erreur absolue ;
    • Erreur absolue moyenne ;
    • Erreur quadratique ;
    • Erreur quadratique moyenne ;
    • Racine de l’erreur quadratique moyenne ;
    • Comparaison des mesures d’erreur ;
    • Interprétation des erreurs dans les unités de la variable dépendante ;
    • Données d’apprentissage ;
    • Données de validation ;
    • Données de test ;
    • Principe de séparation des données ;
    • Performance d’ajustement et performance de généralisation ;
    • Sous-ajustement ;
    • Surajustement ;
    • Comparaison de plusieurs modèles ;
    • Simplicité et interprétabilité ;
    • Choix d’un modèle adapté à l’objectif ;
    • Présentation honnête de la performance prédictive.

    Objectifs pédagogiques :

    • Expliquer la variation expliquée et la variation résiduelle ;
    • Calculer et interpréter le coefficient de détermination ;
    • Distinguer corrélation et coefficient de détermination ;
    • Calculer les principales mesures d’erreur ;
    • Interpréter les erreurs dans le contexte du problème ;
    • Comparer plusieurs modèles à partir de critères identiques ;
    • Comprendre le rôle des données d’apprentissage et de test ;
    • Distinguer ajustement et généralisation ;
    • Identifier les signes de sous-ajustement et de surajustement ;
    • Sélectionner un modèle en tenant compte de sa performance et de sa simplicité ;
    • Présenter les performances sans en exagérer la portée.
  • Contenus :

    • Rôle de l’analyse des résidus ;
    • Résidus standardisés ;
    • Graphique des résidus en fonction des valeurs prédites ;
    • Résidus en fonction de la variable explicative ;
    • Hypothèse de linéarité ;
    • Signes graphiques d’une relation non linéaire ;
    • Hypothèse d’indépendance des observations ;
    • Dépendance temporelle ou spatiale ;
    • Hypothèse de variance constante ;
    • Homoscédasticité ;
    • Hétéroscédasticité ;
    • Formes graphiques de l’hétéroscédasticité ;
    • Hypothèse de normalité des résidus ;
    • Histogramme des résidus ;
    • Graphique quantile-quantile ;
    • Interprétation introductive de la normalité ;
    • Détection des résidus élevés ;
    • Observations atypiques ;
    • Observations influentes ;
    • Effet de levier ;
    • Influence d’une observation sur les coefficients ;
    • Causes possibles d’une violation des hypothèses ;
    • Erreurs de données ;
    • Variables omises ;
    • Mauvaise forme fonctionnelle ;
    • Transformation logarithmique ou autre transformation simple ;
    • Ajout d’une variable pertinente ;
    • Limites des corrections automatiques ;
    • Effets des violations sur l’interprétation et la prédiction ;
    • Présentation des diagnostics dans un rapport.

    Objectifs pédagogiques :

    • Expliquer le rôle des résidus ;
    • Produire et interpréter les principaux graphiques de diagnostic ;
    • Vérifier la plausibilité de la linéarité ;
    • Comprendre l’hypothèse d’indépendance ;
    • Identifier une dispersion non constante des résidus ;
    • Définir l’hétéroscédasticité ;
    • Examiner la normalité des résidus ;
    • Identifier les observations atypiques et influentes ;
    • Distinguer un problème de données d’un problème de modèle ;
    • Proposer une action corrective raisonnable ;
    • Évaluer les effets d’une violation des hypothèses ; 
    • Formuler une conclusion prudente sur la validité du modèle
  • Contenus :

    • Limites de la régression à une seule variable explicative ;
    • Introduction à la régression linéaire multiple ;
    • Forme générale du modèle multiple ;
    • Variable dépendante et variables explicatives ;
    • Interprétation conditionnelle d’un coefficient ;
    • Maintien constant des autres variables ;
    • Choix des variables explicatives ;
    • Justification théorique et contextuelle ;
    • Risque lié aux variables omises ;
    • Variables catégorielles ;
    • Codage indicateur ;
    • Catégorie de référence ;
    • Interprétation d’un coefficient associé à une catégorie ;
    • Comparaison d’un modèle simple et d’un modèle multiple ;
    • Coefficient de détermination ajusté ;
    • Augmentation mécanique du coefficient de détermination ;
    • Principe de parcimonie ;
    • Variables redondantes ;
    • Introduction à la multicolinéarité ;
    • Effets de la multicolinéarité sur les coefficients ;
    • Sélection raisonnée des variables ;
    • Limites de l’interprétation causale ;
    • Structure d’un rapport d’analyse :
      • contexte ;
      • question ;
      • données ;
      • préparation ;
      • exploration ;
      • modèle ;
      • diagnostics ;
      • résultats ;
      • limites ;
      • recommandations ;
    • Présentation des tableaux et graphiques ;
    • Communication à un public technique et non technique ;
    • Confidentialité et protection des données ;
    • Biais et représentativité ;
    • Transparence des transformations ;
    • Reproductibilité du code et de l’analyse ;
    • Présentation honnête des limites ;
    • Finalisation du projet intégrateur.

    Objectifs pédagogiques :

    • Expliquer l’intérêt de la régression multiple ;
    • Interpréter un coefficient en maintenant les autres variables constantes ;
    • Intégrer une variable catégorielle dans un modèle simple ;
    • Identifier la catégorie de référence ;
    • Comparer un modèle simple à un modèle multiple ;
    • Interpréter le coefficient de détermination ajusté ;
    • Comprendre la notion de parcimonie ;
    • Définir la multicolinéarité ;
    • Reconnaître les effets des variables redondantes ;
    • Sélectionner des variables sur une base justifiable ;
    • Structurer un rapport complet d’analyse ;
    • Communiquer les résultats à différents publics ;
    • Présenter les limites et les risques de manière transparente ;
    • Assurer la reproductibilité de l’analyse ;
    • Finaliser et présenter un projet d’analyse et de régression.
  • Contenus évalués :

    • Analyse des relations entre variables ;
    • Covariance et corrélation ;
    • Corrélation et causalité ;
    • Fondements de la régression linéaire simple ;
    • Variable dépendante et variable explicative ;
    • Droite de régression ;
    • Constante et pente ;
    • Méthode des moindres carrés ;
    • Valeurs observées, valeurs prédites et résidus ;
    • Construction et interprétation d’une équation de régression ;
    • Interpolation et extrapolation ;
    • Coefficient de détermination ;
    • Variation expliquée et variation résiduelle ;
    • Erreur absolue moyenne ;
    • Erreur quadratique moyenne ;
    • Racine de l’erreur quadratique moyenne ;
    • Ensembles d’apprentissage et de test ;
    • Sous-ajustement et surajustement ;
    • Analyse des résidus ;
    • Hypothèse de linéarité ;
    • Indépendance des observations ;
    • Homoscédasticité et hétéroscédasticité ;
    • Normalité des résidus ;
    • Valeurs atypiques et observations influentes ;
    • Introduction à la régression multiple ;
    • Interprétation conditionnelle des coefficients ;
    • Variables catégorielles et catégories de référence ;
    • Coefficient de détermination ajusté ;
    • Multicolinéarité ;
    • Sélection raisonnée des variables ;
    • Communication et reproductibilité ;
    • Confidentialité, biais et intégrité de l’analyse.

    Compétences évaluées :

    • Analyser la relation entre des variables ;
    • Construire une régression linéaire simple ;
    • Interpréter les coefficients du modèle ;
    • Calculer des prédictions et des résidus ;
    • Évaluer la qualité d’ajustement ;
    • Calculer et interpréter les principales mesures d’erreur ;
    • Comparer plusieurs modèles ;
    • Interpréter les graphiques de diagnostic ;
    • Identifier les violations des hypothèses ;
    • Proposer des corrections ou précautions adaptées ;
    • Interpréter un modèle de régression multiple élémentaire ;
    • Intégrer une variable catégorielle ;
    • Identifier les risques de multicolinéarité ;
    • Sélectionner un modèle cohérent et parcimonieux ;
    • Justifier les choix méthodologiques ;
    • Communiquer les résultats et leurs limites ;
    • Respecter les principes d’éthique, de transparence et de reproductibilité.