Revision sheet: Principes fondamentaux de la statistique descriptive

Plan du Cours

  1. Statistiques descriptives
  2. ParamĂštres de position
  3. ParamĂštres de dispersion
  4. Tests d'hypothĂšses
  5. Analyse de variance (ANOVA)
  6. Régression linéaire simple
  7. Régression linéaire multiple
  8. ModÚles linéaires généralisés (GLMs)
  9. Homogénéité des variances
  10. Normalité des résidus
  11. Transformation des données
  12. Indépendance des données

1. Statistiques descriptives

Notions clés & Définitions

  • ParamĂštres de position : mesures qui rĂ©sument la localisation centrale d’un ensemble de donnĂ©es, notamment la moyenne arithmĂ©tique (AUTEUR (date) : mesure de la tendance centrale calculĂ©e en additionnant toutes les valeurs et en divisant par leur nombre), la mĂ©diane (valeur du milieu aprĂšs tri des donnĂ©es), et le mode (valeur la plus frĂ©quente dans l’échantillon).

  • Moyenne arithmĂ©tique : somme des valeurs divisĂ©e par le nombre d’observations, utilisĂ©e pour faire des dĂ©ductions sur la population (voir PERROUX (date) pour la relation avec la population).

  • MĂ©diane : valeur centrale d’un Ă©chantillon ordonnĂ©, robuste face aux valeurs extrĂȘmes.

  • Mode : valeur la plus frĂ©quente dans un ensemble de donnĂ©es.

  • ParamĂštres de dispersion : mesures qui quantifient la variabilitĂ© ou la dispersion des donnĂ©es, notamment la variance (moyenne des carrĂ©s des Ă©carts Ă  la moyenne), l’écart-type (racine carrĂ©e de la variance), et le coefficient de variation (rapport de l’écart-type Ă  la moyenne, exprimĂ© en %).

  • Variance : mesure de la dispersion calculĂ©e par la moyenne des carrĂ©s des Ă©carts Ă  la moyenne, elle indique la dispersion globale.

  • Écart-type : racine carrĂ©e de la variance, exprimant la dispersion dans la mĂȘme unitĂ© que les donnĂ©es.

  • Visualisation de donnĂ©es : outils graphiques pour reprĂ©senter la distribution, notamment le boxplot (boĂźte Ă  moustache) et l’histogramme, permettant d’observer la symĂ©trie, la dispersion et la prĂ©sence de valeurs extrĂȘmes.

Points essentiels

  • Les paramĂštres de position (moyenne, mĂ©diane, mode) permettent de caractĂ©riser la localisation centrale d’un Ă©chantillon, mais leur utilisation dĂ©pend de la forme de la distribution (par exemple, la mĂ©diane est plus robuste en prĂ©sence d’outliers).

  • La moyenne et la mĂ©diane sont Ă©gales dans une distribution symĂ©trique, mais la mĂ©diane est moins sensible aux valeurs extrĂȘmes.

  • La variance et l’écart-type mesurent la dispersion, avec l’écart-type Ă©tant plus intuitif car dans la mĂȘme unitĂ© que les donnĂ©es.

  • Le coefficient de variation permet de comparer la dispersion relative entre diffĂ©rentes sĂ©ries de donnĂ©es.

  • La visualisation via boxplot ou histogramme facilite la comprĂ©hension de la distribution, notamment la dĂ©tection de skewness ou de valeurs aberrantes.

  • La relation entre paramĂštres de position et dispersion est essentielle pour dĂ©crire une distribution (voir Pantel (date) pour la visualisation et l’interprĂ©tation).

  • La valeur attendue d’un paramĂštre dans une population est souvent estimĂ©e par le paramĂštre calculĂ© sur un Ă©chantillon.

À retenir

Les statistiques descriptives permettent de résumer efficacement un ensemble de données en caractérisant sa tendance centrale et sa dispersion, tout en visualisant sa distribution pour mieux comprendre ses caractéristiques fondamentales.

2. ParamĂštres de position

Notions clés & Définitions

  • Moyenne arithmĂ©tique : Somme de toutes les valeurs divisĂ©e par le nombre total d'observations. (AUTEUR non spĂ©cifiĂ©).
  • Mode : La valeur la plus frĂ©quente dans un ensemble de donnĂ©es. (AUTEUR non spĂ©cifiĂ©).
  • MĂ©diane : La valeur qui partage un ensemble de donnĂ©es classĂ© en deux parties Ă©gales. (AUTEUR non spĂ©cifiĂ©).
  • ParamĂštre de position : Mesure centrale permettant de situer la tendance centrale d’un ensemble de donnĂ©es. (AUTEUR non spĂ©cifiĂ©).
  • Distribution asymĂ©trique (skewness) : Indicateur de la symĂ©trie ou de l’asymĂ©trie d’une distribution. (AUTEUR non spĂ©cifiĂ©).
  • Auteurs : La notion de paramĂštres de position est fondamentale dans la statistique descriptive, sans rĂ©fĂ©rence spĂ©cifique Ă  un auteur dans le contenu source.

Points essentiels

  • Les paramĂštres de position (moyenne, mode, mĂ©diane) permettent de rĂ©sumer la localisation centrale d’un ensemble de donnĂ©es. La moyenne est sensible aux valeurs extrĂȘmes, contrairement Ă  la mĂ©diane qui est robuste.
  • La moyenne est souvent utilisĂ©e pour faire des infĂ©rences sur la population, mais peut ĂȘtre biaisĂ©e par des valeurs aberrantes. La mĂ©diane est prĂ©fĂ©rĂ©e en prĂ©sence de distributions asymĂ©triques.
  • La mode indique la valeur la plus frĂ©quente, utile pour des donnĂ©es qualitatives ou discrĂštes.
  • La distribution peut ĂȘtre symĂ©trique ou asymĂ©trique, influençant le choix du paramĂštre de position Ă  utiliser.
  • La visualisation par boĂźte Ă  moustache (boxplot) ou histogramme aide Ă  repĂ©rer la position centrale et la symĂ©trie de la distribution.
  • La valeur Ă  retenir : La mĂ©diane est une mesure robuste pour la position centrale en prĂ©sence de distributions asymĂ©triques ou de valeurs extrĂȘmes.

À retenir

Les paramĂštres de position (moyenne, mĂ©diane, mode) sont essentiels pour dĂ©crire la tendance centrale d’un ensemble de donnĂ©es, chaque mesure ayant ses avantages selon la nature de la distribution.

3. ParamĂštres de dispersion

Notions clés & Définitions

  • Variance : Mesure de la dispersion des valeurs autour de la moyenne, calculĂ©e par s2=∑(xi−xˉ)2n−1s^2 = \frac{\sum (x_i - \bar{x})^2}{n-1} (notion fondamentale en statistique descriptive).
  • Écart-type : Racine carrĂ©e de la variance, s=s2s = \sqrt{s^2}, permettant d'exprimer la dispersion dans la mĂȘme unitĂ© que les donnĂ©es.
  • Coefficient de variation (CV) : Indicateur de dispersion relatif, dĂ©fini par CV=100×sxˉCV = 100 \times \frac{s}{\bar{x}}, utile pour comparer la variabilitĂ© entre diffĂ©rentes sĂ©ries de donnĂ©es (source : CM7).
  • Notion de dispersion dans les modĂšles statistiques : Elle Ă©value la variabilitĂ© des donnĂ©es autour d’un paramĂštre central, essentielle pour la modĂ©lisation et l’infĂ©rence (voir aussi la section sur la variance).
  • Visualisation de la dispersion : La boĂźte Ă  moustache (boxplot) et l’histogramme sont des outils graphiques pour reprĂ©senter la dispersion et dĂ©tecter les outliers (source : CM7).
  • Point Ă  retenir : La dispersion quantifie la variabilitĂ© des donnĂ©es, et ses paramĂštres (variance, Ă©cart-type, CV) sont fondamentaux pour comprendre la distribution et la fiabilitĂ© des estimations.

Points essentiels

  • La variance et l’écart-type mesurent la dispersion absolue, la variance Ă©tant leur carrĂ©, ce qui accentue l’impact des valeurs extrĂȘmes.
  • Le coefficient de variation permet de comparer la dispersion entre sĂ©ries de donnĂ©es avec des unitĂ©s ou des moyennes diffĂ©rentes, facilitant la standardisation de la variabilitĂ©.
  • La visualisation par boxplot ou histogramme permet d’identifier rapidement la dispersion, la prĂ©sence d’outliers, et la forme de la distribution.
  • La variance est utilisĂ©e dans la majoritĂ© des modĂšles statistiques, notamment pour calculer la somme des carrĂ©s, la dĂ©viation standard, et dans les tests d’hypothĂšses (voir aussi la section sur la normalitĂ© et l’homogĂ©nĂ©itĂ©).
  • La relation entre dispersion et prĂ©cision : une faible dispersion indique une estimation plus prĂ©cise de la moyenne ou du paramĂštre de la population.
  • La formule de la variance : s2=∑(xi−xˉ)2n−1s^2 = \frac{\sum (x_i - \bar{x})^2}{n-1}, oĂč nn est la taille de l’échantillon, et xix_i chaque donnĂ©e.

À retenir

Les paramĂštres de dispersion, notamment la variance et l’écart-type, sont essentiels pour Ă©valuer la variabilitĂ© des donnĂ©es, influençant la fiabilitĂ© des estimations et la validitĂ© des modĂšles statistiques.

4. Tests d'hypothĂšses

Notions clés & Définitions

  • HypothĂšse nulle (H0) : Affirmation de dĂ©part que l’on cherche Ă  tester, gĂ©nĂ©ralement une absence d’effet ou de diffĂ©rence (ex : pas de diffĂ©rence entre deux groupes).
  • HypothĂšse alternative (H1) : Affirmation que l’on cherche Ă  prouver, gĂ©nĂ©ralement une prĂ©sence d’effet ou de diffĂ©rence.
  • Valeur p : ProbabilitĂ© d’observer un rĂ©sultat aussi extrĂȘme que celui obtenu, sous l’hypothĂšse nulle. Selon Neyman et Pearson (1933), elle permet de mesurer la compatibilitĂ© des donnĂ©es avec H0.
  • Seuil de signification (α) : Niveau fixĂ© (souvent 0,05) pour dĂ©cider de rejeter H0 si p < α.
  • Erreur de type I (α) : Rejeter H0 alors qu’elle est vraie (faux positif).
  • Erreur de type II (ÎČ) : Ne pas rejeter H0 alors qu’H1 est vraie (faux nĂ©gatif).
  • Test statistique : Fonction qui calcule une statistique Ă  partir des donnĂ©es, permettant de comparer cette valeur Ă  une distribution thĂ©orique pour dĂ©cider du rejet ou non de H0.
  • CritĂšre de dĂ©cision : Rejeter H0 si la valeur p est infĂ©rieure au seuil α, sinon ne pas rejeter H0.
  • Loi de probabilitĂ© : Fonction mathĂ©matique dĂ©crivant la distribution d’une statistique sous H0, utilisĂ©e pour calculer la p-value (ex : loi 𝜒2, loi t).

Points essentiels

  • Les tests d’hypothĂšses permettent de faire une infĂ©rence Ă  partir d’un Ă©chantillon pour Ă©valuer une hypothĂšse sur une population.
  • La valeur p indique la probabilitĂ© d’observer un rĂ©sultat aussi extrĂȘme que celui obtenu si H0 est vraie. Une p-value faible (gĂ©nĂ©ralement < 0,05) conduit au rejet de H0, ce qui suggĂšre une diffĂ©rence ou un effet significatif.
  • La distribution de rĂ©fĂ©rence (ex : loi 𝜒2, loi t) est utilisĂ©e pour dĂ©terminer la valeur critique ou la p-value associĂ©e Ă  la statistique calculĂ©e.
  • La comparaison avec le seuil α permet de prendre une dĂ©cision : si p < α, on rejette H0, sinon on ne peut pas conclure Ă  une diffĂ©rence significative.
  • La probabilitĂ© conditionnelle P(𝜒2 | H0) ou P(t | H0) reprĂ©sente la probabilitĂ© d’observer une valeur donnĂ©e sous H0.
  • La valeur critique est la valeur seuil dans la distribution de rĂ©fĂ©rence, au-delĂ  de laquelle H0 est rejetĂ©e (ex : loi 𝜒2 Ă  3 ddl).
  • La densitĂ© de probabilitĂ© d’une loi continue indique la probabilitĂ© relative d’un rĂ©sultat, mais pas la probabilitĂ© exacte d’un Ă©vĂ©nement prĂ©cis. La zone sous la courbe entre deux valeurs donne la probabilitĂ© que la statistique se trouve dans cet intervalle.
  • La valeur t ou 𝜒2 observĂ©e doit ĂȘtre comparĂ©e Ă  la valeur critique pour dĂ©cider du rejet ou non de H0.

À retenir

Les tests d’hypothĂšses utilisent des statistiques et des lois de probabilitĂ© pour Ă©valuer la compatibilitĂ© des donnĂ©es avec une hypothĂšse nulle, permettant ainsi de dĂ©terminer si une diffĂ©rence ou un effet est statistiquement significatif ou non.

5. Analyse de variance (ANOVA)

Notions clés & Définitions

  • ANOVA (Analyse de Variance) : MĂ©thode statistique permettant de comparer les moyennes de plusieurs groupes pour dĂ©terminer si au moins un groupe diffĂšre significativement des autres (source : Eve Afonso, date non prĂ©cisĂ©e).
  • HypothĂšse nulle (H0) : Tous les groupes ont la mĂȘme moyenne, il n’y a pas de diffĂ©rence significative entre eux.
  • HypothĂšse alternative (H1) : Au moins un groupe a une moyenne diffĂ©rente, indiquant une diffĂ©rence significative.
  • F-statistique : Ratio entre la variance expliquĂ©e par le modĂšle et la variance rĂ©siduelle, utilisĂ© pour tester la significativitĂ© globale du modĂšle (source : Eve Afonso).
  • DegrĂ©s de libertĂ© (ddl) : Nombre de valeurs indĂ©pendantes pouvant varier dans le calcul de la statistique, pour ANOVA, gĂ©nĂ©ralement (k-1) pour le nombre de groupes et (N-k) pour les rĂ©sidus.
  • Variance expliquĂ©e (MS entre) : Variance moyenne entre les groupes, liĂ©e Ă  la diffĂ©rence entre leurs moyennes (source : Eve Afonso).
  • Variance rĂ©siduelle (MS rĂ©siduelle) : Variance moyenne Ă  l’intĂ©rieur des groupes, liĂ©e Ă  la variabilitĂ© non expliquĂ©e par le modĂšle.

Points essentiels

  • L’ANOVA compare la variance entre groupes Ă  la variance Ă  l’intĂ©rieur des groupes pour tester l’hypothĂšse d’égalitĂ© des moyennes (source : Eve Afonso).
  • La statistique F est calculĂ©e par le rapport MS entre / MS rĂ©siduelle. Si cette valeur est significativement Ă©levĂ©e, on rejette H0.
  • La p-value associĂ©e Ă  la F indique la probabilitĂ© d’observer une telle diffĂ©rence si H0 est vraie. Si p < 0,05, on rejette H0, concluant Ă  une diffĂ©rence significative (source : Eve Afonso).
  • La table de l’ANOVA fournit la valeur critique de F pour un niveau de signification donnĂ© et les degrĂ©s de libertĂ© correspondants.
  • Lorsqu’une diffĂ©rence est dĂ©tectĂ©e, des tests post-hoc (ex : Tukey) permettent d’identifier quels groupes diffĂšrent (non mentionnĂ© explicitement dans le contenu source).
  • La prĂ©sence d’interactions dans un modĂšle Ă  plusieurs facteurs (ex : ANOVA Ă  deux facteurs) indique que l’effet d’un facteur dĂ©pend du niveau de l’autre (source : Eve Afonso).

À retenir

L’ANOVA est une mĂ©thode robuste pour tester la diffĂ©rence entre plusieurs moyennes en comparant la variance expliquĂ©e par les groupes Ă  la variabilitĂ© interne, avec une interprĂ©tation basĂ©e sur la statistique F et la p-value associĂ©e.

6. Régression linéaire simple

Notions clés & Définitions

  • RĂ©gression linĂ©aire simple : ModĂšle statistique qui Ă©tablit une relation linĂ©aire entre une variable dĂ©pendante (Y) et une variable indĂ©pendante (X). AUTEUR (date) : permet de prĂ©dire la valeur de Y Ă  partir de X en ajustant une droite aux donnĂ©es.

  • Coefficient de rĂ©gression (b₁) : ParamĂštre estimĂ© qui indique la pente de la droite de rĂ©gression, c’est-Ă -dire la variation moyenne de Y pour une unitĂ© d’augmentation de X. AUTEUR (date) : mesure l’effet de X sur Y.

  • Intercept (b₀) : Point oĂč la droite de rĂ©gression croise l’axe Y, reprĂ©sentant la valeur prĂ©dite de Y lorsque X = 0. AUTEUR (date) : valeur de Y quand X est nul.

  • Erreur rĂ©siduelle (Δ) : DiffĂ©rence entre la valeur observĂ©e de Y et la valeur prĂ©dite par le modĂšle. AUTEUR (date) : mesure de l’ajustement du modĂšle.

  • Coefficient de dĂ©termination (RÂČ) : Indicateur de la proportion de la variance de Y expliquĂ©e par X. AUTEUR (date) : Ă©value la qualitĂ© de l’ajustement du modĂšle.

  • Test t pour le coefficient (b₁) : Test statistique permettant de vĂ©rifier si la pente est significativement diffĂ©rente de zĂ©ro, donc si X influence Y. AUTEUR (date) : test d’hypothĂšse sur le paramĂštre de rĂ©gression.

Points essentiels

  • La rĂ©gression linĂ©aire simple repose sur l’hypothĂšse que la relation entre X et Y est linĂ©aire. La formule du modĂšle est :
    Y=b0+b1X+ΔY = b_0 + b_1 X + Δ
  • La mĂ©thode d’estimation des paramĂštres (b₀, b₁) est la mĂ©thode des moindres carrĂ©s, minimisant la somme des carrĂ©s des erreurs rĂ©siduelles (voir section 4 sur les tests d’hypothĂšses).
  • La significativitĂ© de la relation est testĂ©e via le test t sur b₁, avec une hypothĂšse nulle que b₁ = 0 (aucune relation).
  • La qualitĂ© de l’ajustement est Ă©valuĂ©e par le RÂČ, qui indique la proportion de variance expliquĂ©e par le modĂšle.
  • La validitĂ© du modĂšle suppose que les rĂ©sidus suivent une distribution normale, ont une variance constante (homoscĂ©dasticitĂ©), et sont indĂ©pendants (voir sections 9 et 8).

À retenir

La rĂ©gression linĂ©aire simple permet de modĂ©liser et de prĂ©dire une variable dĂ©pendante Ă  partir d’une variable indĂ©pendante, en estimant la relation par une droite ajustĂ©e aux donnĂ©es, sous rĂ©serve que les hypothĂšses fondamentales soient respectĂ©es.

7. Régression linéaire multiple

Notions clés & Définitions

  • Variables explicatives (ou indĂ©pendantes) : variables utilisĂ©es pour prĂ©dire ou expliquer la variable rĂ©ponse. Elles peuvent ĂȘtre quantitatives ou qualitatives. (Source : Eve Afonso, 2023)
  • Variables dĂ©pendantes (ou rĂ©ponse) : variable que l’on cherche Ă  modĂ©liser ou prĂ©dire en fonction des variables explicatives. (Source : Eve Afonso, 2023)
  • ModĂšle additif : modĂšle oĂč chaque variable explicative agit indĂ©pendamment, sans interaction, sur la variable rĂ©ponse. La relation s’écrit comme une somme des effets. (Source : Eve Afonso, 2023)
  • Interaction (dans le contexte de la rĂ©gression multiple) : effet combinĂ© de deux variables explicatives, oĂč l’impact de l’une dĂ©pend de la valeur de l’autre. Se traduit par un terme d’interaction dans le modĂšle (ex : X * Z). (Source : Eve Afonso, 2023)
  • Coefficient de rĂ©gression (ÎČ) : paramĂštre estimĂ© indiquant la variation moyenne de la variable rĂ©ponse pour une unitĂ© de variation de la variable explicative, en tenant compte des autres variables. (Source : Eve Afonso, 2023)
  • Analyse de variance (ANOVA) : mĂ©thode permettant de tester la significativitĂ© globale du modĂšle ou de ses termes, en comparant la variance expliquĂ©e Ă  la variance rĂ©siduelle. (Source : Eve Afonso, 2023)

Points essentiels

  • La rĂ©gression linĂ©aire multiple permet d’étudier l’effet simultanĂ© de plusieurs variables explicatives sur une variable rĂ©ponse continue.
  • Le modĂšle s’écrit :
    Y=ÎČ0+ÎČ1X1+ÎČ2X2+⋯+ÎČkXk+ΔY = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \dots + \beta_k X_k + \varepsilon
    oĂč ÎČ0\beta_0 est l’intercept, ÎČi\beta_i les coefficients de rĂ©gression, et Δ\varepsilon l’erreur alĂ©atoire.
  • La sĂ©lection des variables explicatives doit respecter le principe de parcimonie : utiliser le moins de paramĂštres possibles tout en conservant une bonne reprĂ©sentativitĂ©.
  • La prĂ©sence d’interactions (X * Z) indique que l’effet d’une variable explicative dĂ©pend de la valeur d’une autre. La modĂ©lisation en interaction permet d’étudier ces effets combinĂ©s.
  • La significativitĂ© des coefficients est Ă©valuĂ©e via le test de Student (p-value). Un coefficient est considĂ©rĂ© comme significatif si p < 0,05.
  • L’analyse de variance (ANOVA) du modĂšle permet de tester si l’ensemble des variables explicatives explique une part significative de la variance de la variable rĂ©ponse.
  • La reprĂ©sentation graphique en 3D ou en projection 2D (fixant une variable) facilite l’interprĂ©tation des interactions.
  • La modĂ©lisation avec interactions est essentielle pour comprendre des effets combinĂ©s, notamment dans des expĂ©riences factoriales ou des modĂšles avec variables qualitatives.
  • La prĂ©sence d’interactions peut rendre l’interprĂ©tation plus complexe, mais elle offre une meilleure comprĂ©hension des effets conjoints.
  • La validation du modĂšle passe par l’analyse des rĂ©sidus, la vĂ©rification des hypothĂšses (normalitĂ©, homogĂ©nĂ©itĂ©, indĂ©pendance), et la significativitĂ© globale.

À retenir

La rĂ©gression linĂ©aire multiple permet d’étudier simultanĂ©ment l’effet de plusieurs variables explicatives, y compris leurs interactions, sur une variable rĂ©ponse continue, tout en respectant le principe de parcimonie pour une interprĂ©tation claire et pertinente.

8. ModÚles linéaires généralisés (GLMs)

Notions clés & Définitions

  • ModĂšle linĂ©aire gĂ©nĂ©ralisĂ© (GLM) : Extension du modĂšle linĂ©aire classique permettant de modĂ©liser une variable rĂ©ponse non nĂ©cessairement quantitative, en utilisant une fonction de lien entre la moyenne conditionnelle et une combinaison linĂ©aire des variables explicatives (Nelder & Wedderburn, 1972).
  • Fonction de lien : Fonction qui relie la moyenne de la variable rĂ©ponse Ă  la combinaison linĂ©aire des variables explicatives, permettant d’adapter le modĂšle Ă  diffĂ©rents types de distributions (binomiale, Poisson, etc.).
  • Distribution exponentielle : Famille de distributions de probabilitĂ© caractĂ©risĂ©es par une densitĂ© ou une fonction de masse pouvant s’écrire sous une forme exponentielle, utilisĂ©e dans les GLMs pour modĂ©liser la variable rĂ©ponse (ex : binomiale, Poisson).
  • DegrĂ© de libertĂ© (ddl) : Nombre de paramĂštres libres dans le modĂšle, influençant la complexitĂ© et la capacitĂ© d’ajustement du modĂšle. Dans les GLMs, il concerne notamment le nombre de paramĂštres estimĂ©s pour la fonction de lien et la distribution.
  • Estimation par maximum de vraisemblance : MĂ©thode utilisĂ©e pour ajuster les paramĂštres du GLM en maximisant la probabilitĂ© d’observer les donnĂ©es, adaptĂ©e aux distributions de la famille exponentielle. (McCullagh & Nelder, 1989).

Points essentiels

  • Les GLMs permettent de modĂ©liser des variables rĂ©ponse de types variĂ©s (binaires, comptages, etc.) en utilisant une fonction de lien adaptĂ©e (logit, log, probit, etc.).
  • La relation entre la moyenne conditionnelle de la variable rĂ©ponse et les variables explicatives est exprimĂ©e par une fonction de lien, souvent choisie selon la distribution (ex : logit pour binomiale, log pour Poisson).
  • La famille de distributions associĂ©e doit appartenir Ă  la famille exponentielle, ce qui facilite l’estimation par maximum de vraisemblance et la dĂ©rivation des propriĂ©tĂ©s statistiques.
  • La sĂ©lection du modĂšle inclut l’analyse des coefficients, leur significativitĂ© (test de Student), et la vĂ©rification des hypothĂšses (normalitĂ©, homogĂ©nĂ©itĂ©, etc. — voir autres sections).
  • La formule gĂ©nĂ©rale d’un GLM :
    g(ÎŒ)=η=XÎČg(\mu) = \eta = X\beta
    oĂč gg est la fonction de lien, ÎŒ\mu la moyenne conditionnelle, XX la matrice des variables explicatives, et ÎČ\beta les paramĂštres estimĂ©s.
  • La validation du modĂšle passe par l’analyse des rĂ©sidus, la significativitĂ© des paramĂštres, et la qualitĂ© de l’ajustement (pseudo RÂČ, tests de rapport de vraisemblance).
  • La complexitĂ© du modĂšle peut inclure des termes d’interaction ou des effets non linĂ©aires via des transformations ou des splines.

À retenir

Les modÚles linéaires généralisés offrent une flexibilité essentielle pour analyser des données non quantitatives en adaptant la fonction de lien et la distribution, permettant de modéliser efficacement une large gamme de phénomÚnes statistiques.

9. Homogénéité des variances

Notions clés & Définitions

  • HomogĂ©nĂ©itĂ© des variances : hypothĂšse selon laquelle toutes les populations comparĂ©es ont des variances identiques. (AUTEUR inconnu, source CM7)
  • Test de Levene : test statistique permettant d’évaluer l’hypothĂšse d’homogĂ©nĂ©itĂ© des variances entre plusieurs groupes. (Levene, 1960)
  • Test de Bartlett : test paramĂ©trique pour vĂ©rifier l’égalitĂ© des variances, sensible aux Ă©carts Ă  la normalitĂ©. (Bartlett, 1937)
  • Variance : mesure de la dispersion des donnĂ©es autour de la moyenne, notĂ©e s2s^2. (source CM7)
  • Point Ă  retenir : La violation de l’hypothĂšse d’homogĂ©nĂ©itĂ© des variances peut compromettre la validitĂ© des tests paramĂ©triques comme l’ANOVA ou le t-test.

Points essentiels

  • L’hypothĂšse d’homogĂ©nĂ©itĂ© des variances est cruciale pour la validitĂ© des tests paramĂ©triques (ANOVA, t-test).
  • Test de Levene : utilisĂ© pour vĂ©rifier cette hypothĂšse, notamment en prĂ©sence de distributions non normales. La statistique est basĂ©e sur la dĂ©viation des valeurs par rapport Ă  la mĂ©diane ou la moyenne.
  • Test de Bartlett : plus sensible aux distributions normales, mais moins robuste en cas de non-normalitĂ©.
  • En cas de non-homogĂ©nĂ©itĂ©, il est conseillĂ© d’utiliser des tests non paramĂ©triques ou de transformer les donnĂ©es (voir section 10).
  • La visualisation par boxplots ou histogrammes peut aider Ă  dĂ©tecter visuellement une inĂ©galitĂ© des variances.
  • La valeur p du test indique si l’on peut rejeter l’hypothĂšse d’homogĂ©nĂ©itĂ© : p < 0,05 suggĂšre une inĂ©galitĂ© significative des variances.
  • La double imposition (voir section 4) : en cas d’hĂ©tĂ©rogĂ©nĂ©itĂ©, il faut ajuster l’analyse ou utiliser des tests robustes.

À retenir

L’homogĂ©nĂ©itĂ© des variances doit ĂȘtre vĂ©rifiĂ©e avant de rĂ©aliser des tests paramĂ©triques, car sa violation peut fausser les rĂ©sultats. En cas de non-homogĂ©nĂ©itĂ©, privilĂ©gier des mĂ©thodes non paramĂ©triques ou des transformations de donnĂ©es.

10. Normalité des résidus

Notions clés & Définitions

  • RĂ©sidu : diffĂ©rence entre la valeur observĂ©e et la valeur prĂ©dite par le modĂšle (rĂ©sidu = observation - prĂ©diction). (AUTEUR inconnu, concept standard)
  • NormalitĂ© des rĂ©sidus : hypothĂšse selon laquelle les rĂ©sidus suivent une distribution normale, condition essentielle pour la validitĂ© de nombreux tests paramĂ©triques. (AUTEUR inconnu, principe fondamental en statistique infĂ©rentielle)
  • Test de Shapiro-Wilk : test statistique utilisĂ© pour vĂ©rifier la normalitĂ© d’un ensemble de donnĂ©es, notamment des rĂ©sidus. (SHAPIRO & WILK, 1965)
  • Q-Q plot (Quantile-Quantile plot) : graphique comparant la distribution empirique des rĂ©sidus Ă  une distribution normale thĂ©orique pour Ă©valuer la normalitĂ© visuellement. (Inconnu, outil graphique standard)
  • Transformation de donnĂ©es : procĂ©dure visant Ă  modifier la distribution des rĂ©sidus pour mieux respecter l’hypothĂšse de normalitĂ©, par exemple par transformation logarithmique ou racine carrĂ©e. (Inconnu, mĂ©thode courante en statistique)
  • Point Ă  retenir : La normalitĂ© des rĂ©sidus est une condition clĂ© pour assurer la validitĂ© des tests paramĂ©triques (ex : t-test, ANOVA), et doit ĂȘtre vĂ©rifiĂ©e systĂ©matiquement lors de l’analyse de modĂšles linĂ©aires.

Points essentiels

  • La normalitĂ© des rĂ©sidus garantit la validitĂ© des infĂ©rences statistiques dans les modĂšles linĂ©aires, notamment pour l’estimation des intervalles de confiance et des tests d’hypothĂšses (voir AUTEUR).
  • La vĂ©rification se fait via des tests statistiques comme le test de Shapiro-Wilk ou le test de Kolmogorov-Smirnov, ainsi que par des reprĂ©sentations graphiques telles que le Q-Q plot ou l’histogramme des rĂ©sidus.
  • En cas de non-normalitĂ©, des transformations de donnĂ©es (logarithmique, racine carrĂ©e, Box-Cox) peuvent ĂȘtre appliquĂ©es pour amĂ©liorer la normalitĂ©.
  • La violation de cette hypothĂšse peut entraĂźner des rĂ©sultats biaisĂ©s ou invalides, notamment des p-values incorrectes ou des intervalles de confiance biaisĂ©s.
  • La normalitĂ© des rĂ©sidus doit ĂȘtre vĂ©rifiĂ©e pour chaque modĂšle, surtout lorsque la taille de l’échantillon est petite, oĂč l’effet de la non-normalitĂ© est plus marquĂ©.
  • La distribution des rĂ©sidus doit Ă©galement prĂ©senter une homogĂ©nĂ©itĂ© de variance (homoscĂ©dasticitĂ©) pour garantir la validitĂ© des tests (voir section 9).

À retenir

La normalitĂ© des rĂ©sidus est une condition essentielle pour la validitĂ© des tests paramĂ©triques en rĂ©gression, et doit ĂȘtre systĂ©matiquement vĂ©rifiĂ©e Ă  l’aide de tests ou de reprĂ©sentations graphiques. En cas de non-normalitĂ©, des transformations peuvent ĂȘtre nĂ©cessaires pour assurer la fiabilitĂ© des infĂ©rences.

11. Transformation des données

Notions clés & Définitions

  • Transformation de donnĂ©es : OpĂ©ration consistant Ă  modifier la forme ou l’échelle des donnĂ©es pour amĂ©liorer leur analyse ou leur interprĂ©tation, notamment en stabilisant la variance ou en rendant la distribution plus normale. (AUTEUR (date) : concept gĂ©nĂ©ral)
  • Logarithme (log) : Fonction mathĂ©matique appliquĂ©e aux donnĂ©es pour rĂ©duire l’asymĂ©trie ou la variance, notamment en transformant une distribution exponentielle en distribution normale. Elle est souvent utilisĂ©e pour traiter des donnĂ©es positives et fortement asymĂ©triques.
  • Transformation de Box-Cox : MĂ©thode paramĂ©trique permettant de dĂ©terminer la meilleure transformation pour rendre une distribution plus normale, en utilisant une famille de transformations paramĂ©trĂ©es par un paramĂštre λ. (AUTEUR (1964) : Box et Cox)
  • Standardisation (z-score) : Transformation qui consiste Ă  soustraire la moyenne et diviser par l’écart-type, pour centrer la distribution autour de 0 avec une variance unitaire.
  • Notion de stabilitĂ© de variance : Concept selon lequel une transformation peut rendre la variance constante Ă  travers diffĂ©rentes valeurs de la variable, facilitant l’application de certains modĂšles statistiques.

Points essentiels

  • La transformation des donnĂ©es est souvent nĂ©cessaire pour respecter les hypothĂšses des modĂšles statistiques, notamment la normalitĂ© et l’homogĂ©nĂ©itĂ© des variances (AUTEUR (date) : principes de la modĂ©lisation paramĂ©trique).
  • La transformation logarithmique est particuliĂšrement efficace pour traiter des donnĂ©es asymĂ©triques positives, en rĂ©duisant l’effet des valeurs extrĂȘmes et en stabilisant la variance.
  • La transformation de Box-Cox permet de dĂ©terminer automatiquement la meilleure transformation parmi une famille de transformations paramĂ©trĂ©es, en maximisant la normalitĂ© des donnĂ©es.
  • La standardisation (z-score) est utile pour comparer des variables sur des Ă©chelles diffĂ©rentes ou pour prĂ©parer les donnĂ©es Ă  des mĂ©thodes sensibles Ă  l’échelle, comme la PCA ou la rĂ©gression.
  • La sĂ©lection de la transformation appropriĂ©e doit se faire en vĂ©rifiant l’amĂ©lioration de la normalitĂ© (tests de normalitĂ©, histogrammes, Q-Q plots) et la stabilitĂ© de la variance.

À retenir

La transformation des donnĂ©es est une Ă©tape clĂ© pour respecter les hypothĂšses des modĂšles statistiques, permettant d’amĂ©liorer la validitĂ© des analyses en stabilisant la variance et en rendant la distribution plus normale.

12. Indépendance des données

Notions clés & Définitions

  • IndĂ©pendance des observations : propriĂ©tĂ© selon laquelle la valeur d'une donnĂ©e ne doit pas influencer ou ĂȘtre influencĂ©e par une autre, garantissant que chaque observation est isolĂ©e des autres dans l’analyse (voir AUTEUR (date)).
  • AutocorrĂ©lation : corrĂ©lation entre les valeurs successives d’une sĂ©rie temporelle ou spatiale, indiquant une dĂ©pendance entre observations proches dans le temps ou l’espace (voir AUTEUR (date)).
  • HypothĂšse d’indĂ©pendance : condition fondamentale dans de nombreux tests statistiques, notamment ceux basĂ©s sur la loi 𝜒2 ou la t de Student, qui suppose que les observations sont indĂ©pendantes (voir AUTEUR (date)).
  • Effet de cluster : situation oĂč des observations regroupĂ©es (clusters) prĂ©sentent une corrĂ©lation interne, compromettant l’indĂ©pendance globale des donnĂ©es (voir AUTEUR (date)).
  • Test de Durbin-Watson : test statistique permettant de dĂ©tecter la prĂ©sence d’autocorrĂ©lation dans les rĂ©sidus d’un modĂšle de rĂ©gression (voir AUTEUR (date)).
  • Crise de dĂ©pendance : situation oĂč la violation de l’indĂ©pendance entraĂźne des biais dans l’estimation des paramĂštres et des erreurs standards, affectant la validitĂ© des tests (voir AUTEUR (date)).

Points essentiels

  • L’indĂ©pendance des donnĂ©es est une condition sine qua non pour la validitĂ© des tests paramĂ©triques classiques (ex : 𝜒2, t de Student, ANOVA). La violation peut conduire Ă  des erreurs de type I ou II, faussant les conclusions (voir AUTEUR (date)).
  • La dĂ©pendance peut rĂ©sulter d’effets de cluster, d’autocorrĂ©lations temporelles ou spatiales, ou de processus de collecte inadĂ©quats. Il est crucial de vĂ©rifier cette hypothĂšse Ă  l’aide de tests spĂ©cifiques comme le test de Durbin-Watson ou des analyses graphiques (voir AUTEUR (date)).
  • Lorsqu’une dĂ©pendance est dĂ©tectĂ©e, il faut recourir Ă  des mĂ©thodes adaptĂ©es telles que les modĂšles Ă  effets mixtes, les modĂšles de sĂ©ries temporelles ou les techniques de rééchantillonnage (voir AUTEUR (date)).
  • La non-indĂ©pendance des donnĂ©es peut entraĂźner une sous-estimation des erreurs standards, augmentant artificiellement la significativitĂ© des rĂ©sultats (voir AUTEUR (date)).
  • La vĂ©rification de l’indĂ©pendance doit prĂ©cĂ©der toute analyse statistique pour garantir la validitĂ© des infĂ©rences (voir AUTEUR (date)).

À retenir

L’indĂ©pendance des donnĂ©es est essentielle pour assurer la validitĂ© des tests statistiques ; sa violation nĂ©cessite l’adoption de mĂ©thodes spĂ©cifiques pour Ă©viter des conclusions erronĂ©es.

Tableaux de SynthĂšse

ThÚmeConcepts ClésMéthodes / OutilsAuteurs / RéférencesRemarques
Statistiques descriptivesMoyenne, MĂ©diane, ModeMesures de tendance centralePERROUX (croissance)La moyenne sensible aux valeurs extrĂȘmes, la mĂ©diane robuste
Variance, Écart-type, Coefficient de variationMesures de dispersionPantel (visualisation)La variance accentue les outliers, CV permet la comparaison relative
ParamÚtres de positionMoyenne, Médiane, ModeMesures centralesNon spécifiéLa médiane est robuste en distribution asymétrique
ParamĂštres de dispersionVariance, Écart-type, CVMesures de dispersionCM7La dispersion influence la prĂ©cision des estimations
Tests d'hypothÚsesH0, H1, p-valueTests t, Chi2, ANOVANon spécifiéLa valeur p indique la significativité statistique
Analyse de variance (ANOVA)Variance intra/inter-groupeComparaison de moyennesNon spécifiéPermet de tester plusieurs groupes simultanément
RĂ©gression linĂ©aire simpleY = a + bXCorrĂ©lation, coefficient RÂČNon spĂ©cifiĂ©Relation entre deux variables continues
Régression multipleY = a + b1X1 + b2X2 + ...Modélisation avec plusieurs variablesNon spécifiéPrédiction et contrÎle de plusieurs facteurs
ModÚles linéaires généralisés (GLMs)Link functions, distributionLogistique, PoissonNon spécifiéPour variables non normales ou discrÚtes
Homogénéité des variancesTest de LeveneVérification de l'égalitéNon spécifiéCondition essentielle pour ANOVA et tests paramétriques
Normalité des résidusTest de Shapiro-WilkVérification de la distributionNon spécifiéCondition pour la validité des tests paramétriques
Transformation des donnĂ©esLog, racine carrĂ©eNormalisation, stabilisationNon spĂ©cifiĂ©AmĂ©liore la normalitĂ© ou l’homogĂ©nĂ©itĂ©
IndĂ©pendance des donnĂ©esRandomisation, testsVĂ©rification de l’absence de dĂ©pendanceNon spĂ©cifiĂ©Condition fondamentale pour la validitĂ© des tests

PiÚges & Confusions Fréquentes

  1. Confondre moyenne et mĂ©diane : la moyenne est sensible aux valeurs extrĂȘmes, la mĂ©diane est robuste.
  2. Utiliser la variance pour comparer la dispersion entre séries avec unités différentes : privilégier le coefficient de variation.
  3. Interpréter une distribution asymétrique en utilisant uniquement la moyenne : la médiane est plus appropriée.
  4. Supposer que la normalité est toujours nécessaire : certains tests (ex : Wilcoxon) ne requiÚrent pas cette condition.
  5. Confondre homoscédasticité et normalité : ce sont deux conditions distinctes pour certains tests.
  6. Omettre de vĂ©rifier l’indĂ©pendance des donnĂ©es : essentiel pour la validitĂ© des tests paramĂ©triques.
  7. Mal interprĂ©ter la valeur p : elle indique la probabilitĂ© d’observer les donnĂ©es si H0 est vraie, pas la probabilitĂ© que H0 soit vraie.

Checklist Examen

  1. Connaßtre la définition de PERROUX sur la croissance et son lien avec la moyenne arithmétique.
  2. Savoir distinguer entre paramÚtres de position : moyenne, médiane, mode, et leur utilisation selon la distribution.
  3. MaĂźtriser la formule et l’interprĂ©tation de la variance, de l’écart-type, et du coefficient de variation.
  4. Être capable d’interprĂ©ter un boxplot et un histogramme pour analyser la distribution et la dispersion.
  5. Comprendre le principe du test d’hypothĂšses, notamment la formulation de H0 et H1, et l’interprĂ©tation de la p-value.
  6. Savoir quand utiliser l’ANOVA pour comparer plusieurs moyennes.
  7. Connaßtre la formule de la régression linéaire simple et ses hypothÚses.
  8. Savoir distinguer régression linéaire multiple et modÚles linéaires généralisés (GLMs).
  9. VĂ©rifier l’homogĂ©nĂ©itĂ© des variances Ă  l’aide du test de Levene.
  10. Vérifier la normalité des résidus avec le test de Shapiro-Wilk.
  11. Connaßtre les principales transformations de données (logarithme, racine carrée) pour normaliser ou stabiliser la variance.
  12. S’assurer de l’indĂ©pendance des donnĂ©es avant de rĂ©aliser des analyses statistiques.

Test your knowledge

Test your knowledge on Principes fondamentaux de la statistique descriptive with 12 multiple-choice questions with detailed corrections.

1. Qu'est-ce que la moyenne arithmétique en statistiques descriptives ?

2. Quelle est la formule de la moyenne arithmétique ?

Take the quiz →

Review with flashcards

Memorize the key concepts of Principes fondamentaux de la statistique descriptive with 23 interactive flashcards.

Statistiques descriptives — dĂ©finition ?

Résumé des données par mesures de tendance centrale et dispersion.

Paramùtres de position — rîle ?

RĂ©sument la localisation centrale d’un ensemble de donnĂ©es.

Moyenne arithmĂ©tique — calcul ?

Somme des valeurs divisĂ©e par le nombre d’observations.

See flashcards →

Similar courses

Create your own revision sheets

Import your course and AI generates sheets, quizzes and flashcards in 30 seconds.

Sheet generator