đ Plan du Cours
- Statistiques descriptives
- ParamĂštres de position
- ParamĂštres de dispersion
- Tests d'hypothĂšses
- Analyse de variance (ANOVA)
- Régression linéaire simple
- Régression linéaire multiple
- ModÚles linéaires généralisés (GLMs)
- Homogénéité des variances
- Normalité des résidus
- Transformation des données
- Indépendance des données
đ 1. Statistiques descriptives
đ Notions clĂ©s & DĂ©finitions
-
ParamĂštres de position : mesures qui rĂ©sument la localisation centrale dâun ensemble de donnĂ©es, notamment la moyenne arithmĂ©tique (AUTEUR (date) : mesure de la tendance centrale calculĂ©e en additionnant toutes les valeurs et en divisant par leur nombre), la mĂ©diane (valeur du milieu aprĂšs tri des donnĂ©es), et le mode (valeur la plus frĂ©quente dans lâĂ©chantillon).
-
Moyenne arithmĂ©tique : somme des valeurs divisĂ©e par le nombre dâobservations, utilisĂ©e pour faire des dĂ©ductions sur la population (voir PERROUX (date) pour la relation avec la population).
-
MĂ©diane : valeur centrale dâun Ă©chantillon ordonnĂ©, robuste face aux valeurs extrĂȘmes.
-
Mode : valeur la plus fréquente dans un ensemble de données.
-
ParamĂštres de dispersion : mesures qui quantifient la variabilitĂ© ou la dispersion des donnĂ©es, notamment la variance (moyenne des carrĂ©s des Ă©carts Ă la moyenne), lâĂ©cart-type (racine carrĂ©e de la variance), et le coefficient de variation (rapport de lâĂ©cart-type Ă la moyenne, exprimĂ© en %).
-
Variance : mesure de la dispersion calculée par la moyenne des carrés des écarts à la moyenne, elle indique la dispersion globale.
-
Ăcart-type : racine carrĂ©e de la variance, exprimant la dispersion dans la mĂȘme unitĂ© que les donnĂ©es.
-
Visualisation de donnĂ©es : outils graphiques pour reprĂ©senter la distribution, notamment le boxplot (boĂźte Ă moustache) et lâhistogramme, permettant dâobserver la symĂ©trie, la dispersion et la prĂ©sence de valeurs extrĂȘmes.
đ Points essentiels
-
Les paramĂštres de position (moyenne, mĂ©diane, mode) permettent de caractĂ©riser la localisation centrale dâun Ă©chantillon, mais leur utilisation dĂ©pend de la forme de la distribution (par exemple, la mĂ©diane est plus robuste en prĂ©sence dâoutliers).
-
La moyenne et la mĂ©diane sont Ă©gales dans une distribution symĂ©trique, mais la mĂ©diane est moins sensible aux valeurs extrĂȘmes.
-
La variance et lâĂ©cart-type mesurent la dispersion, avec lâĂ©cart-type Ă©tant plus intuitif car dans la mĂȘme unitĂ© que les donnĂ©es.
-
Le coefficient de variation permet de comparer la dispersion relative entre différentes séries de données.
-
La visualisation via boxplot ou histogramme facilite la compréhension de la distribution, notamment la détection de skewness ou de valeurs aberrantes.
-
La relation entre paramĂštres de position et dispersion est essentielle pour dĂ©crire une distribution (voir Pantel (date) pour la visualisation et lâinterprĂ©tation).
-
La valeur attendue dâun paramĂštre dans une population est souvent estimĂ©e par le paramĂštre calculĂ© sur un Ă©chantillon.
đĄ Ă retenir
Les statistiques descriptives permettent de résumer efficacement un ensemble de données en caractérisant sa tendance centrale et sa dispersion, tout en visualisant sa distribution pour mieux comprendre ses caractéristiques fondamentales.
đ 2. ParamĂštres de position
đ Notions clĂ©s & DĂ©finitions
- Moyenne arithmétique : Somme de toutes les valeurs divisée par le nombre total d'observations. (AUTEUR non spécifié).
- Mode : La valeur la plus fréquente dans un ensemble de données. (AUTEUR non spécifié).
- Médiane : La valeur qui partage un ensemble de données classé en deux parties égales. (AUTEUR non spécifié).
- ParamĂštre de position : Mesure centrale permettant de situer la tendance centrale dâun ensemble de donnĂ©es. (AUTEUR non spĂ©cifiĂ©).
- Distribution asymĂ©trique (skewness) : Indicateur de la symĂ©trie ou de lâasymĂ©trie dâune distribution. (AUTEUR non spĂ©cifiĂ©).
- Auteurs : La notion de paramÚtres de position est fondamentale dans la statistique descriptive, sans référence spécifique à un auteur dans le contenu source.
đ Points essentiels
- Les paramĂštres de position (moyenne, mode, mĂ©diane) permettent de rĂ©sumer la localisation centrale dâun ensemble de donnĂ©es. La moyenne est sensible aux valeurs extrĂȘmes, contrairement Ă la mĂ©diane qui est robuste.
- La moyenne est souvent utilisĂ©e pour faire des infĂ©rences sur la population, mais peut ĂȘtre biaisĂ©e par des valeurs aberrantes. La mĂ©diane est prĂ©fĂ©rĂ©e en prĂ©sence de distributions asymĂ©triques.
- La mode indique la valeur la plus fréquente, utile pour des données qualitatives ou discrÚtes.
- La distribution peut ĂȘtre symĂ©trique ou asymĂ©trique, influençant le choix du paramĂštre de position Ă utiliser.
- La visualisation par boßte à moustache (boxplot) ou histogramme aide à repérer la position centrale et la symétrie de la distribution.
- La valeur Ă retenir : La mĂ©diane est une mesure robuste pour la position centrale en prĂ©sence de distributions asymĂ©triques ou de valeurs extrĂȘmes.
đĄ Ă retenir
Les paramĂštres de position (moyenne, mĂ©diane, mode) sont essentiels pour dĂ©crire la tendance centrale dâun ensemble de donnĂ©es, chaque mesure ayant ses avantages selon la nature de la distribution.
đ 3. ParamĂštres de dispersion
đ Notions clĂ©s & DĂ©finitions
- Variance : Mesure de la dispersion des valeurs autour de la moyenne, calculĂ©e par s2=nâ1â(xiââxË)2â (notion fondamentale en statistique descriptive).
- Ăcart-type : Racine carrĂ©e de la variance, s=s2â, permettant d'exprimer la dispersion dans la mĂȘme unitĂ© que les donnĂ©es.
- Coefficient de variation (CV) : Indicateur de dispersion relatif, dĂ©fini par CV=100ĂxËsâ, utile pour comparer la variabilitĂ© entre diffĂ©rentes sĂ©ries de donnĂ©es (source : CM7).
- Notion de dispersion dans les modĂšles statistiques : Elle Ă©value la variabilitĂ© des donnĂ©es autour dâun paramĂštre central, essentielle pour la modĂ©lisation et lâinfĂ©rence (voir aussi la section sur la variance).
- Visualisation de la dispersion : La boĂźte Ă moustache (boxplot) et lâhistogramme sont des outils graphiques pour reprĂ©senter la dispersion et dĂ©tecter les outliers (source : CM7).
- Point à retenir : La dispersion quantifie la variabilité des données, et ses paramÚtres (variance, écart-type, CV) sont fondamentaux pour comprendre la distribution et la fiabilité des estimations.
đ Points essentiels
- La variance et lâĂ©cart-type mesurent la dispersion absolue, la variance Ă©tant leur carrĂ©, ce qui accentue lâimpact des valeurs extrĂȘmes.
- Le coefficient de variation permet de comparer la dispersion entre séries de données avec des unités ou des moyennes différentes, facilitant la standardisation de la variabilité.
- La visualisation par boxplot ou histogramme permet dâidentifier rapidement la dispersion, la prĂ©sence dâoutliers, et la forme de la distribution.
- La variance est utilisĂ©e dans la majoritĂ© des modĂšles statistiques, notamment pour calculer la somme des carrĂ©s, la dĂ©viation standard, et dans les tests dâhypothĂšses (voir aussi la section sur la normalitĂ© et lâhomogĂ©nĂ©itĂ©).
- La relation entre dispersion et précision : une faible dispersion indique une estimation plus précise de la moyenne ou du paramÚtre de la population.
- La formule de la variance : s2=nâ1â(xiââxË)2â, oĂč n est la taille de lâĂ©chantillon, et xiâ chaque donnĂ©e.
đĄ Ă retenir
Les paramĂštres de dispersion, notamment la variance et lâĂ©cart-type, sont essentiels pour Ă©valuer la variabilitĂ© des donnĂ©es, influençant la fiabilitĂ© des estimations et la validitĂ© des modĂšles statistiques.
đ 4. Tests d'hypothĂšses
đ Notions clĂ©s & DĂ©finitions
- HypothĂšse nulle (H0) : Affirmation de dĂ©part que lâon cherche Ă tester, gĂ©nĂ©ralement une absence dâeffet ou de diffĂ©rence (ex : pas de diffĂ©rence entre deux groupes).
- HypothĂšse alternative (H1) : Affirmation que lâon cherche Ă prouver, gĂ©nĂ©ralement une prĂ©sence dâeffet ou de diffĂ©rence.
- Valeur p : ProbabilitĂ© dâobserver un rĂ©sultat aussi extrĂȘme que celui obtenu, sous lâhypothĂšse nulle. Selon Neyman et Pearson (1933), elle permet de mesurer la compatibilitĂ© des donnĂ©es avec H0.
- Seuil de signification (α) : Niveau fixé (souvent 0,05) pour décider de rejeter H0 si p < α.
- Erreur de type I (α) : Rejeter H0 alors quâelle est vraie (faux positif).
- Erreur de type II (ÎČ) : Ne pas rejeter H0 alors quâH1 est vraie (faux nĂ©gatif).
- Test statistique : Fonction qui calcule une statistique à partir des données, permettant de comparer cette valeur à une distribution théorique pour décider du rejet ou non de H0.
- CritÚre de décision : Rejeter H0 si la valeur p est inférieure au seuil α, sinon ne pas rejeter H0.
- Loi de probabilitĂ© : Fonction mathĂ©matique dĂ©crivant la distribution dâune statistique sous H0, utilisĂ©e pour calculer la p-value (ex : loi đ2, loi t).
đ Points essentiels
- Les tests dâhypothĂšses permettent de faire une infĂ©rence Ă partir dâun Ă©chantillon pour Ă©valuer une hypothĂšse sur une population.
- La valeur p indique la probabilitĂ© dâobserver un rĂ©sultat aussi extrĂȘme que celui obtenu si H0 est vraie. Une p-value faible (gĂ©nĂ©ralement < 0,05) conduit au rejet de H0, ce qui suggĂšre une diffĂ©rence ou un effet significatif.
- La distribution de rĂ©fĂ©rence (ex : loi đ2, loi t) est utilisĂ©e pour dĂ©terminer la valeur critique ou la p-value associĂ©e Ă la statistique calculĂ©e.
- La comparaison avec le seuil α permet de prendre une décision : si p < α, on rejette H0, sinon on ne peut pas conclure à une différence significative.
- La probabilitĂ© conditionnelle P(đ2 | H0) ou P(t | H0) reprĂ©sente la probabilitĂ© dâobserver une valeur donnĂ©e sous H0.
- La valeur critique est la valeur seuil dans la distribution de rĂ©fĂ©rence, au-delĂ de laquelle H0 est rejetĂ©e (ex : loi đ2 Ă 3 ddl).
- La densitĂ© de probabilitĂ© dâune loi continue indique la probabilitĂ© relative dâun rĂ©sultat, mais pas la probabilitĂ© exacte dâun Ă©vĂ©nement prĂ©cis. La zone sous la courbe entre deux valeurs donne la probabilitĂ© que la statistique se trouve dans cet intervalle.
- La valeur t ou đ2 observĂ©e doit ĂȘtre comparĂ©e Ă la valeur critique pour dĂ©cider du rejet ou non de H0.
đĄ Ă retenir
Les tests dâhypothĂšses utilisent des statistiques et des lois de probabilitĂ© pour Ă©valuer la compatibilitĂ© des donnĂ©es avec une hypothĂšse nulle, permettant ainsi de dĂ©terminer si une diffĂ©rence ou un effet est statistiquement significatif ou non.
đ 5. Analyse de variance (ANOVA)
đ Notions clĂ©s & DĂ©finitions
- ANOVA (Analyse de Variance) : Méthode statistique permettant de comparer les moyennes de plusieurs groupes pour déterminer si au moins un groupe diffÚre significativement des autres (source : Eve Afonso, date non précisée).
- HypothĂšse nulle (H0) : Tous les groupes ont la mĂȘme moyenne, il nây a pas de diffĂ©rence significative entre eux.
- HypothÚse alternative (H1) : Au moins un groupe a une moyenne différente, indiquant une différence significative.
- F-statistique : Ratio entre la variance expliquée par le modÚle et la variance résiduelle, utilisé pour tester la significativité globale du modÚle (source : Eve Afonso).
- Degrés de liberté (ddl) : Nombre de valeurs indépendantes pouvant varier dans le calcul de la statistique, pour ANOVA, généralement (k-1) pour le nombre de groupes et (N-k) pour les résidus.
- Variance expliquée (MS entre) : Variance moyenne entre les groupes, liée à la différence entre leurs moyennes (source : Eve Afonso).
- Variance rĂ©siduelle (MS rĂ©siduelle) : Variance moyenne Ă lâintĂ©rieur des groupes, liĂ©e Ă la variabilitĂ© non expliquĂ©e par le modĂšle.
đ Points essentiels
- LâANOVA compare la variance entre groupes Ă la variance Ă lâintĂ©rieur des groupes pour tester lâhypothĂšse dâĂ©galitĂ© des moyennes (source : Eve Afonso).
- La statistique F est calculée par le rapport MS entre / MS résiduelle. Si cette valeur est significativement élevée, on rejette H0.
- La p-value associĂ©e Ă la F indique la probabilitĂ© dâobserver une telle diffĂ©rence si H0 est vraie. Si p < 0,05, on rejette H0, concluant Ă une diffĂ©rence significative (source : Eve Afonso).
- La table de lâANOVA fournit la valeur critique de F pour un niveau de signification donnĂ© et les degrĂ©s de libertĂ© correspondants.
- Lorsquâune diffĂ©rence est dĂ©tectĂ©e, des tests post-hoc (ex : Tukey) permettent dâidentifier quels groupes diffĂšrent (non mentionnĂ© explicitement dans le contenu source).
- La prĂ©sence dâinteractions dans un modĂšle Ă plusieurs facteurs (ex : ANOVA Ă deux facteurs) indique que lâeffet dâun facteur dĂ©pend du niveau de lâautre (source : Eve Afonso).
đĄ Ă retenir
LâANOVA est une mĂ©thode robuste pour tester la diffĂ©rence entre plusieurs moyennes en comparant la variance expliquĂ©e par les groupes Ă la variabilitĂ© interne, avec une interprĂ©tation basĂ©e sur la statistique F et la p-value associĂ©e.
đ 6. RĂ©gression linĂ©aire simple
đ Notions clĂ©s & DĂ©finitions
-
Régression linéaire simple : ModÚle statistique qui établit une relation linéaire entre une variable dépendante (Y) et une variable indépendante (X). AUTEUR (date) : permet de prédire la valeur de Y à partir de X en ajustant une droite aux données.
-
Coefficient de rĂ©gression (bâ) : ParamĂštre estimĂ© qui indique la pente de la droite de rĂ©gression, câest-Ă -dire la variation moyenne de Y pour une unitĂ© dâaugmentation de X. AUTEUR (date) : mesure lâeffet de X sur Y.
-
Intercept (bâ) : Point oĂč la droite de rĂ©gression croise lâaxe Y, reprĂ©sentant la valeur prĂ©dite de Y lorsque X = 0. AUTEUR (date) : valeur de Y quand X est nul.
-
Erreur rĂ©siduelle (Δ) : DiffĂ©rence entre la valeur observĂ©e de Y et la valeur prĂ©dite par le modĂšle. AUTEUR (date) : mesure de lâajustement du modĂšle.
-
Coefficient de dĂ©termination (RÂČ) : Indicateur de la proportion de la variance de Y expliquĂ©e par X. AUTEUR (date) : Ă©value la qualitĂ© de lâajustement du modĂšle.
-
Test t pour le coefficient (bâ) : Test statistique permettant de vĂ©rifier si la pente est significativement diffĂ©rente de zĂ©ro, donc si X influence Y. AUTEUR (date) : test dâhypothĂšse sur le paramĂštre de rĂ©gression.
đ Points essentiels
- La rĂ©gression linĂ©aire simple repose sur lâhypothĂšse que la relation entre X et Y est linĂ©aire. La formule du modĂšle est :
Y=b0â+b1âX+Δ
- La mĂ©thode dâestimation des paramĂštres (bâ, bâ) est la mĂ©thode des moindres carrĂ©s, minimisant la somme des carrĂ©s des erreurs rĂ©siduelles (voir section 4 sur les tests dâhypothĂšses).
- La significativitĂ© de la relation est testĂ©e via le test t sur bâ, avec une hypothĂšse nulle que bâ = 0 (aucune relation).
- La qualitĂ© de lâajustement est Ă©valuĂ©e par le RÂČ, qui indique la proportion de variance expliquĂ©e par le modĂšle.
- La validité du modÚle suppose que les résidus suivent une distribution normale, ont une variance constante (homoscédasticité), et sont indépendants (voir sections 9 et 8).
đĄ Ă retenir
La rĂ©gression linĂ©aire simple permet de modĂ©liser et de prĂ©dire une variable dĂ©pendante Ă partir dâune variable indĂ©pendante, en estimant la relation par une droite ajustĂ©e aux donnĂ©es, sous rĂ©serve que les hypothĂšses fondamentales soient respectĂ©es.
đ 7. RĂ©gression linĂ©aire multiple
đ Notions clĂ©s & DĂ©finitions
- Variables explicatives (ou indĂ©pendantes) : variables utilisĂ©es pour prĂ©dire ou expliquer la variable rĂ©ponse. Elles peuvent ĂȘtre quantitatives ou qualitatives. (Source : Eve Afonso, 2023)
- Variables dĂ©pendantes (ou rĂ©ponse) : variable que lâon cherche Ă modĂ©liser ou prĂ©dire en fonction des variables explicatives. (Source : Eve Afonso, 2023)
- ModĂšle additif : modĂšle oĂč chaque variable explicative agit indĂ©pendamment, sans interaction, sur la variable rĂ©ponse. La relation sâĂ©crit comme une somme des effets. (Source : Eve Afonso, 2023)
- Interaction (dans le contexte de la rĂ©gression multiple) : effet combinĂ© de deux variables explicatives, oĂč lâimpact de lâune dĂ©pend de la valeur de lâautre. Se traduit par un terme dâinteraction dans le modĂšle (ex : X * Z). (Source : Eve Afonso, 2023)
- Coefficient de rĂ©gression (ÎČ) : paramĂštre estimĂ© indiquant la variation moyenne de la variable rĂ©ponse pour une unitĂ© de variation de la variable explicative, en tenant compte des autres variables. (Source : Eve Afonso, 2023)
- Analyse de variance (ANOVA) : méthode permettant de tester la significativité globale du modÚle ou de ses termes, en comparant la variance expliquée à la variance résiduelle. (Source : Eve Afonso, 2023)
đ Points essentiels
- La rĂ©gression linĂ©aire multiple permet dâĂ©tudier lâeffet simultanĂ© de plusieurs variables explicatives sur une variable rĂ©ponse continue.
- Le modĂšle sâĂ©crit :
Y=ÎČ0â+ÎČ1âX1â+ÎČ2âX2â+âŻ+ÎČkâXkâ+Δ
oĂč ÎČ0â est lâintercept, ÎČiâ les coefficients de rĂ©gression, et Δ lâerreur alĂ©atoire.
- La sélection des variables explicatives doit respecter le principe de parcimonie : utiliser le moins de paramÚtres possibles tout en conservant une bonne représentativité.
- La prĂ©sence dâinteractions (X * Z) indique que lâeffet dâune variable explicative dĂ©pend de la valeur dâune autre. La modĂ©lisation en interaction permet dâĂ©tudier ces effets combinĂ©s.
- La significativité des coefficients est évaluée via le test de Student (p-value). Un coefficient est considéré comme significatif si p < 0,05.
- Lâanalyse de variance (ANOVA) du modĂšle permet de tester si lâensemble des variables explicatives explique une part significative de la variance de la variable rĂ©ponse.
- La reprĂ©sentation graphique en 3D ou en projection 2D (fixant une variable) facilite lâinterprĂ©tation des interactions.
- La modélisation avec interactions est essentielle pour comprendre des effets combinés, notamment dans des expériences factoriales ou des modÚles avec variables qualitatives.
- La prĂ©sence dâinteractions peut rendre lâinterprĂ©tation plus complexe, mais elle offre une meilleure comprĂ©hension des effets conjoints.
- La validation du modĂšle passe par lâanalyse des rĂ©sidus, la vĂ©rification des hypothĂšses (normalitĂ©, homogĂ©nĂ©itĂ©, indĂ©pendance), et la significativitĂ© globale.
đĄ Ă retenir
La rĂ©gression linĂ©aire multiple permet dâĂ©tudier simultanĂ©ment lâeffet de plusieurs variables explicatives, y compris leurs interactions, sur une variable rĂ©ponse continue, tout en respectant le principe de parcimonie pour une interprĂ©tation claire et pertinente.
đ 8. ModĂšles linĂ©aires gĂ©nĂ©ralisĂ©s (GLMs)
đ Notions clĂ©s & DĂ©finitions
- ModÚle linéaire généralisé (GLM) : Extension du modÚle linéaire classique permettant de modéliser une variable réponse non nécessairement quantitative, en utilisant une fonction de lien entre la moyenne conditionnelle et une combinaison linéaire des variables explicatives (Nelder & Wedderburn, 1972).
- Fonction de lien : Fonction qui relie la moyenne de la variable rĂ©ponse Ă la combinaison linĂ©aire des variables explicatives, permettant dâadapter le modĂšle Ă diffĂ©rents types de distributions (binomiale, Poisson, etc.).
- Distribution exponentielle : Famille de distributions de probabilitĂ© caractĂ©risĂ©es par une densitĂ© ou une fonction de masse pouvant sâĂ©crire sous une forme exponentielle, utilisĂ©e dans les GLMs pour modĂ©liser la variable rĂ©ponse (ex : binomiale, Poisson).
- DegrĂ© de libertĂ© (ddl) : Nombre de paramĂštres libres dans le modĂšle, influençant la complexitĂ© et la capacitĂ© dâajustement du modĂšle. Dans les GLMs, il concerne notamment le nombre de paramĂštres estimĂ©s pour la fonction de lien et la distribution.
- Estimation par maximum de vraisemblance : MĂ©thode utilisĂ©e pour ajuster les paramĂštres du GLM en maximisant la probabilitĂ© dâobserver les donnĂ©es, adaptĂ©e aux distributions de la famille exponentielle. (McCullagh & Nelder, 1989).
đ Points essentiels
- Les GLMs permettent de modéliser des variables réponse de types variés (binaires, comptages, etc.) en utilisant une fonction de lien adaptée (logit, log, probit, etc.).
- La relation entre la moyenne conditionnelle de la variable réponse et les variables explicatives est exprimée par une fonction de lien, souvent choisie selon la distribution (ex : logit pour binomiale, log pour Poisson).
- La famille de distributions associĂ©e doit appartenir Ă la famille exponentielle, ce qui facilite lâestimation par maximum de vraisemblance et la dĂ©rivation des propriĂ©tĂ©s statistiques.
- La sĂ©lection du modĂšle inclut lâanalyse des coefficients, leur significativitĂ© (test de Student), et la vĂ©rification des hypothĂšses (normalitĂ©, homogĂ©nĂ©itĂ©, etc. â voir autres sections).
- La formule gĂ©nĂ©rale dâun GLM :
g(ÎŒ)=η=XÎČ
oĂč g est la fonction de lien, ÎŒ la moyenne conditionnelle, X la matrice des variables explicatives, et ÎČ les paramĂštres estimĂ©s.
- La validation du modĂšle passe par lâanalyse des rĂ©sidus, la significativitĂ© des paramĂštres, et la qualitĂ© de lâajustement (pseudo RÂČ, tests de rapport de vraisemblance).
- La complexitĂ© du modĂšle peut inclure des termes dâinteraction ou des effets non linĂ©aires via des transformations ou des splines.
đĄ Ă retenir
Les modÚles linéaires généralisés offrent une flexibilité essentielle pour analyser des données non quantitatives en adaptant la fonction de lien et la distribution, permettant de modéliser efficacement une large gamme de phénomÚnes statistiques.
đ 9. HomogĂ©nĂ©itĂ© des variances
đ Notions clĂ©s & DĂ©finitions
- Homogénéité des variances : hypothÚse selon laquelle toutes les populations comparées ont des variances identiques. (AUTEUR inconnu, source CM7)
- Test de Levene : test statistique permettant dâĂ©valuer lâhypothĂšse dâhomogĂ©nĂ©itĂ© des variances entre plusieurs groupes. (Levene, 1960)
- Test de Bartlett : test paramĂ©trique pour vĂ©rifier lâĂ©galitĂ© des variances, sensible aux Ă©carts Ă la normalitĂ©. (Bartlett, 1937)
- Variance : mesure de la dispersion des données autour de la moyenne, notée s2. (source CM7)
- Point Ă retenir : La violation de lâhypothĂšse dâhomogĂ©nĂ©itĂ© des variances peut compromettre la validitĂ© des tests paramĂ©triques comme lâANOVA ou le t-test.
đ Points essentiels
- LâhypothĂšse dâhomogĂ©nĂ©itĂ© des variances est cruciale pour la validitĂ© des tests paramĂ©triques (ANOVA, t-test).
- Test de Levene : utilisé pour vérifier cette hypothÚse, notamment en présence de distributions non normales. La statistique est basée sur la déviation des valeurs par rapport à la médiane ou la moyenne.
- Test de Bartlett : plus sensible aux distributions normales, mais moins robuste en cas de non-normalité.
- En cas de non-homogĂ©nĂ©itĂ©, il est conseillĂ© dâutiliser des tests non paramĂ©triques ou de transformer les donnĂ©es (voir section 10).
- La visualisation par boxplots ou histogrammes peut aider à détecter visuellement une inégalité des variances.
- La valeur p du test indique si lâon peut rejeter lâhypothĂšse dâhomogĂ©nĂ©itĂ© : p < 0,05 suggĂšre une inĂ©galitĂ© significative des variances.
- La double imposition (voir section 4) : en cas dâhĂ©tĂ©rogĂ©nĂ©itĂ©, il faut ajuster lâanalyse ou utiliser des tests robustes.
đĄ Ă retenir
LâhomogĂ©nĂ©itĂ© des variances doit ĂȘtre vĂ©rifiĂ©e avant de rĂ©aliser des tests paramĂ©triques, car sa violation peut fausser les rĂ©sultats. En cas de non-homogĂ©nĂ©itĂ©, privilĂ©gier des mĂ©thodes non paramĂ©triques ou des transformations de donnĂ©es.
đ 10. NormalitĂ© des rĂ©sidus
đ Notions clĂ©s & DĂ©finitions
- Résidu : différence entre la valeur observée et la valeur prédite par le modÚle (résidu = observation - prédiction). (AUTEUR inconnu, concept standard)
- Normalité des résidus : hypothÚse selon laquelle les résidus suivent une distribution normale, condition essentielle pour la validité de nombreux tests paramétriques. (AUTEUR inconnu, principe fondamental en statistique inférentielle)
- Test de Shapiro-Wilk : test statistique utilisĂ© pour vĂ©rifier la normalitĂ© dâun ensemble de donnĂ©es, notamment des rĂ©sidus. (SHAPIRO & WILK, 1965)
- Q-Q plot (Quantile-Quantile plot) : graphique comparant la distribution empirique des résidus à une distribution normale théorique pour évaluer la normalité visuellement. (Inconnu, outil graphique standard)
- Transformation de donnĂ©es : procĂ©dure visant Ă modifier la distribution des rĂ©sidus pour mieux respecter lâhypothĂšse de normalitĂ©, par exemple par transformation logarithmique ou racine carrĂ©e. (Inconnu, mĂ©thode courante en statistique)
- Point Ă retenir : La normalitĂ© des rĂ©sidus est une condition clĂ© pour assurer la validitĂ© des tests paramĂ©triques (ex : t-test, ANOVA), et doit ĂȘtre vĂ©rifiĂ©e systĂ©matiquement lors de lâanalyse de modĂšles linĂ©aires.
đ Points essentiels
- La normalitĂ© des rĂ©sidus garantit la validitĂ© des infĂ©rences statistiques dans les modĂšles linĂ©aires, notamment pour lâestimation des intervalles de confiance et des tests dâhypothĂšses (voir AUTEUR).
- La vĂ©rification se fait via des tests statistiques comme le test de Shapiro-Wilk ou le test de Kolmogorov-Smirnov, ainsi que par des reprĂ©sentations graphiques telles que le Q-Q plot ou lâhistogramme des rĂ©sidus.
- En cas de non-normalitĂ©, des transformations de donnĂ©es (logarithmique, racine carrĂ©e, Box-Cox) peuvent ĂȘtre appliquĂ©es pour amĂ©liorer la normalitĂ©.
- La violation de cette hypothÚse peut entraßner des résultats biaisés ou invalides, notamment des p-values incorrectes ou des intervalles de confiance biaisés.
- La normalitĂ© des rĂ©sidus doit ĂȘtre vĂ©rifiĂ©e pour chaque modĂšle, surtout lorsque la taille de lâĂ©chantillon est petite, oĂč lâeffet de la non-normalitĂ© est plus marquĂ©.
- La distribution des résidus doit également présenter une homogénéité de variance (homoscédasticité) pour garantir la validité des tests (voir section 9).
đĄ Ă retenir
La normalitĂ© des rĂ©sidus est une condition essentielle pour la validitĂ© des tests paramĂ©triques en rĂ©gression, et doit ĂȘtre systĂ©matiquement vĂ©rifiĂ©e Ă lâaide de tests ou de reprĂ©sentations graphiques. En cas de non-normalitĂ©, des transformations peuvent ĂȘtre nĂ©cessaires pour assurer la fiabilitĂ© des infĂ©rences.
đ Notions clĂ©s & DĂ©finitions
- Transformation de donnĂ©es : OpĂ©ration consistant Ă modifier la forme ou lâĂ©chelle des donnĂ©es pour amĂ©liorer leur analyse ou leur interprĂ©tation, notamment en stabilisant la variance ou en rendant la distribution plus normale. (AUTEUR (date) : concept gĂ©nĂ©ral)
- Logarithme (log) : Fonction mathĂ©matique appliquĂ©e aux donnĂ©es pour rĂ©duire lâasymĂ©trie ou la variance, notamment en transformant une distribution exponentielle en distribution normale. Elle est souvent utilisĂ©e pour traiter des donnĂ©es positives et fortement asymĂ©triques.
- Transformation de Box-Cox : Méthode paramétrique permettant de déterminer la meilleure transformation pour rendre une distribution plus normale, en utilisant une famille de transformations paramétrées par un paramÚtre λ. (AUTEUR (1964) : Box et Cox)
- Standardisation (z-score) : Transformation qui consiste Ă soustraire la moyenne et diviser par lâĂ©cart-type, pour centrer la distribution autour de 0 avec une variance unitaire.
- Notion de stabilitĂ© de variance : Concept selon lequel une transformation peut rendre la variance constante Ă travers diffĂ©rentes valeurs de la variable, facilitant lâapplication de certains modĂšles statistiques.
đ Points essentiels
- La transformation des donnĂ©es est souvent nĂ©cessaire pour respecter les hypothĂšses des modĂšles statistiques, notamment la normalitĂ© et lâhomogĂ©nĂ©itĂ© des variances (AUTEUR (date) : principes de la modĂ©lisation paramĂ©trique).
- La transformation logarithmique est particuliĂšrement efficace pour traiter des donnĂ©es asymĂ©triques positives, en rĂ©duisant lâeffet des valeurs extrĂȘmes et en stabilisant la variance.
- La transformation de Box-Cox permet de déterminer automatiquement la meilleure transformation parmi une famille de transformations paramétrées, en maximisant la normalité des données.
- La standardisation (z-score) est utile pour comparer des variables sur des Ă©chelles diffĂ©rentes ou pour prĂ©parer les donnĂ©es Ă des mĂ©thodes sensibles Ă lâĂ©chelle, comme la PCA ou la rĂ©gression.
- La sĂ©lection de la transformation appropriĂ©e doit se faire en vĂ©rifiant lâamĂ©lioration de la normalitĂ© (tests de normalitĂ©, histogrammes, Q-Q plots) et la stabilitĂ© de la variance.
đĄ Ă retenir
La transformation des donnĂ©es est une Ă©tape clĂ© pour respecter les hypothĂšses des modĂšles statistiques, permettant dâamĂ©liorer la validitĂ© des analyses en stabilisant la variance et en rendant la distribution plus normale.
đ 12. IndĂ©pendance des donnĂ©es
đ Notions clĂ©s & DĂ©finitions
- IndĂ©pendance des observations : propriĂ©tĂ© selon laquelle la valeur d'une donnĂ©e ne doit pas influencer ou ĂȘtre influencĂ©e par une autre, garantissant que chaque observation est isolĂ©e des autres dans lâanalyse (voir AUTEUR (date)).
- AutocorrĂ©lation : corrĂ©lation entre les valeurs successives dâune sĂ©rie temporelle ou spatiale, indiquant une dĂ©pendance entre observations proches dans le temps ou lâespace (voir AUTEUR (date)).
- HypothĂšse dâindĂ©pendance : condition fondamentale dans de nombreux tests statistiques, notamment ceux basĂ©s sur la loi đ2 ou la t de Student, qui suppose que les observations sont indĂ©pendantes (voir AUTEUR (date)).
- Effet de cluster : situation oĂč des observations regroupĂ©es (clusters) prĂ©sentent une corrĂ©lation interne, compromettant lâindĂ©pendance globale des donnĂ©es (voir AUTEUR (date)).
- Test de Durbin-Watson : test statistique permettant de dĂ©tecter la prĂ©sence dâautocorrĂ©lation dans les rĂ©sidus dâun modĂšle de rĂ©gression (voir AUTEUR (date)).
- Crise de dĂ©pendance : situation oĂč la violation de lâindĂ©pendance entraĂźne des biais dans lâestimation des paramĂštres et des erreurs standards, affectant la validitĂ© des tests (voir AUTEUR (date)).
đ Points essentiels
- LâindĂ©pendance des donnĂ©es est une condition sine qua non pour la validitĂ© des tests paramĂ©triques classiques (ex : đ2, t de Student, ANOVA). La violation peut conduire Ă des erreurs de type I ou II, faussant les conclusions (voir AUTEUR (date)).
- La dĂ©pendance peut rĂ©sulter dâeffets de cluster, dâautocorrĂ©lations temporelles ou spatiales, ou de processus de collecte inadĂ©quats. Il est crucial de vĂ©rifier cette hypothĂšse Ă lâaide de tests spĂ©cifiques comme le test de Durbin-Watson ou des analyses graphiques (voir AUTEUR (date)).
- Lorsquâune dĂ©pendance est dĂ©tectĂ©e, il faut recourir Ă des mĂ©thodes adaptĂ©es telles que les modĂšles Ă effets mixtes, les modĂšles de sĂ©ries temporelles ou les techniques de rééchantillonnage (voir AUTEUR (date)).
- La non-indépendance des données peut entraßner une sous-estimation des erreurs standards, augmentant artificiellement la significativité des résultats (voir AUTEUR (date)).
- La vĂ©rification de lâindĂ©pendance doit prĂ©cĂ©der toute analyse statistique pour garantir la validitĂ© des infĂ©rences (voir AUTEUR (date)).
đĄ Ă retenir
LâindĂ©pendance des donnĂ©es est essentielle pour assurer la validitĂ© des tests statistiques ; sa violation nĂ©cessite lâadoption de mĂ©thodes spĂ©cifiques pour Ă©viter des conclusions erronĂ©es.
đ Tableaux de SynthĂšse
| ThÚme | Concepts Clés | Méthodes / Outils | Auteurs / Références | Remarques |
|---|
| Statistiques descriptives | Moyenne, MĂ©diane, Mode | Mesures de tendance centrale | PERROUX (croissance) | La moyenne sensible aux valeurs extrĂȘmes, la mĂ©diane robuste |
| Variance, Ăcart-type, Coefficient de variation | Mesures de dispersion | Pantel (visualisation) | La variance accentue les outliers, CV permet la comparaison relative |
| ParamÚtres de position | Moyenne, Médiane, Mode | Mesures centrales | Non spécifié | La médiane est robuste en distribution asymétrique |
| ParamĂštres de dispersion | Variance, Ăcart-type, CV | Mesures de dispersion | CM7 | La dispersion influence la prĂ©cision des estimations |
| Tests d'hypothÚses | H0, H1, p-value | Tests t, Chi2, ANOVA | Non spécifié | La valeur p indique la significativité statistique |
| Analyse de variance (ANOVA) | Variance intra/inter-groupe | Comparaison de moyennes | Non spécifié | Permet de tester plusieurs groupes simultanément |
| RĂ©gression linĂ©aire simple | Y = a + bX | CorrĂ©lation, coefficient RÂČ | Non spĂ©cifiĂ© | Relation entre deux variables continues |
| Régression multiple | Y = a + b1X1 + b2X2 + ... | Modélisation avec plusieurs variables | Non spécifié | Prédiction et contrÎle de plusieurs facteurs |
| ModÚles linéaires généralisés (GLMs) | Link functions, distribution | Logistique, Poisson | Non spécifié | Pour variables non normales ou discrÚtes |
| Homogénéité des variances | Test de Levene | Vérification de l'égalité | Non spécifié | Condition essentielle pour ANOVA et tests paramétriques |
| Normalité des résidus | Test de Shapiro-Wilk | Vérification de la distribution | Non spécifié | Condition pour la validité des tests paramétriques |
| Transformation des donnĂ©es | Log, racine carrĂ©e | Normalisation, stabilisation | Non spĂ©cifiĂ© | AmĂ©liore la normalitĂ© ou lâhomogĂ©nĂ©itĂ© |
| IndĂ©pendance des donnĂ©es | Randomisation, tests | VĂ©rification de lâabsence de dĂ©pendance | Non spĂ©cifiĂ© | Condition fondamentale pour la validitĂ© des tests |
â ïž PiĂšges & Confusions FrĂ©quentes
- Confondre moyenne et mĂ©diane : la moyenne est sensible aux valeurs extrĂȘmes, la mĂ©diane est robuste.
- Utiliser la variance pour comparer la dispersion entre séries avec unités différentes : privilégier le coefficient de variation.
- Interpréter une distribution asymétrique en utilisant uniquement la moyenne : la médiane est plus appropriée.
- Supposer que la normalité est toujours nécessaire : certains tests (ex : Wilcoxon) ne requiÚrent pas cette condition.
- Confondre homoscédasticité et normalité : ce sont deux conditions distinctes pour certains tests.
- Omettre de vĂ©rifier lâindĂ©pendance des donnĂ©es : essentiel pour la validitĂ© des tests paramĂ©triques.
- Mal interprĂ©ter la valeur p : elle indique la probabilitĂ© dâobserver les donnĂ©es si H0 est vraie, pas la probabilitĂ© que H0 soit vraie.
â
Checklist Examen
- Connaßtre la définition de PERROUX sur la croissance et son lien avec la moyenne arithmétique.
- Savoir distinguer entre paramÚtres de position : moyenne, médiane, mode, et leur utilisation selon la distribution.
- MaĂźtriser la formule et lâinterprĂ©tation de la variance, de lâĂ©cart-type, et du coefficient de variation.
- Ătre capable dâinterprĂ©ter un boxplot et un histogramme pour analyser la distribution et la dispersion.
- Comprendre le principe du test dâhypothĂšses, notamment la formulation de H0 et H1, et lâinterprĂ©tation de la p-value.
- Savoir quand utiliser lâANOVA pour comparer plusieurs moyennes.
- Connaßtre la formule de la régression linéaire simple et ses hypothÚses.
- Savoir distinguer régression linéaire multiple et modÚles linéaires généralisés (GLMs).
- VĂ©rifier lâhomogĂ©nĂ©itĂ© des variances Ă lâaide du test de Levene.
- Vérifier la normalité des résidus avec le test de Shapiro-Wilk.
- Connaßtre les principales transformations de données (logarithme, racine carrée) pour normaliser ou stabiliser la variance.
- Sâassurer de lâindĂ©pendance des donnĂ©es avant de rĂ©aliser des analyses statistiques.
Create your own revision sheets
Import your course and AI generates sheets, quizzes and flashcards in 30 seconds.
Sheet generator