Retourner au courant

Introduction - Statistiques

Cette fiche récapitulative présente les notions de base en statistiques. Elle est destinée aux étudiants de première année de licence.

FR

Pour illustrer cette fiche récapitulative, nous allons prendre comme exemple une population composée de 10 individus avec pour variables :

  • Cancer (bool) : La présence ou non d’un cancer chez l’individu
  • Age (entier) : L’âge de l’individu
  • Revenu (entier) : Le revenu de l’individu
  • Loyer (entier) : Le loyer de l’individu

Notions de base

Variable

Une variable est une caractéristique d’un échantillon pouvant prendre plusieurs valeurs. Dans le cas de notre exemple, les variables sont Cancer, Age et Revenu.

Type d’une variable

  • Variable qualitative : Une variable qualitative (ou catégorique) décrit une catégorie plutôt qu’une quantité. Exemple : Cancer prend les modalités oui ou non. Une couleur est également une variable qualitative.
  • Variable quantitative : Une variable quantitative (ou numérique) représente une quantité et peut être discrète ou continue. Age et Revenu sont ici quantitatifs. Un numéro de téléphone reste un identifiant : calculer sa moyenne n’a pas de sens.
  • Variable nominale: Une variable nominale est une variable qualitative qui ne possède pas d’ordre. Exemple : Cancer est une variable nominale car elle n’est pas associé à un ordre. Oui n’est pas plus grand que non.
  • Variable ordinale: Une variable ordonnée (ordinale) est une variable qualitative qui possède un ordre. Exemple : Bronze, Argent, Or sont associées à un ordre.
  • Variable discrète vs Variable continue : une variable quantitative discrète prend un ensemble fini ou dénombrable de valeurs, tandis qu’une variable quantitative continue peut prendre toute valeur d’un intervalle. Le nombre d’enfants est discret. L’âge exact est continu, même s’il est arrondi ici à un entier. Une note entière sur 20 est discrète.

Unité statistique

Une unité statistique est l’objet d’étude d’une enquête statistique. Dans notre exemple, l’unité statistique est l’individu.

Mesures

Soit DD un échantillon de taille nn. On appelle mesure une fonction qui associe à une ou plusieurs variables une valeur.

Reprenons notre exemple avec les variables Cancer, Age, Revenu, Loyer.

CancerAgeRevenuLoyer
non20800500
oui403000900
non302200700
oui5050001600
oui601500600
non20800500
oui401800600
oui8032001000
non302200700
non502000500

Moyenne

La moyenne est la mesure la plus utilisée en statistique. Elle est définie par la formule suivante :

xˉ=1ni=1nxi\bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i

Pour cet exemple, la moyenne de l’âge est :

xˉ_age=110i=110agei=20+40+30+50+60+20+40+80+30+5010=42\bar{x}\_{age} = \frac{1}{10} \sum_{i=1}^{10} age_i = \frac{20 + 40 + 30 + 50 + 60 + 20 + 40 + 80 + 30 + 50}{10} = 42

Variance

La variance est une mesure de dispersion des données. Elle est définie par la formule suivante :

s2=1n1i=1n(xixˉ)2s^2 = \frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar{x})^2

Pour cet exemple, la variance de l’âge est :

sage2=19i=110(ageixˉage)2=31609351,11s^2_{age} = \frac{1}{9} \sum_{i=1}^{10} (age_i - \bar{x}_{age})^2 = \frac{3160}{9} \approx 351{,}11

Ecart-type

L’écart-type est la racine carrée de la variance. Il est défini par la formule suivante :

s=1n1i=1n(xixˉ)2s = \sqrt{\frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar{x})^2}

Pour cet exemple, l’écart-type de l’âge est :

sage=19i=110(ageixˉage)2=3160918,74s_{age} = \sqrt{\frac{1}{9} \sum_{i=1}^{10} (age_i - \bar{x}_{age})^2} = \sqrt{\frac{3160}{9}} \approx 18{,}74

Médiane

La médiane est la valeur qui partage un ensemble de données en deux parties de même taille. Elle est définie par la formule suivante :

Pour un effectif pair et des valeurs triées x(1)x(n)x_{(1)}\leq\cdots\leq x_{(n)} :

M=x(n/2)+x(n/2+1)2M = \frac{x_{(n/2)} + x_{(n/2+1)}}{2}

Pour cet exemple, la médiane de l’âge est :

Mage=x(5)+x(6)2=40+402=40M_{age} = \frac{x_{(5)} + x_{(6)}}{2} = \frac{40 + 40}{2} = 40

Mode

Le mode est une valeur dont la fréquence est maximale dans un jeu de données. Plusieurs valeurs peuvent partager cette fréquence :

Mode(D)={xDf(x)=maxyDf(y)}\operatorname{Mode}(D)=\{x\in D\mid f(x)=\max_{y\in D}f(y)\}

Dans cet exemple, 20, 30, 40 et 50 apparaissent chacun deux fois :

Mode(Dage)={20,30,40,50}\operatorname{Mode}(D_{age})=\{20,30,40,50\}

Conclusion

En résumé, la statistique est une méthode pour étudier un ensemble de données et décrire leur comportement. Pour cela, on utilise des mesures comme la moyenne, la variance, l’écart-type, la médiane et le mode. Ces mesures sont définies à partir des variables qualitatives ou quantitatives qui composent un jeu de données. Cet article n’était qu’une légère introduction (ou rappel du lycée) à la statistique et il existe de nombreuses autres mesures et techniques statistiques que nous n’avons pas abordées ici. Je vous invite à en apprendre davantage si vous souhaitez approfondir le sujet.