Lexique du langage statistique
Population
Les études statistiques portent généralement sur une population , qu'on appelle des individus .
Caractère
Un critère d'étude sur une population s'appelle un caractère , et à chaque individu correspondra au plus une valeur .
Ce caractère peut être :
-
soit quantitatif (exemple : une note)
-
soit qualitatif (exemple : la classe d'un individu)
Effectif
L'effectif \(e_i\) est le nombre d'individus concerné par le caractère \(x_i\).
Fréquence
La fréquence est le rapport entre nombre d'individus concerné par un certain caractère, sur l'effectif total.
Moyennes
Dans cette partie, on distinguera deux manières d'écrire le nombre d'éléments d'une donnée statistique :
-
avec un élément par donnée , on appellera \(n\) la somme des éléments
-
avec la prise en compte d'un effectif (plusieurs éléments pour une donnée statistique), la somme des effectifs sera notée \(N\) :$$ N=e_1 + e_2 + e_3 \hspace{0.2em} + \hspace{0.2em} \dots \hspace{0.2em} + \hspace{0.2em} e_n $$
Avec une série de données ordinaire :
|
Indice
|
1
|
2
|
3
|
...
|
n
|
|---|---|---|---|---|---|
|
Donnée
|
$$ x_1 $$ |
$$ x_2 $$ |
$$ x_3 $$ |
$$ ... $$ |
$$ x_n $$ |
|
Effectif
|
$$ e_1 $$ |
$$ e_2 $$ |
$$ e_3 $$ |
$$ ... $$ |
$$ e_n $$ |
On calcule différents types de moyenne.
Moyenne arithmétique
La moyenne arithmétique est celle que l'on calcule généralement dans les bulletins de notes :
-
Calcul simple$$ M_A = \overline{x} = \frac{x_1 + x_2 + x_3 \ + \ \dots + \ \ x_n}{n} $$$$ (\text{où } n \text{ est le nombre de données}) $$
Ou encore écrite sous forme de somme :
$$ M_A = \frac{1}{n} \sum_{k=1}^n x_k $$ -
Calcul avec la prise en compte d'effectifs$$ M_A = \frac{e_1x_1 + e_2x_2 + e_3x_3 \ + \ \dots + \ \ e_nx_n}{N} $$$$ (\text{où } N \text{ est l'effectif total}) $$$$ N=e_1 + e_2 + e_3 \hspace{0.2em} + \hspace{0.2em} \dots \hspace{0.2em} + \hspace{0.2em} e_n $$
Ou encore écrite sous forme de somme :
$$ M_A = \frac{1}{N} \sum_{k=1}^{n} \Bigl[ e_k \ x_k \Bigr] $$ -
Linéarité de la moyenne
-
Sur un l'ajout d'une quantité \(Q\)
Si l'on ajoute (ou retire) une certaine quantité \(Q\) à toutes les valeurs d'une série de données, alors la moyenne se verra augmentée de cette même quantité .
Linéarité de la moyenne (ajout)
Si l'on reprend la formule de la moyenne sous forme de somme :
$$ M_A = \frac{1}{n} \sum_{k=1}^n x_k $$En ajoutant une quantité réelle \(Q \in \mathbb{R}\), on a :
$$ M_A' = \frac{1}{n} \sum_{k=1}^n \bigl[ x_k + Q \bigr] $$$$ M_A' = \frac{1}{n} \left( \sum_{k=1}^n x_k + \sum_{k=1}^n Q\right) $$La somme des \(A\) sur \(n\) itérations vaut \(n \times Q\), donc :
$$ M_A' = \frac{1}{n} \left( \sum_{k=1}^n x_k + nQ\right) $$$$ M_A' = \frac{1}{n} \sum_{k=1}^n x_k + Q $$La moyenne de départ a bien augmenté de \(Q\).
-
Sur l'application d'un coefficient \(C\)
Si l'on multiplie (ou divise) par un coefficient \(C\) toutes les valeurs d'une série de données, alors la moyenne s'en verra multipliée par ce même coefficient .
Linéarité de la moyenne (coefficient)
Si l'on reprend la formule de la moyenne sous forme de somme :
$$ M_A = \frac{1}{n} \sum_{k=1}^n x_k $$En mulitpliant par un coefficient réel \(C \in \mathbb{R}\), on a :
$$ M_A^* = \frac{1}{n} \sum_{k=1}^n \bigl[ x_k \times C \bigr] $$Avec l'opérateur somme, on a le droit de sortir les constantes, donc :
$$ M_A^* = C \times \frac{1}{n} \sum_{k=1}^n x_k $$La moyenne de départ a bien été multipliée par \(C\).
-
Moyenne géométrique
La moyenne géométrique est un type de moyenne beaucoup plus sensible que la moyenne arithmétique aux valeurs les plus élevées, mais beaucoup plus sensible pour les valeurs les plus basses d'une série de données.
Dans tous les cas, on aura :
-
Calcul simple$$ M_G = \sqrt[n]{x_1 \ x_2 \ x_3 \ \ \dots \ \ \ x_n} $$$$ \text{où } n \text{ est le nombre de données}$$
Ou encore écrite sous forme de produit :
$$ M_G = \left( \prod_{k=1}^n x_k \right)^{\frac{1}{n}} $$ -
Calcul avec la prise en compte d'effectifs$$ M_G = \sqrt[N]{x_1^{e_1} \ x_2^{e_2} \ x_3^{e_3} \ \dots \ x_n^{e_n}} $$$$ (\text{où } N \text{ est l'effectif total}) $$
Ou encore écrite sous forme de produit :
$$ M_G = \left( \prod_{k=1}^n x_k^{e_k} \right)^{\frac{1}{N}} $$
Indicateurs de positionnement : \( (Q_1, M, Q_3)\)
Avant de chercher la médiane \((M)\) et les quartiles \((Q_1, Q_3)\), il faut dans un premier temps ranger les données en ordre croissant (ou par ordre alphabétique), en laissant les répétitions éventuelles.
Médiane \( : M\)
La médiane
La médiane est la valeur centrale d'un jeu de données.
Dans le cas d'un nombre pair de valeurs, on prend moyenne des deux valeurs centrales .
Dans les faits, c'est la valeur du \(\frac{n}{2}\)-ième individu.
-
Si \(n\) est impair :
$$ x = \Bigl \{ 10, \ 10, \ 11, \ 11, \ 12, \ 14, \ 16 \Bigr \} $$$$ (n = 7) \Longrightarrow \frac{n}{2} = 3.5 $$On doit prendre la 4 ème valeur :
$$ x = \Bigl \{ 10, \ 10, \ 11, \ \textcolor{rgb(232 124 124)}{11}, \ 12, \ 14, \ 16 \Bigr \} $$$$ \textcolor{rgb(232 124 124)}{M = 11} $$ -
Si \(n\) est pair :
$$ x = \Bigl \{ 10, \ 10, \ 11, \ 11, \ 12, \ 14, \ 16, \ 16 \Bigr \} $$$$ (n = 8) \Longrightarrow \frac{n}{2} = 4 $$On doit prendre la moyenne des 4 ème et 5 ème valeurs :
$$ x = \Bigl \{ 10, \ 10, \ 11, \ \textcolor{rgb(232 124 124)}{11, \ 12}, \ 14, \ 16, \ 16 \Bigr \} $$$$ \textcolor{rgb(232 124 124)}{M = \frac{11 + 12}{2}} $$$$ \textcolor{rgb(232 124 124)}{M = 11.5} $$
Exemples :
Quartiles : \((Q_1,Q_3)\)
Les quartiles
Les quartiles (premier et troisième) sont les valeurs pour lesquelles respectivement \(25 \text{ %}\) et \(75 \text{ %}\) des valeurs leur sont inférieures .
-
1 er quartile : \(Q_1\)
Dans les faits, c'est la valeur du \(\frac{n}{4}\)-ième individu.
Peut importe le résultat, dans tous les cas on arrondit à la valeur supérieure .
Exemple :
$$ x = \Bigl \{ 10, \ 10, \ 11, \ 11, \ 12, \ 14, \ 16 \Bigr \} $$$$ (n = 7) \Longrightarrow \frac{n}{4} = 1.75 $$On doit prendre la 2 ème valeur :
$$ x = \Bigl \{ 10, \ \textcolor{rgb(232 124 124)}{10}, \ 11, \ 11, \ 12, \ 14, \ 16 \Bigr \} $$$$ \textcolor{rgb(232 124 124)}{Q_1 = 10} $$ -
3 ème quartile : \(Q_3\)
Dans les faits, c'est la valeur du \(\frac{3n}{4}\)-ième individu.
De la même manière, arrondit à la valeur supérieure .
Exemple :
$$ x = \Bigl \{ 10, \ 10, \ 11, \ 11, \ 12, \ 14, \ 16 \Bigr \} $$$$ (n = 7) \Longrightarrow \frac{3n}{4} = 5.25 $$On doit prendre la 6 ème valeur :
$$ x = \Bigl \{ 10, \ 10, \ 11, \ 11, \ 12, \ \textcolor{rgb(232 124 124)}{14}, \ 16 \Bigr \} $$$$ \textcolor{rgb(232 124 124)}{Q_3 = 14} $$ -
Écart inter-quartile : \(Q_3 - Q_1\)
L'écart inter-quartile est un indicateur de dispersion . On le calcule par la différence des quartiles :
$$ \Delta Q = Q_3 - Q_1 $$
Variance, écart-type
Variance
Dans cette partie, on notera \(\overline{x}\) la moyenne d'une série de valeurs \( x = \Bigl \{ x_1, \ x_2, \ \dots , \ x_n \Bigr\}\) :
La variance est alors la moyenne (arithmétique) des carrés des écarts à la moyenne . Cette donnée sera utile par la suite pour la calcul de l'écart-type .
-
Calcul simple
-
Première forme
$$\mathrm{Var}(x) = \frac{(x_1 - \overline{x})^2 + (x_2 - \overline{x})^2 + \ (x_3 - \overline{x})^2 + \ \dots \ + \ (x_n - \overline{x})^2}{n} $$Ou encore écrite sous forme de somme :
$$ \mathrm{Var}(x) = \frac{1}{n} \sum_{k=1}^{n} (x_k - \overline{x})^2 $$ -
Seconde forme
$$\mathrm{Var}(x) = \frac{(x_1)^2 + (x_2)^2 + \ (x_3)^2 + \ \dots \ + \ (x_n)^2}{n} - \ \overline{x}^2 $$Ou encore écrite sous forme de somme :
$$ \mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} x_k^2 - \ \overline{x}^2 $$Les deux formes de la formule de la variance (sans effectif)
En démarrant de la première formule, définition de la variance :
$$ \mathrm{Var}(x) = \frac{(x_1 - \overline{x})^2 + (x_2 - \overline{x})^2 + \ (x_3 - \overline{x})^2 + \ \dots \ + \ (x_n - \overline{x})^2}{n} $$Soit, sous forme de somme :
$$ \mathrm{Var}(x) = \frac{1}{n} \sum_{k=1}^{n} (x_k - \overline{x})^2 $$On développe alors l'identité remarquable :
$$ \mathrm{Var}(x) = \frac{1}{n} \sum_{k=1}^{n} \left[ (x_k)^2 - 2 \ x_k \ \overline{x} + \overline{x}^2 \right] $$On sépare maintenant chaque élément de la somme :
$$ \mathrm{Var}(x) = \frac{1}{n}\left[ \sum_{k=1}^{n} (x_k)^2 - \sum_{k=1}^{n}2 \ x_k \ \overline{x} + \sum_{k=1}^{n} \overline{x}^2 \right] $$$$ \mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} (x_k)^2 - 2 \times \frac{1}{n}\sum_{k=1}^{n} x_k \ \overline{x} + \frac{1}{n}\sum_{k=1}^{n} \overline{x}^2 $$Le dernier terme est une constante, on peut donc simplifier cette somme :
$$ \mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} (x_k)^2 - 2 \times \frac{1}{n}\sum_{k=1}^{n} x_k \ \overline{x} + \frac{1}{n} \times n \times \overline{x}^2 $$$$ \mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} (x_k)^2 - 2 \times \frac{1}{n}\sum_{k=1}^{n} x_k \ \overline{x} + \overline{x}^2 $$Or, dans le terme central, on reconnaît la définition de la moyenne :
$$ \mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} (x_k)^2 - 2 \times \textcolor{rgb(232 124 124)}{\frac{1}{n}\sum_{k=1}^{n} x_k} \ \overline{x} + \overline{x}^2 $$Que l'on remplace :
$$ \mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} (x_k)^2 - 2 \times \textcolor{rgb(232 124 124)}{\overline{x}} \ \overline{x} + \overline{x}^2 $$Puis finalement
$$\mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} (x_k)^2 - \overline{x}^2 $$
-
-
Calcul avec la prise en compte d'effectifs
-
Première forme
$$ \mathrm{Var}(x) = \frac{e_1(x_1 - \overline{x})^2 + e_2(x_2 - \overline{x})^2 + \ e_3(x_3 - \overline{x})^2 + \ \dots \ + \ e_n(x_n - \overline{x})^2}{N} $$ -
Seconde forme
$$ \mathrm{Var}(x) = \frac{e_1(x_1)^2 + e_2(x_2)^2 + \ e_3(x_3)^2 + \ \dots \ + \ e_n(x_n)^n}{N} - \ \overline{x}^2 $$Ou encore écrite sous forme de somme :
$$ \mathrm{Var}(x) = \frac{\left[ \sum\limits_{k=1}^{n} e_k \ x_k^2 \right]}{N} - \ \overline{x}^2 $$
-
Écart-type
L'écart-type est un indicateur de dispersion d'une série statistique.
Il permet de savoir quel est l'écart moyen entre une donnée et la moyenne de cette même série.
Propriétés de la moyenne
Linéarité
Lorsque toutes les valeurs d'une série subissent la même transformation affine, la moyenne subit exactement la même .
La linéarité de la moyenne
Soit une série \(x_1, \dots, x_n\) de moyenne \(\overline{x}\), et la série obtenue en posant \(y_i = ax_i + b\). Par définition :
On distribue le facteur \(\frac{1}{n}\), et on reconnaît la moyenne des \(x_i\) :
Si toutes les notes d'un devoir sont augmentées de \(2\) points, la moyenne augmente de \(2\) points. Si elles sont doublées, elle double.
Ajout ou retrait d'une valeur
Ajouter une valeur à une série modifie la moyenne selon que cette valeur est au-dessus ou en dessous de la moyenne actuelle.
Valeur ajoutée |
Effet sur la moyenne |
Effet sur la médiane |
|---|---|---|
Supérieure à \(\overline{x}\) |
augmente |
augmente ou reste égale |
Égale à \(\overline{x}\) |
inchangée |
peut changer |
Inférieure à \(\overline{x}\) |
diminue |
diminue ou reste égale |
La moyenne est sensible aux valeurs extrêmes, la médiane ne l'est pas : c'est pourquoi on donne souvent les deux.
Séries regroupées en classes
Lorsque les valeurs sont trop nombreuses, on les regroupe en classes , c'est-à-dire en intervalles. On perd le détail des valeurs, mais on gagne en lisibilité.
Moyenne d'une série en classes
On remplace chaque classe par son centre , et on calcule la moyenne pondérée par les effectifs.
Le résultat n'est qu'une valeur approchée : il suppose que les valeurs d'une classe se répartissent régulièrement autour de son centre.
Classe médiane
La classe médiane est la première classe pour laquelle l'effectif cumulé atteint la moitié de l'effectif total. On y estime ensuite la médiane par lecture graphique sur le polygone des fréquences cumulées.
Histogramme
Dans un histogramme , c'est l'aire de chaque rectangle qui est proportionnelle à l'effectif de la classe, et non sa hauteur. Lorsque les classes n'ont pas la même amplitude, la hauteur représente donc l'effectif rapporté à l'amplitude.
Croiser deux caractères qualitatifs
Lorsqu'on étudie deux caractères qualitatifs sur une même population, on présente les effectifs dans un tableau croisé .
Externes |
Demi-pensionnaires |
Total |
|
|---|---|---|---|
Seconde |
\(48\) |
\(72\) |
\(120\) |
Première |
\(30\) |
\(50\) |
\(80\) |
Total |
\(78\) |
\(122\) |
\(200\) |
Fréquence marginale
Une fréquence marginale est calculée à partir d'un total , c'est-à-dire d'une marge du tableau, rapporté à l'effectif total.
La fréquence marginale des externes vaut :
Fréquence conditionnelle
Une fréquence conditionnelle est calculée à l'intérieur d'une seule ligne ou d'une seule colonne : on se restreint à une sous-population.
La fréquence des externes parmi les élèves de seconde vaut :
Cette fréquence se lit sur la ligne « Seconde » et non sur le total général. Il faut donc toujours préciser par rapport à quel ensemble une fréquence est calculée : \(48\) élèves représentent \(40\ \%\) des secondes, mais seulement \(24\ \%\) de l'établissement.