Afficher en version réduite
Vider les textes à trous
Moon Arrows Sun
Arrows

Les statistiques

Lexique du langage statistique

Population

Les études statistiques portent généralement sur une population , qu'on appelle des individus .

Caractère

Un critère d'étude sur une population s'appelle un caractère , et à chaque individu correspondra au plus une valeur .

Ce caractère peut être :

Effectif

L'effectif \(e_i\) est le nombre d'individus concerné par le caractère \(x_i\).

Fréquence

La fréquence est le rapport entre nombre d'individus concerné par un certain caractère, sur l'effectif total.

$$ F(x_i) = \frac{e_i}{N} $$
$$ avec \enspace \left \{ \begin{gather*} x_i : \text{le caractère étudié} \\ e_i : \text{l'effectif concerné par le caractère étudié} \\ N : \text{l'effectif total} \end{gather*} \right \} $$

Moyennes

Dans cette partie, on distinguera deux manières d'écrire le nombre d'éléments d'une donnée statistique :

Avec une série de données ordinaire :

Indice
1
2
3
...
n
Donnée
$$ x_1 $$
$$ x_2 $$
$$ x_3 $$
$$ ... $$
$$ x_n $$
Effectif
$$ e_1 $$
$$ e_2 $$
$$ e_3 $$
$$ ... $$
$$ e_n $$

On calcule différents types de moyenne.

Moyenne arithmétique

La moyenne arithmétique est celle que l'on calcule généralement dans les bulletins de notes :

  1. Calcul simple
    $$ M_A = \overline{x} = \frac{x_1 + x_2 + x_3 \ + \ \dots + \ \ x_n}{n} $$
    $$ (\text{où } n \text{ est le nombre de données}) $$

    Ou encore écrite sous forme de somme :

    $$ M_A = \frac{1}{n} \sum_{k=1}^n x_k $$
  2. Calcul avec la prise en compte d'effectifs
    $$ M_A = \frac{e_1x_1 + e_2x_2 + e_3x_3 \ + \ \dots + \ \ e_nx_n}{N} $$
    $$ (\text{où } N \text{ est l'effectif total}) $$
    $$ N=e_1 + e_2 + e_3 \hspace{0.2em} + \hspace{0.2em} \dots \hspace{0.2em} + \hspace{0.2em} e_n $$

    Ou encore écrite sous forme de somme :

    $$ M_A = \frac{1}{N} \sum_{k=1}^{n} \Bigl[ e_k \ x_k \Bigr] $$
  3. Linéarité de la moyenne
    1. Sur un l'ajout d'une quantité \(Q\)

      Si l'on ajoute (ou retire) une certaine quantité \(Q\) à toutes les valeurs d'une série de données, alors la moyenne se verra augmentée de cette même quantité .

      Linéarité de la moyenne (ajout)

      Si l'on reprend la formule de la moyenne sous forme de somme :

      $$ M_A = \frac{1}{n} \sum_{k=1}^n x_k $$

      En ajoutant une quantité réelle \(Q \in \mathbb{R}\), on a :

      $$ M_A' = \frac{1}{n} \sum_{k=1}^n \bigl[ x_k + Q \bigr] $$
      $$ M_A' = \frac{1}{n} \left( \sum_{k=1}^n x_k + \sum_{k=1}^n Q\right) $$

      La somme des \(A\) sur \(n\) itérations vaut \(n \times Q\), donc :

      $$ M_A' = \frac{1}{n} \left( \sum_{k=1}^n x_k + nQ\right) $$
      $$ M_A' = \frac{1}{n} \sum_{k=1}^n x_k + Q $$

      La moyenne de départ a bien augmenté de \(Q\).

    2. Sur l'application d'un coefficient \(C\)

      Si l'on multiplie (ou divise) par un coefficient \(C\) toutes les valeurs d'une série de données, alors la moyenne s'en verra multipliée par ce même coefficient .

      Linéarité de la moyenne (coefficient)

      Si l'on reprend la formule de la moyenne sous forme de somme :

      $$ M_A = \frac{1}{n} \sum_{k=1}^n x_k $$

      En mulitpliant par un coefficient réel \(C \in \mathbb{R}\), on a :

      $$ M_A^* = \frac{1}{n} \sum_{k=1}^n \bigl[ x_k \times C \bigr] $$

      Avec l'opérateur somme, on a le droit de sortir les constantes, donc :

      $$ M_A^* = C \times \frac{1}{n} \sum_{k=1}^n x_k $$

      La moyenne de départ a bien été multipliée par \(C\).

Moyenne géométrique

La moyenne géométrique est un type de moyenne beaucoup plus sensible que la moyenne arithmétique aux valeurs les plus élevées, mais beaucoup plus sensible pour les valeurs les plus basses d'une série de données.

Dans tous les cas, on aura :

$$ M_G \leqslant M_A $$
  1. Calcul simple
    $$ M_G = \sqrt[n]{x_1 \ x_2 \ x_3 \ \ \dots \ \ \ x_n} $$
    $$ \text{où } n \text{ est le nombre de données}$$

    Ou encore écrite sous forme de produit :

    $$ M_G = \left( \prod_{k=1}^n x_k \right)^{\frac{1}{n}} $$
  2. Calcul avec la prise en compte d'effectifs
    $$ M_G = \sqrt[N]{x_1^{e_1} \ x_2^{e_2} \ x_3^{e_3} \ \dots \ x_n^{e_n}} $$
    $$ (\text{où } N \text{ est l'effectif total}) $$

    Ou encore écrite sous forme de produit :

    $$ M_G = \left( \prod_{k=1}^n x_k^{e_k} \right)^{\frac{1}{N}} $$

Indicateurs de positionnement : \( (Q_1, M, Q_3)\)

Avant de chercher la médiane \((M)\) et les quartiles \((Q_1, Q_3)\), il faut dans un premier temps ranger les données en ordre croissant (ou par ordre alphabétique), en laissant les répétitions éventuelles.

Médiane \( : M\)

La médiane

La médiane est la valeur centrale d'un jeu de données.

Dans le cas d'un nombre pair de valeurs, on prend moyenne des deux valeurs centrales .

Dans les faits, c'est la valeur du \(\frac{n}{2}\)-ième individu.

Quartiles : \((Q_1,Q_3)\)

Les quartiles

Les quartiles (premier et troisième) sont les valeurs pour lesquelles respectivement \(25 \text{ %}\) et \(75 \text{ %}\) des valeurs leur sont inférieures .

  1. 1 er quartile : \(Q_1\)

    Dans les faits, c'est la valeur du \(\frac{n}{4}\)-ième individu.

    Peut importe le résultat, dans tous les cas on arrondit à la valeur supérieure .


    Exemple :

    $$ x = \Bigl \{ 10, \ 10, \ 11, \ 11, \ 12, \ 14, \ 16 \Bigr \} $$
    $$ (n = 7) \Longrightarrow \frac{n}{4} = 1.75 $$

    On doit prendre la 2 ème valeur :

    $$ x = \Bigl \{ 10, \ \textcolor{rgb(232 124 124)}{10}, \ 11, \ 11, \ 12, \ 14, \ 16 \Bigr \} $$
    $$ \textcolor{rgb(232 124 124)}{Q_1 = 10} $$
  2. 3 ème quartile : \(Q_3\)

    Dans les faits, c'est la valeur du \(\frac{3n}{4}\)-ième individu.

    De la même manière, arrondit à la valeur supérieure .


    Exemple :

    $$ x = \Bigl \{ 10, \ 10, \ 11, \ 11, \ 12, \ 14, \ 16 \Bigr \} $$
    $$ (n = 7) \Longrightarrow \frac{3n}{4} = 5.25 $$

    On doit prendre la 6 ème valeur :

    $$ x = \Bigl \{ 10, \ 10, \ 11, \ 11, \ 12, \ \textcolor{rgb(232 124 124)}{14}, \ 16 \Bigr \} $$
    $$ \textcolor{rgb(232 124 124)}{Q_3 = 14} $$
  3. Écart inter-quartile : \(Q_3 - Q_1\)

    L'écart inter-quartile est un indicateur de dispersion . On le calcule par la différence des quartiles :

    $$ \Delta Q = Q_3 - Q_1 $$

Variance, écart-type

Variance

Dans cette partie, on notera \(\overline{x}\) la moyenne d'une série de valeurs \( x = \Bigl \{ x_1, \ x_2, \ \dots , \ x_n \Bigr\}\) :

$$ \overline{x} = \frac{x_1 + x_2 + x_3 \ + \ \dots + \ \ x_n}{n} $$

La variance est alors la moyenne (arithmétique) des carrés des écarts à la moyenne . Cette donnée sera utile par la suite pour la calcul de l'écart-type .

  1. Calcul simple
    1. Première forme

      $$\mathrm{Var}(x) = \frac{(x_1 - \overline{x})^2 + (x_2 - \overline{x})^2 + \ (x_3 - \overline{x})^2 + \ \dots \ + \ (x_n - \overline{x})^2}{n} $$

      Ou encore écrite sous forme de somme :

      $$ \mathrm{Var}(x) = \frac{1}{n} \sum_{k=1}^{n} (x_k - \overline{x})^2 $$
    2. Seconde forme

      $$\mathrm{Var}(x) = \frac{(x_1)^2 + (x_2)^2 + \ (x_3)^2 + \ \dots \ + \ (x_n)^2}{n} - \ \overline{x}^2 $$

      Ou encore écrite sous forme de somme :

      $$ \mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} x_k^2 - \ \overline{x}^2 $$

      Les deux formes de la formule de la variance (sans effectif)

      En démarrant de la première formule, définition de la variance :

      $$ \mathrm{Var}(x) = \frac{(x_1 - \overline{x})^2 + (x_2 - \overline{x})^2 + \ (x_3 - \overline{x})^2 + \ \dots \ + \ (x_n - \overline{x})^2}{n} $$

      Soit, sous forme de somme :

      $$ \mathrm{Var}(x) = \frac{1}{n} \sum_{k=1}^{n} (x_k - \overline{x})^2 $$

      On développe alors l'identité remarquable :

      $$ \mathrm{Var}(x) = \frac{1}{n} \sum_{k=1}^{n} \left[ (x_k)^2 - 2 \ x_k \ \overline{x} + \overline{x}^2 \right] $$

      On sépare maintenant chaque élément de la somme :

      $$ \mathrm{Var}(x) = \frac{1}{n}\left[ \sum_{k=1}^{n} (x_k)^2 - \sum_{k=1}^{n}2 \ x_k \ \overline{x} + \sum_{k=1}^{n} \overline{x}^2 \right] $$
      $$ \mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} (x_k)^2 - 2 \times \frac{1}{n}\sum_{k=1}^{n} x_k \ \overline{x} + \frac{1}{n}\sum_{k=1}^{n} \overline{x}^2 $$

      Le dernier terme est une constante, on peut donc simplifier cette somme :

      $$ \mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} (x_k)^2 - 2 \times \frac{1}{n}\sum_{k=1}^{n} x_k \ \overline{x} + \frac{1}{n} \times n \times \overline{x}^2 $$
      $$ \mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} (x_k)^2 - 2 \times \frac{1}{n}\sum_{k=1}^{n} x_k \ \overline{x} + \overline{x}^2 $$

      Or, dans le terme central, on reconnaît la définition de la moyenne :

      $$ \mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} (x_k)^2 - 2 \times \textcolor{rgb(232 124 124)}{\frac{1}{n}\sum_{k=1}^{n} x_k} \ \overline{x} + \overline{x}^2 $$

      Que l'on remplace :

      $$ \mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} (x_k)^2 - 2 \times \textcolor{rgb(232 124 124)}{\overline{x}} \ \overline{x} + \overline{x}^2 $$

      Puis finalement

      $$\mathrm{Var}(x) = \frac{1}{n}\sum_{k=1}^{n} (x_k)^2 - \overline{x}^2 $$
  2. Calcul avec la prise en compte d'effectifs
    1. Première forme

      $$ \mathrm{Var}(x) = \frac{e_1(x_1 - \overline{x})^2 + e_2(x_2 - \overline{x})^2 + \ e_3(x_3 - \overline{x})^2 + \ \dots \ + \ e_n(x_n - \overline{x})^2}{N} $$
    2. Seconde forme

      $$ \mathrm{Var}(x) = \frac{e_1(x_1)^2 + e_2(x_2)^2 + \ e_3(x_3)^2 + \ \dots \ + \ e_n(x_n)^n}{N} - \ \overline{x}^2 $$

      Ou encore écrite sous forme de somme :

      $$ \mathrm{Var}(x) = \frac{\left[ \sum\limits_{k=1}^{n} e_k \ x_k^2 \right]}{N} - \ \overline{x}^2 $$

Écart-type

L'écart-type est un indicateur de dispersion d'une série statistique.

Il permet de savoir quel est l'écart moyen entre une donnée et la moyenne de cette même série.

$$ \sigma = \sqrt{\mathrm{Var}(x)} $$

Propriétés de la moyenne

Linéarité

Lorsque toutes les valeurs d'une série subissent la même transformation affine, la moyenne subit exactement la même .

$$ \overline{ax + b} = a\overline{x} + b $$

La linéarité de la moyenne

Soit une série \(x_1, \dots, x_n\) de moyenne \(\overline{x}\), et la série obtenue en posant \(y_i = ax_i + b\). Par définition :

$$ \overline{y} = \frac{1}{n}\sum_{i=1}^{n}\left(ax_i + b\right) = \frac{1}{n}\left(a\sum_{i=1}^{n}x_i + nb\right) $$

On distribue le facteur \(\frac{1}{n}\), et on reconnaît la moyenne des \(x_i\) :

$$ \overline{y} = a\overline{x} + b $$

Si toutes les notes d'un devoir sont augmentées de \(2\) points, la moyenne augmente de \(2\) points. Si elles sont doublées, elle double.

Ajout ou retrait d'une valeur

Ajouter une valeur à une série modifie la moyenne selon que cette valeur est au-dessus ou en dessous de la moyenne actuelle.

Valeur ajoutée
Effet sur la moyenne
Effet sur la médiane
Supérieure à \(\overline{x}\)
augmente
augmente ou reste égale
Égale à \(\overline{x}\)
inchangée
peut changer
Inférieure à \(\overline{x}\)
diminue
diminue ou reste égale
Influence de l'ajout d'une valeur à une série

La moyenne est sensible aux valeurs extrêmes, la médiane ne l'est pas : c'est pourquoi on donne souvent les deux.

Séries regroupées en classes

Lorsque les valeurs sont trop nombreuses, on les regroupe en classes , c'est-à-dire en intervalles. On perd le détail des valeurs, mais on gagne en lisibilité.

Moyenne d'une série en classes

On remplace chaque classe par son centre , et on calcule la moyenne pondérée par les effectifs.

$$ \overline{x} = \frac{\sum e_i c_i}{\sum e_i} \qquad \text{avec } c_i \text{ le centre de la classe } i $$

Le résultat n'est qu'une valeur approchée : il suppose que les valeurs d'une classe se répartissent régulièrement autour de son centre.

Classe médiane

La classe médiane est la première classe pour laquelle l'effectif cumulé atteint la moitié de l'effectif total. On y estime ensuite la médiane par lecture graphique sur le polygone des fréquences cumulées.

Histogramme

Dans un histogramme , c'est l'aire de chaque rectangle qui est proportionnelle à l'effectif de la classe, et non sa hauteur. Lorsque les classes n'ont pas la même amplitude, la hauteur représente donc l'effectif rapporté à l'amplitude.

Histogramme d'une série regroupée en classes d'amplitudes inégales
Durées de trajet de \(64\) salariés : la classe \([20 \ ; \ 40[\) est deux fois plus large, donc deux fois moins haute à effectif égal

Croiser deux caractères qualitatifs

Lorsqu'on étudie deux caractères qualitatifs sur une même population, on présente les effectifs dans un tableau croisé .

Externes
Demi-pensionnaires
Total
Seconde
\(48\)
\(72\)
\(120\)
Première
\(30\)
\(50\)
\(80\)
Total
\(78\)
\(122\)
\(200\)
Répartition de \(200\) élèves selon le niveau et le régime

Fréquence marginale

Une fréquence marginale est calculée à partir d'un total , c'est-à-dire d'une marge du tableau, rapporté à l'effectif total.

La fréquence marginale des externes vaut :

$$ \frac{78}{200} = 0{,}39 = 39\ \% $$

Fréquence conditionnelle

Une fréquence conditionnelle est calculée à l'intérieur d'une seule ligne ou d'une seule colonne : on se restreint à une sous-population.

La fréquence des externes parmi les élèves de seconde vaut :

$$ \frac{48}{120} = 0{,}40 = 40\ \% $$

Cette fréquence se lit sur la ligne « Seconde » et non sur le total général. Il faut donc toujours préciser par rapport à quel ensemble une fréquence est calculée : \(48\) élèves représentent \(40\ \%\) des secondes, mais seulement \(24\ \%\) de l'établissement.