Aller au contenu principal

Deux variables et estimation

Ce que ce chapitre apporte6 points
  • Tracer et lire un nuage de points, et repérer ce qu'aucun coefficient ne dit.
  • Calculer une covariance, puis un coefficient de corrélation, et interpréter son signe et sa force.
  • Écrire une droite de régression par les moindres carrés, et la contrôler par le point moyen.
  • Distinguer corrélation et causalité, et reconnaître une relation non linéaire.
  • Estimer une proportion et une moyenne, et donner un intervalle de confiance.
  • Dire ce que « 95 % de confiance » signifie, et ce que coûte une précision deux fois meilleure.
Décrire une série ne dit rien de ce qui la fait varier. Or la question qui se pose ensuite est toujours la même : deux grandeurs mesurées sur les mêmes individus évoluent-elles ensemble, et si oui, peut-on prévoir l'une à partir de l'autre ?
Et la mesure ne porte jamais sur la population entière. On contrôle quelques centaines de pièces, on interroge mille personnes, et il faut en tirer une affirmation sur la production ou le pays tout entier, avec la précision qui va avec. Ce chapitre traite les deux questions : le lien entre deux séries, puis ce qu'un échantillon autorise à dire.
Le chapitre précédent décrit une série ; celui-ci en relie deux et remonte à la population.
Ce chapitre et celui de Sciences appliquées sur la régression

Ce chapitre installe les outils de la statistique à deux variables, puis continue vers l'estimation et l'intervalle de confiance, qui n'appartiennent qu'à lui.

Corrélation, régression et moindres carrés reprend les mêmes outils sur des mesures d'ingénierie et va plus loin sur un seul point, mais décisif : ce qui rend un ajustement valide ou trompeur. Le quatuor d'Anscombe, la lecture des résidus et l'entonnoir s'y trouvent, et nulle part ailleurs.

Séries à deux variables

On mesure deux caractères sur les mêmes individus (une température et une résistance, une durée d'usage et une usure) et on cherche s'ils sont liés.

Nuage de points

On représente chaque individu par le point (xi,yi)(x_i, y_i). Le point moyen G(xˉ,yˉ)G(\bar{x}, \bar{y}) est le centre de gravité du nuage. Regarder le nuage avant de calculer quoi que ce soit est indispensable : lui seul révèle une relation courbe, un groupe à part, une valeur aberrante.

Voici les deux situations qu'aucun coefficient ne distingue. La première a un lien affine réel.

10203040102030température (°C)locations (centaines)
Un nuage qui justifie une droite : les points sont alignés et les résidus sont minuscules. Droite des moindres carrés : y = 1,389 x − 0,194, avec r = 0,997 et r² = 0,993.

La seconde a un lien tout aussi fort, mais courbe. La droite y est calculable, elle est même la meilleure droite possible, et elle ne décrit rien.

46851015xy
Le même coefficient de corrélation, r = 0,816, sur un nuage qui n'a rien d'affine. Les résidus ne sont plus répartis au hasard : ils sont négatifs aux extrémités et positifs au milieu, signature d'un modèle mal choisi. Droite des moindres carrés : y = 0,5 x + 3,001, avec r = 0,816 et r² = 0,666.
Le contrôle qui ne demande aucun calcul

Après avoir tracé la droite, regarder les résidus, c'est-à-dire les écarts verticaux entre les points et la droite. S'ils sont dispersés sans forme, le modèle affine convient. S'ils dessinent une courbe, un arc ou un motif, c'est que la relation n'est pas affine, quel que soit le coefficient de corrélation obtenu.

Covariance

Pour mesurer si deux variables varient ensemble, on regarde, pour chaque individu, de quel côté de la moyenne tombe chacune de ses deux mesures.

Définition

La covariance de xx et yy est la moyenne des produits des écarts :

cov(x,y)=1Ni(xixˉ)(yiyˉ)=1Nixiyimoyenne des produitsxˉyˉproduit des moyennes\operatorname{cov}(x, y) = \frac{1}{N}\sum_i (x_i - \bar{x})(y_i - \bar{y}) = \underbrace{\frac{1}{N}\sum_i x_i\,y_i}_{\text{moyenne des produits}} - \underbrace{\bar{x}\,\bar{y}}_{\text{produit des moyennes}}

En clair : un individu au-dessus de la moyenne sur les deux variables, ou en dessous sur les deux, donne un produit positif. Un individu au-dessus sur l'une et en dessous sur l'autre donne un produit négatif. La covariance fait la moyenne de ces produits : elle est positive si les deux variables montent ensemble, négative si l'une descend quand l'autre monte. La seconde écriture, comme pour la variance, sert au calcul.

La figure trace les deux droites qui passent par le point moyen GG et colore chaque point selon le signe de son produit.

10203040102030température (°C)locations (centaines)produit positifproduit positifproduit négatifproduit négatifG
Le même nuage, découpé en quatre par le point moyen G. Tous les points tombent dans les deux quadrants où le produit des écarts est positif : la covariance est positive, et nettement. Point moyen G (18,5 ; 25,5) : 8 points de produit positif, 0 de produit négatif.

Sur un nuage sans lien, les points se répartiraient dans les quatre quadrants, et les produits positifs et négatifs se compenseraient : la covariance serait proche de zéro. Ici aucun point ne tombe dans les quadrants négatifs.

La covariance a un défaut : sa valeur dépend des unités. Mesurer la température en kelvins ou les locations en unités plutôt qu'en centaines la multiplie par 100, sans que le lien ait changé. Elle dit le sens du lien, pas sa force. Pour la force, on la normalise.

Coefficient de corrélation

Définition

Le coefficient de corrélation linéaire est

r=cov(x,y)σxσyr = \frac{\operatorname{cov}(x, y)}{\sigma_x\,\sigma_y}

Il est sans unité, et toujours compris entre −1 et 1.

En divisant par les deux écarts-types, on fait disparaître les unités : rr ne change pas quand on change d'unité sur l'une ou l'autre variable. Sa lecture :

  • rr proche de 1 : les points sont presque alignés sur une droite croissante ;
  • rr proche de −1 : presque alignés sur une droite décroissante ;
  • rr proche de 0 : aucune relation linéaire, ce qui n'exclut pas une relation d'un autre type.

Son carré r2r^2, affiché sous les nuages, se lit comme la part de la variation de yy expliquée par la droite. Pour r=0,8r = 0{,}8, r2=0,64r^2 = 0{,}64 : la droite explique moins des deux tiers de la variation, alors que 0,8 sonne comme un lien très fort.

Les deux pièges de la corrélation

1. Corrélation n'est pas causalité. Les ventes de glaces et les noyades sont fortement corrélées ; aucune ne cause l'autre, c'est la chaleur qui cause les deux. Une corrélation ne dit rien du pourquoi.

2. r=0r = 0 ne signifie pas « indépendantes ». Des points parfaitement disposés sur une parabole peuvent donner r=0r = 0 : la relation est totale, mais elle n'est pas linéaire, et rr ne mesure que le linéaire. D'où l'obligation de regarder le nuage.

Ce n'est pas une figure de style. Voici neuf points posés exactement sur une parabole : yy est entièrement déterminé par xx, il n'y a aucun hasard, et pourtant le coefficient de corrélation est nul.

Les neuf abscisses sont symétriques autour de zéro, donc leur moyenne est nulle. La covariance vaut 19xi(yiyˉ)\frac{1}{9}\sum x_i\,(y_i - \bar{y}), et comme yi=xi2y_i = x_i^2 est une fonction paire, chaque terme d'abscisse x-x annule exactement celui d'abscisse +x+x. La somme est nulle, donc r=0r = 0, alors que yy est entièrement déterminé par xx.

-4-3-2-11234-22468101214161820xy
Valeurs de f(x) sur l'intervalle [-4,5 ; 4,5]
xf
-4,520,25
-4,0516,4025
-416
-3,612,96
-3,159,9225
-2,77,29
-2,255,0625
-24
-1,83,24
-1,351,8225
-0,90,81
-0,450,2025
00
0,450,2025
0,90,81
1,351,8225
1,83,24
24
2,255,0625
2,77,29
3,159,9225
3,612,96
416
4,0516,4025
4,520,25
f(x) = x^2
La relation est parfaite, et pourtant r vaut zéro. Ce qui monte à droite descend à gauche : la meilleure droite est horizontale.

En termes de quadrants : les points de droite tombent dans un quadrant positif, ceux de gauche dans le quadrant négatif symétrique, et les deux se compensent exactement. Un coefficient de corrélation nul ne dit pas « pas de lien », il dit « pas de lien linéaire ».

Droite de régression

Définition

La droite de régression de yy en xx, dite droite des moindres carrés, est celle qui minimise la somme des carrés des résidus, c'est-à-dire des écarts verticaux entre les points et la droite. Son équation est y=ax+by = ax + b avec

a=cov(x,y)V(x)b=yˉaxˉa = \frac{\operatorname{cov}(x, y)}{V(x)} \qquad\qquad b = \bar{y} - a\,\bar{x}

Les deux formules se lisent. La pente aa a le signe de la covariance, donc de rr : la droite monte si le nuage monte. Et la seconde formule s'écrit aussi yˉ=axˉ+b\bar{y} = a\,\bar{x} + b : la droite passe toujours par le point moyen G(xˉ,yˉ)G(\bar{x}, \bar{y}). C'est le contrôle à faire sur toute droite calculée à la main.

« Moindres carrés » n'est pas une formule tombée du ciel, c'est une recherche. La figure suivante dessine le carré construit sur chaque résidu et en affiche la somme ; la droite se règle à la main.

10203040102030température (°C)locations (centaines)
somme des carrés 94

Le minimum vaut 4,83, soit 89,17 de moins qu'ici.

Les huit relevés, et une droite à régler. L'aire totale des carrés est ce que la méthode rend aussi petite que possible. Droite optimale : y = 1,389 x + -0,194, somme 4,83.
À manipuler
Faire descendre la somme des carrés aussi bas que possible, en jouant sur la pente puis sur l'ordonnée à l'origine. Relever la pente obtenue, et la comparer à celle que le calcul ci-dessous trouve par la formule. Vérifier au passage que la meilleure droite passe par le point moyen, à 18,5 °C et 25,5 centaines de locations.
La droite des huit relevés, à la main

Les moyennes. xˉ=1488=18,5\bar{x} = \dfrac{148}{8} = 18{,}5 °C et yˉ=2048=25,5\bar{y} = \dfrac{204}{8} = 25{,}5 centaines.

Le tableau des écarts. Une colonne par écart, une pour le produit, une pour le carré de l'écart en xx :

xix_iyiy_ixixˉx_i - \bar{x}yiyˉy_i - \bar{y}produit(xixˉ)2(x_i - \bar{x})^2
812−10,5−13,5141,75110,25
1115−7,5−10,578,7556,25
1419−4,5−6,529,2520,25
1722−1,5−3,55,252,25
20281,52,53,752,25
23314,55,524,7520,25
26367,510,578,7556,25
294110,515,5162,75110,25
Somme00525378

Les deux colonnes d'écarts totalisent 0 : c'est le contrôle gratuit, une somme d'écarts à la moyenne est toujours nulle. Tous les produits sont positifs, comme la figure des quadrants l'annonçait.

Covariance, variance, droite.

cov(x,y)=5258=65,625V(x)=3788=47,25\operatorname{cov}(x, y) = \frac{525}{8} = 65{,}625 \qquad V(x) = \frac{378}{8} = 47{,}25 a=65,62547,251,389b=25,51,389×18,50,19a = \frac{65{,}625}{47{,}25} \approx 1{,}389 \qquad\qquad b = 25{,}5 - 1{,}389 \times 18{,}5 \approx -0{,}19

La droite est y1,389x0,19y \approx 1{,}389\,x - 0{,}19 : chaque degré supplémentaire apporte environ 139 locations par jour.

Le coefficient de corrélation. Il faut encore V(y)V(y), la moyenne des carrés de la quatrième colonne : 7348=91,75\dfrac{734}{8} = 91{,}75. Alors

r=65,62547,25×91,7565,62565,840,997r = \frac{65{,}625}{\sqrt{47{,}25 \times 91{,}75}} \approx \frac{65{,}625}{65{,}84} \approx 0{,}997

Le lien est presque parfaitement affine, ce qui justifie la droite. Une prévision à 25 °C donne 1,389×250,1934,51{,}389 \times 25 - 0{,}19 \approx 34{,}5 centaines de locations.

L'ajustement sert à interpoler (estimer une valeur à l'intérieur du domaine observé) et, avec prudence, à extrapoler. L'extrapolation loin des données observées est le péché classique : rien ne garantit que la relation linéaire se prolonge. À 45 °C, cette droite promet 6 200 locations ; en réalité, plus personne ne pédale.

La condition d'usage

Une régression linéaire n'a de sens que si rr est proche de ±1 et si les résidus ne dessinent aucune forme. Ajuster une droite sur un nuage de r=0,2r = 0{,}2 produit une équation qui ne prédit rien. On annonce donc rr avant d'écrire la droite, et on justifie que l'ajustement est légitime.

Le calcul a deux fautes rituelles : diviser la covariance par la variance de yy au lieu de celle de xx, et se tromper de signe dans b=yˉaxˉb = \bar{y} - a\bar{x}. L'exercice suivant les fait rencontrer sur cinq points, jusqu'à ce que la procédure soit acquise. Le chapitre corrélation et moindres carrés la reprend sur des mesures physiques.

La droite des moindres carrés, en six nombres

Cinq relevés (xi;yi)(x_i \,;\, y_i) : (3;3)(3 \,;\, -3), (5;1)(5 \,;\, -1), (7;9)(7 \,;\, -9), (9;17)(9 \,;\, -17), (11;15)(11 \,;\, -15).

  1. La moyenne xˉ\bar{x}
  2. La moyenne yˉ\bar{y}
  3. La variance V(x)V(x)
  4. La covariance cov(x,y)\operatorname{cov}(x, y)
  5. Le coefficient directeur aa de la droite des moindres carrés
  6. L'ordonnée à l'origine bb
Vérification rapideon peut se reprendre

1.On calcule r=0r = 0 entre deux séries. Que peut-on conclure ?

2.Les ventes de glaces et le nombre de noyades sont fortement corrélées. Que peut-on en déduire ?

3.Par quel point passe toujours la droite des moindres carrés ?

Échantillonnage et estimation

Jusqu'ici on décrivait des données. Ici on veut en tirer une conclusion sur une population qu'on n'a pas entièrement observée : le taux de défauts d'une production entière, à partir de quelques centaines de pièces contrôlées.

Définition

Un échantillon est une partie de la population, choisie au hasard. On calcule sur l'échantillon une estimation de la grandeur inconnue de la population : la fréquence observée ff estime la proportion réelle pp, la moyenne de l'échantillon estime la moyenne de la population.

Une estimation n'est jamais exacte : un autre échantillon aurait donné une autre fréquence. Ce qu'on peut donner, c'est un intervalle et un niveau de confiance.

D'où vient l'intervalle

Sur un échantillon de nn individus, le nombre de « oui » suit une loi binomiale B(n,p)\mathcal{B}(n, p), d'espérance npnp et d'écart-type np(1p)\sqrt{np(1-p)}. La fréquence ff est ce nombre divisé par nn, donc

E(f)=pσ(f)=np(1p)n=p(1p)nE(f) = p \qquad\qquad \sigma(f) = \frac{\sqrt{np(1-p)}}{n} = \sqrt{\frac{p(1-p)}{n}}

En clair : la fréquence observée tombe en moyenne sur la bonne valeur, et s'en écarte typiquement de p(1p)/n\sqrt{p(1-p)/n}. Quand nn est grand, la binomiale est proche d'une loi normale, et 95 % des valeurs d'une loi normale tombent à moins de 1,961{,}96 écart-type de sa moyenne : c'est le nombre que la figure du chapitre précédent faisait chercher. D'où l'intervalle, où l'on remplace pp, inconnu, par ff :

Intervalle de confiance à 95 % d'une proportion
[f1,96f(1f)n ; f+1,96f(1f)n]\left[\, f - 1{,}96\sqrt{\frac{f(1-f)}{n}} \ ;\ f + 1{,}96\sqrt{\frac{f(1-f)}{n}} \,\right]

valable quand n30n \geq 30, nf5nf \geq 5 et n(1f)5n(1-f) \geq 5. On le simplifie souvent en

[f1n ; f+1n]\left[\, f - \frac{1}{\sqrt{n}} \ ;\ f + \frac{1}{\sqrt{n}} \,\right]

qui est un peu plus large, mais se calcule de tête.

La simplification n'est pas une approximation hasardeuse. Le produit f(1f)f(1-f) ne dépasse jamais 14\frac{1}{4}, atteint pour f=0,5f = 0{,}5. Donc 1,96f(1f)n1,96×12n=0,98n1{,}96\sqrt{\frac{f(1-f)}{n}} \leq 1{,}96 \times \dfrac{1}{2\sqrt{n}} = \dfrac{0{,}98}{\sqrt{n}}, qui est inférieur à 1n\dfrac{1}{\sqrt{n}}. L'intervalle simplifié contient toujours l'intervalle exact : il est prudent, et d'autant plus large que ff est loin de 0,5.

Sur 400 pièces contrôlées, 24 sont défectueuses

f=24400=0,06f = \dfrac{24}{400} = 0{,}06, et les conditions sont remplies (nf=24nf = 24, n(1f)=376n(1-f) = 376).

Intervalle simplifié. 1400=120=0,05\dfrac{1}{\sqrt{400}} = \dfrac{1}{20} = 0{,}05, d'où [0,01;0,11][0{,}01 \,;\, 0{,}11].

Intervalle exact. 1,960,06×0,944001,96×0,01190,0231{,}96\sqrt{\dfrac{0{,}06 \times 0{,}94}{400}} \approx 1{,}96 \times 0{,}0119 \approx 0{,}023, d'où [0,037;0,083][0{,}037 \,;\, 0{,}083].

On peut affirmer, avec 95 % de confiance, que le taux réel de défauts est entre 3,7 % et 8,3 %. L'intervalle simplifié, entre 1 % et 11 %, est juste mais deux fois plus large : f=0,06f = 0{,}06 est loin de 0,5, et c'est le cas où la simplification coûte le plus.

Ce que « 95 % de confiance » veut dire

La figure suivante connaît la vraie proportion, p=0,3p = 0{,}3, trait vertical fixe. Elle tire cinquante échantillons de cent individus, calcule sur chacun sa fréquence et son intervalle, et les empile. Ceux qui manquent la vraie valeur sont colorés.

00,20,40,6p = 0,3, la vraie valeurproportion observée
n = 100
demi-largeur

ce tirage : 48 sur 50 intervalles contiennent p. Largeur moyenne : 0,179.

Cinquante échantillons de cent individus, dans une population où la vraie proportion vaut 0,3. Chaque trait est l'intervalle calculé sur un échantillon ; la vraie valeur, elle, ne bouge jamais.

À l'ouverture, 48 intervalles sur 50 contiennent la vraie valeur. Les deux qui la manquent viennent d'échantillons malchanceux, l'un avec trop de « oui », l'autre avec trop peu, et rien, vu depuis l'échantillon, ne permettait de le savoir : ils ont été calculés exactement comme les autres.

À manipuler
Tirer de nouveaux échantillons une dizaine de fois, et suivre la proportion cumulée d'intervalles qui contiennent la vraie valeur : elle se stabilise autour de 95 %, sans jamais dire lequel des intervalles d'un tirage est le mauvais. Passer ensuite à la formule simplifiée : les intervalles s'élargissent et n'en manquent presque plus. Enfin, faire passer la taille de 100 à 400, soit deux crans : la largeur moyenne affichée est divisée par deux.
Ce que « 95 % de confiance » veut dire

Ce n'est pas « il y a 95 % de chances que pp soit dans cet intervalle » : pp est une valeur fixe, elle y est ou elle n'y est pas. Cela signifie : si on répétait l'échantillonnage un grand nombre de fois, 95 % des intervalles ainsi construits contiendraient la vraie valeur. C'est la méthode qui est fiable à 95 %, pas l'intervalle particulier qu'on a sous les yeux.

Et la conséquence pratique la plus importante : la largeur de l'intervalle est en 1n\dfrac{1}{\sqrt{n}}. Pour diviser l'incertitude par deux, il faut multiplier la taille de l'échantillon par quatre. C'est ce qui rend la précision coûteuse : passer de ±5 points à ±1 point demande vingt-cinq fois plus d'individus, de 400 à 10 000.

L'intervalle de confiance d'une moyenne

Une mesure physique répétée ne donne pas une proportion mais une moyenne, et la même logique s'applique. Si nn mesures indépendantes ont pour moyenne xˉ\bar{x} et pour écart-type ss, la moyenne observée s'écarte typiquement de la vraie valeur de s/ns/\sqrt{n}, et pour nn assez grand, environ 30 ou plus :

Intervalle de confiance à 95 % d'une moyenne
[xˉ1,96sn ; xˉ+1,96sn]\left[\, \bar{x} - 1{,}96\,\frac{s}{\sqrt{n}} \ ;\ \bar{x} + 1{,}96\,\frac{s}{\sqrt{n}} \,\right]

ss est l'écart-type calculé en divisant par n1n - 1, puisqu'il estime celui de la population.

Exemple travaillé. Cinquante mesures du temps de démarrage d'un service donnent xˉ=4,20\bar{x} = 4{,}20 s et s=0,60s = 0{,}60 s. L'écart-type de la moyenne vaut 0,60/500,0850{,}60/\sqrt{50} \approx 0{,}085 s, et l'intervalle est 4,20±1,96×0,0854{,}20 \pm 1{,}96 \times 0{,}085, soit [4,03;4,37][4{,}03 \,;\, 4{,}37] s.

Deux écarts-types à ne pas confondre
s=0,60s = 0{,}60 s décrit la dispersion des mesures : un démarrage isolé s'écarte typiquement de 0,6 s de la moyenne. s/n=0,085s/\sqrt{n} = 0{,}085 s décrit la précision de la moyenne. Le premier ne diminue pas quand on mesure davantage, le second si. Annoncer « 4,2 s à 0,085 près » pour un démarrage isolé est faux, et c'est pourtant la confusion la plus répandue.

Encadrer une proportion, et le prix d'un intervalle deux fois plus étroit

Sur un échantillon de 2500 pièces prélevées au hasard, 850 sont défectueuses. On encadre la proportion réelle de pièces défectueuses par l'intervalle simplifié à 95 %, [f1n;f+1n]\left[f - \dfrac{1}{\sqrt{n}} \,;\, f + \dfrac{1}{\sqrt{n}}\right]. Toutes les réponses sont en pour cent.

  1. La fréquence observée ff%
  2. La demi-largeur de l'intervallepoints
  3. La borne basse de l'intervalle%
  4. La borne haute de l'intervalle%
  5. La taille d'échantillon qui diviserait cette demi-largeur par deux
Vérification rapideon peut se reprendre

Un intervalle de confiance à 95 % vaut [0,21 ; 0,39]. Quelle phrase est juste ?

Où la démarche dérape

Une droite juste, un coefficient excellent, et une prévision qui n'a aucun sens.

Une droite prolongée trop loin

Une seule étape est fausse. Désigner laquelle.

L'autonomie d'une batterie de secours, en heures, est relevée en fonction du nombre d'appareils qu'elle alimente, de 0 à 3 appareils. Les points sont presque alignés, et la droite des moindres carrés s'écrit A=123nA = 12 - 3n, avec un coefficient de corrélation de 0,99-0{,}99. On cherche l'autonomie pour 7 appareils.

À calculer soi-même

Trois nombres : une droite, une précision, et le prix d'une précision deux fois meilleure.

Ajuster, puis estimer

  • 1.

    Pour xˉ=10\bar{x} = 10, yˉ=25\bar{y} = 25, cov(x,y)=12\operatorname{cov}(x, y) = 12 et V(x)=8V(x) = 8, quelle est la pente de la droite de régression ?

  • 2.

    Pour la même droite, quelle est l'ordonnée à l'origine ?

  • 3.

    Sur un échantillon de 100 personnes, 40 % répondent oui. Quelle est la demi-largeur de l'intervalle de confiance à 95 % ?

  • 4.

    Quelle taille d'échantillon faut-il pour garantir une précision de ±0,02\pm 0{,}02 à 95 %, sans rien savoir de pp ?

Exercices type

Interpréter r = −0,95 entre la température et la consommation de chauffage

Corrélation linéaire négative et très forte : plus il fait chaud, moins on chauffe, et la relation est presque parfaitement linéaire sur le domaine observé (r20,90r^2 \approx 0{,}90 : la droite explique 90 % de la variation de la consommation).

Un ajustement affine est ici pleinement légitime. Attention toutefois à l'extrapolation : à 35 °C, la droite prédirait une consommation négative, ce qui n'a pas de sens. La relation linéaire ne vaut que sur la plage observée.

Droite de régression avec xˉ=10\bar{x} = 10, yˉ=25\bar{y} = 25, cov(x,y)=12\operatorname{cov}(x, y) = 12, V(x)=8V(x) = 8 a=128=1,5b=251,5×10=10a = \frac{12}{8} = 1{,}5 \qquad\qquad b = 25 - 1{,}5 \times 10 = 10

La droite est y=1,5x+10y = 1{,}5x + 10.

Contrôle : pour x=10x = 10, on obtient y=25y = 25, c'est bien le point moyen.

Un sondage sur 1000 personnes donne 52 % pour un candidat. Peut-on conclure qu'il gagne ?

110000,032\dfrac{1}{\sqrt{1000}} \approx 0{,}032, soit ±3,2 points. La formule exacte donne 1,960,52×0,4810000,0311{,}96\sqrt{\dfrac{0{,}52 \times 0{,}48}{1000}} \approx 0{,}031 : presque la même chose, puisque ff est proche de 0,5.

L'intervalle de confiance à 95 % est [48,8%;55,2%][48{,}8 \% ; 55{,}2 \%]. Il contient 50 %.

On ne peut donc pas conclure : le candidat est peut-être minoritaire. C'est exactement la raison pour laquelle les instituts publient une marge d'erreur, et pourquoi un écart de 2 points est considéré comme non significatif sur un tel échantillon.

La méthode

  1. Tracer le nuage avant de calculer un coefficient. Une corrélation nulle n'exclut pas une dépendance, elle exclut seulement une dépendance linéaire.
  2. Poser le tableau des écarts : la somme de chaque colonne d'écarts doit être nulle, et c'est le contrôle qui ne coûte rien.
  3. Calculer rr avant d'écrire la droite, et justifier que l'ajustement est légitime.
  4. Contrôler la droite : elle passe par le point moyen, et sa pente a le signe de rr.
  5. Regarder les résidus : dispersés sans forme, le modèle affine convient ; dessinant une courbe, il ne convient pas, quel que soit rr.
  6. Ne jamais conclure à une causalité à partir d'une corrélation. L'écrire noir sur blanc est souvent une question à part entière.
  7. Pour un intervalle de confiance, rappeler la taille de l'échantillon et vérifier les conditions : c'est nn qui fait la précision.
  8. Interpoler, extrapoler seulement en le disant, et vérifier que la prévision garde un sens physique.

Synthèse

  • Covariance cov(x,y)=1N(xixˉ)(yiyˉ)\operatorname{cov}(x,y) = \frac{1}{N}\sum (x_i - \bar{x})(y_i - \bar{y}) : le sens du lien. Corrélation r=covσxσyr = \dfrac{\operatorname{cov}}{\sigma_x\sigma_y}, entre −1 et 1 : sa force.
  • Corrélation ≠ causalité, et r=0r = 0 ≠ indépendance. Regarder toujours le nuage, puis les résidus.
  • r2r^2 se lit comme la part de la variation de yy que la droite explique : r=0,8r = 0{,}8 n'en explique que 64 %.
  • Régression : a=cov(x,y)V(x)a = \dfrac{\operatorname{cov}(x,y)}{V(x)}, b=yˉaxˉb = \bar{y} - a\bar{x}. La droite passe par le point moyen.
  • Une droite ne vaut que sur le domaine observé : extrapoler loin des mesures produit des prévisions absurdes.
  • Intervalle de confiance à 95 % d'une proportion : f±1,96f(1f)/nf \pm 1{,}96\sqrt{f(1-f)/n}, ou f±1/nf \pm 1/\sqrt{n} plus prudent.
  • Intervalle de confiance à 95 % d'une moyenne : xˉ±1,96s/n\bar{x} \pm 1{,}96\,s/\sqrt{n}, avec ss calculé en divisant par n1n - 1.
  • Le 95 % qualifie la méthode, pas l'intervalle qu'on a sous les yeux. Pour deux fois plus de précision, quatre fois plus de données.

Mettre en pratique