Deux variables et estimation
Ce que ce chapitre apporte6 points
- Tracer et lire un nuage de points, et repérer ce qu'aucun coefficient ne dit.
- Calculer une covariance, puis un coefficient de corrélation, et interpréter son signe et sa force.
- Écrire une droite de régression par les moindres carrés, et la contrôler par le point moyen.
- Distinguer corrélation et causalité, et reconnaître une relation non linéaire.
- Estimer une proportion et une moyenne, et donner un intervalle de confiance.
- Dire ce que « 95 % de confiance » signifie, et ce que coûte une précision deux fois meilleure.
Et la mesure ne porte jamais sur la population entière. On contrôle quelques centaines de pièces, on interroge mille personnes, et il faut en tirer une affirmation sur la production ou le pays tout entier, avec la précision qui va avec. Ce chapitre traite les deux questions : le lien entre deux séries, puis ce qu'un échantillon autorise à dire.
Le chapitre précédent décrit une série ; celui-ci en relie deux et remonte à la population.
Ce chapitre installe les outils de la statistique à deux variables, puis continue vers l'estimation et l'intervalle de confiance, qui n'appartiennent qu'à lui.
Corrélation, régression et moindres carrés reprend les mêmes outils sur des mesures d'ingénierie et va plus loin sur un seul point, mais décisif : ce qui rend un ajustement valide ou trompeur. Le quatuor d'Anscombe, la lecture des résidus et l'entonnoir s'y trouvent, et nulle part ailleurs.
Séries à deux variables
On mesure deux caractères sur les mêmes individus (une température et une résistance, une durée d'usage et une usure) et on cherche s'ils sont liés.
Nuage de points
On représente chaque individu par le point . Le point moyen est le centre de gravité du nuage. Regarder le nuage avant de calculer quoi que ce soit est indispensable : lui seul révèle une relation courbe, un groupe à part, une valeur aberrante.
Voici les deux situations qu'aucun coefficient ne distingue. La première a un lien affine réel.
La seconde a un lien tout aussi fort, mais courbe. La droite y est calculable, elle est même la meilleure droite possible, et elle ne décrit rien.
Après avoir tracé la droite, regarder les résidus, c'est-à-dire les écarts verticaux entre les points et la droite. S'ils sont dispersés sans forme, le modèle affine convient. S'ils dessinent une courbe, un arc ou un motif, c'est que la relation n'est pas affine, quel que soit le coefficient de corrélation obtenu.
Covariance
Pour mesurer si deux variables varient ensemble, on regarde, pour chaque individu, de quel côté de la moyenne tombe chacune de ses deux mesures.
La covariance de et est la moyenne des produits des écarts :
En clair : un individu au-dessus de la moyenne sur les deux variables, ou en dessous sur les deux, donne un produit positif. Un individu au-dessus sur l'une et en dessous sur l'autre donne un produit négatif. La covariance fait la moyenne de ces produits : elle est positive si les deux variables montent ensemble, négative si l'une descend quand l'autre monte. La seconde écriture, comme pour la variance, sert au calcul.
La figure trace les deux droites qui passent par le point moyen et colore chaque point selon le signe de son produit.
Sur un nuage sans lien, les points se répartiraient dans les quatre quadrants, et les produits positifs et négatifs se compenseraient : la covariance serait proche de zéro. Ici aucun point ne tombe dans les quadrants négatifs.
La covariance a un défaut : sa valeur dépend des unités. Mesurer la température en kelvins ou les locations en unités plutôt qu'en centaines la multiplie par 100, sans que le lien ait changé. Elle dit le sens du lien, pas sa force. Pour la force, on la normalise.
Coefficient de corrélation
Le coefficient de corrélation linéaire est
Il est sans unité, et toujours compris entre −1 et 1.
En divisant par les deux écarts-types, on fait disparaître les unités : ne change pas quand on change d'unité sur l'une ou l'autre variable. Sa lecture :
- proche de 1 : les points sont presque alignés sur une droite croissante ;
- proche de −1 : presque alignés sur une droite décroissante ;
- proche de 0 : aucune relation linéaire, ce qui n'exclut pas une relation d'un autre type.
Son carré , affiché sous les nuages, se lit comme la part de la variation de expliquée par la droite. Pour , : la droite explique moins des deux tiers de la variation, alors que 0,8 sonne comme un lien très fort.
1. Corrélation n'est pas causalité. Les ventes de glaces et les noyades sont fortement corrélées ; aucune ne cause l'autre, c'est la chaleur qui cause les deux. Une corrélation ne dit rien du pourquoi.
2. ne signifie pas « indépendantes ». Des points parfaitement disposés sur une parabole peuvent donner : la relation est totale, mais elle n'est pas linéaire, et ne mesure que le linéaire. D'où l'obligation de regarder le nuage.
Ce n'est pas une figure de style. Voici neuf points posés exactement sur une parabole : est entièrement déterminé par , il n'y a aucun hasard, et pourtant le coefficient de corrélation est nul.
Les neuf abscisses sont symétriques autour de zéro, donc leur moyenne est nulle. La covariance vaut , et comme est une fonction paire, chaque terme d'abscisse annule exactement celui d'abscisse . La somme est nulle, donc , alors que est entièrement déterminé par .
| x | f |
|---|---|
| -4,5 | 20,25 |
| -4,05 | 16,4025 |
| -4 | 16 |
| -3,6 | 12,96 |
| -3,15 | 9,9225 |
| -2,7 | 7,29 |
| -2,25 | 5,0625 |
| -2 | 4 |
| -1,8 | 3,24 |
| -1,35 | 1,8225 |
| -0,9 | 0,81 |
| -0,45 | 0,2025 |
| 0 | 0 |
| 0,45 | 0,2025 |
| 0,9 | 0,81 |
| 1,35 | 1,8225 |
| 1,8 | 3,24 |
| 2 | 4 |
| 2,25 | 5,0625 |
| 2,7 | 7,29 |
| 3,15 | 9,9225 |
| 3,6 | 12,96 |
| 4 | 16 |
| 4,05 | 16,4025 |
| 4,5 | 20,25 |
En termes de quadrants : les points de droite tombent dans un quadrant positif, ceux de gauche dans le quadrant négatif symétrique, et les deux se compensent exactement. Un coefficient de corrélation nul ne dit pas « pas de lien », il dit « pas de lien linéaire ».
Droite de régression
La droite de régression de en , dite droite des moindres carrés, est celle qui minimise la somme des carrés des résidus, c'est-à-dire des écarts verticaux entre les points et la droite. Son équation est avec
Les deux formules se lisent. La pente a le signe de la covariance, donc de : la droite monte si le nuage monte. Et la seconde formule s'écrit aussi : la droite passe toujours par le point moyen . C'est le contrôle à faire sur toute droite calculée à la main.
« Moindres carrés » n'est pas une formule tombée du ciel, c'est une recherche. La figure suivante dessine le carré construit sur chaque résidu et en affiche la somme ; la droite se règle à la main.
Le minimum vaut 4,83, soit 89,17 de moins qu'ici.
Les moyennes. °C et centaines.
Le tableau des écarts. Une colonne par écart, une pour le produit, une pour le carré de l'écart en :
| produit | |||||
|---|---|---|---|---|---|
| 8 | 12 | −10,5 | −13,5 | 141,75 | 110,25 |
| 11 | 15 | −7,5 | −10,5 | 78,75 | 56,25 |
| 14 | 19 | −4,5 | −6,5 | 29,25 | 20,25 |
| 17 | 22 | −1,5 | −3,5 | 5,25 | 2,25 |
| 20 | 28 | 1,5 | 2,5 | 3,75 | 2,25 |
| 23 | 31 | 4,5 | 5,5 | 24,75 | 20,25 |
| 26 | 36 | 7,5 | 10,5 | 78,75 | 56,25 |
| 29 | 41 | 10,5 | 15,5 | 162,75 | 110,25 |
| Somme | 0 | 0 | 525 | 378 |
Les deux colonnes d'écarts totalisent 0 : c'est le contrôle gratuit, une somme d'écarts à la moyenne est toujours nulle. Tous les produits sont positifs, comme la figure des quadrants l'annonçait.
Covariance, variance, droite.
La droite est : chaque degré supplémentaire apporte environ 139 locations par jour.
Le coefficient de corrélation. Il faut encore , la moyenne des carrés de la quatrième colonne : . Alors
Le lien est presque parfaitement affine, ce qui justifie la droite. Une prévision à 25 °C donne centaines de locations.
L'ajustement sert à interpoler (estimer une valeur à l'intérieur du domaine observé) et, avec prudence, à extrapoler. L'extrapolation loin des données observées est le péché classique : rien ne garantit que la relation linéaire se prolonge. À 45 °C, cette droite promet 6 200 locations ; en réalité, plus personne ne pédale.
Une régression linéaire n'a de sens que si est proche de ±1 et si les résidus ne dessinent aucune forme. Ajuster une droite sur un nuage de produit une équation qui ne prédit rien. On annonce donc avant d'écrire la droite, et on justifie que l'ajustement est légitime.
Le calcul a deux fautes rituelles : diviser la covariance par la variance de au lieu de celle de , et se tromper de signe dans . L'exercice suivant les fait rencontrer sur cinq points, jusqu'à ce que la procédure soit acquise. Le chapitre corrélation et moindres carrés la reprend sur des mesures physiques.
La droite des moindres carrés, en six nombres
Cinq relevés : , , , , .
- La moyenne
- La moyenne
- La variance
- La covariance
- Le coefficient directeur de la droite des moindres carrés
- L'ordonnée à l'origine
1.On calcule entre deux séries. Que peut-on conclure ?
2.Les ventes de glaces et le nombre de noyades sont fortement corrélées. Que peut-on en déduire ?
3.Par quel point passe toujours la droite des moindres carrés ?
Échantillonnage et estimation
Jusqu'ici on décrivait des données. Ici on veut en tirer une conclusion sur une population qu'on n'a pas entièrement observée : le taux de défauts d'une production entière, à partir de quelques centaines de pièces contrôlées.
Un échantillon est une partie de la population, choisie au hasard. On calcule sur l'échantillon une estimation de la grandeur inconnue de la population : la fréquence observée estime la proportion réelle , la moyenne de l'échantillon estime la moyenne de la population.
Une estimation n'est jamais exacte : un autre échantillon aurait donné une autre fréquence. Ce qu'on peut donner, c'est un intervalle et un niveau de confiance.
D'où vient l'intervalle
Sur un échantillon de individus, le nombre de « oui » suit une loi binomiale , d'espérance et d'écart-type . La fréquence est ce nombre divisé par , donc
En clair : la fréquence observée tombe en moyenne sur la bonne valeur, et s'en écarte typiquement de . Quand est grand, la binomiale est proche d'une loi normale, et 95 % des valeurs d'une loi normale tombent à moins de écart-type de sa moyenne : c'est le nombre que la figure du chapitre précédent faisait chercher. D'où l'intervalle, où l'on remplace , inconnu, par :
valable quand , et . On le simplifie souvent en
qui est un peu plus large, mais se calcule de tête.
La simplification n'est pas une approximation hasardeuse. Le produit ne dépasse jamais , atteint pour . Donc , qui est inférieur à . L'intervalle simplifié contient toujours l'intervalle exact : il est prudent, et d'autant plus large que est loin de 0,5.
, et les conditions sont remplies (, ).
Intervalle simplifié. , d'où .
Intervalle exact. , d'où .
On peut affirmer, avec 95 % de confiance, que le taux réel de défauts est entre 3,7 % et 8,3 %. L'intervalle simplifié, entre 1 % et 11 %, est juste mais deux fois plus large : est loin de 0,5, et c'est le cas où la simplification coûte le plus.
Ce que « 95 % de confiance » veut dire
La figure suivante connaît la vraie proportion, , trait vertical fixe. Elle tire cinquante échantillons de cent individus, calcule sur chacun sa fréquence et son intervalle, et les empile. Ceux qui manquent la vraie valeur sont colorés.
ce tirage : 48 sur 50 intervalles contiennent p. Largeur moyenne : 0,179.
À l'ouverture, 48 intervalles sur 50 contiennent la vraie valeur. Les deux qui la manquent viennent d'échantillons malchanceux, l'un avec trop de « oui », l'autre avec trop peu, et rien, vu depuis l'échantillon, ne permettait de le savoir : ils ont été calculés exactement comme les autres.
Ce n'est pas « il y a 95 % de chances que soit dans cet intervalle » : est une valeur fixe, elle y est ou elle n'y est pas. Cela signifie : si on répétait l'échantillonnage un grand nombre de fois, 95 % des intervalles ainsi construits contiendraient la vraie valeur. C'est la méthode qui est fiable à 95 %, pas l'intervalle particulier qu'on a sous les yeux.
Et la conséquence pratique la plus importante : la largeur de l'intervalle est en . Pour diviser l'incertitude par deux, il faut multiplier la taille de l'échantillon par quatre. C'est ce qui rend la précision coûteuse : passer de ±5 points à ±1 point demande vingt-cinq fois plus d'individus, de 400 à 10 000.
L'intervalle de confiance d'une moyenne
Une mesure physique répétée ne donne pas une proportion mais une moyenne, et la même logique s'applique. Si mesures indépendantes ont pour moyenne et pour écart-type , la moyenne observée s'écarte typiquement de la vraie valeur de , et pour assez grand, environ 30 ou plus :
où est l'écart-type calculé en divisant par , puisqu'il estime celui de la population.
Exemple travaillé. Cinquante mesures du temps de démarrage d'un service donnent s et s. L'écart-type de la moyenne vaut s, et l'intervalle est , soit s.
Encadrer une proportion, et le prix d'un intervalle deux fois plus étroit
Sur un échantillon de 2500 pièces prélevées au hasard, 850 sont défectueuses. On encadre la proportion réelle de pièces défectueuses par l'intervalle simplifié à 95 %, . Toutes les réponses sont en pour cent.
- La fréquence observée %
- La demi-largeur de l'intervallepoints
- La borne basse de l'intervalle%
- La borne haute de l'intervalle%
- La taille d'échantillon qui diviserait cette demi-largeur par deux
Un intervalle de confiance à 95 % vaut [0,21 ; 0,39]. Quelle phrase est juste ?
Où la démarche dérape
Une droite juste, un coefficient excellent, et une prévision qui n'a aucun sens.
Une droite prolongée trop loin
Une seule étape est fausse. Désigner laquelle.
L'autonomie d'une batterie de secours, en heures, est relevée en fonction du nombre d'appareils qu'elle alimente, de 0 à 3 appareils. Les points sont presque alignés, et la droite des moindres carrés s'écrit , avec un coefficient de corrélation de . On cherche l'autonomie pour 7 appareils.
À calculer soi-même
Trois nombres : une droite, une précision, et le prix d'une précision deux fois meilleure.
Ajuster, puis estimer
- 1.
Pour , , et , quelle est la pente de la droite de régression ?
- 2.
Pour la même droite, quelle est l'ordonnée à l'origine ?
- 3.
Sur un échantillon de 100 personnes, 40 % répondent oui. Quelle est la demi-largeur de l'intervalle de confiance à 95 % ?
- 4.
Quelle taille d'échantillon faut-il pour garantir une précision de à 95 %, sans rien savoir de ?
Exercices type
Interpréter r = −0,95 entre la température et la consommation de chauffage
Corrélation linéaire négative et très forte : plus il fait chaud, moins on chauffe, et la relation est presque parfaitement linéaire sur le domaine observé ( : la droite explique 90 % de la variation de la consommation).
Un ajustement affine est ici pleinement légitime. Attention toutefois à l'extrapolation : à 35 °C, la droite prédirait une consommation négative, ce qui n'a pas de sens. La relation linéaire ne vaut que sur la plage observée.
Droite de régression avec , , ,
La droite est .
Contrôle : pour , on obtient , c'est bien le point moyen.
Un sondage sur 1000 personnes donne 52 % pour un candidat. Peut-on conclure qu'il gagne ?
, soit ±3,2 points. La formule exacte donne : presque la même chose, puisque est proche de 0,5.
L'intervalle de confiance à 95 % est . Il contient 50 %.
On ne peut donc pas conclure : le candidat est peut-être minoritaire. C'est exactement la raison pour laquelle les instituts publient une marge d'erreur, et pourquoi un écart de 2 points est considéré comme non significatif sur un tel échantillon.
La méthode
- Tracer le nuage avant de calculer un coefficient. Une corrélation nulle n'exclut pas une dépendance, elle exclut seulement une dépendance linéaire.
- Poser le tableau des écarts : la somme de chaque colonne d'écarts doit être nulle, et c'est le contrôle qui ne coûte rien.
- Calculer avant d'écrire la droite, et justifier que l'ajustement est légitime.
- Contrôler la droite : elle passe par le point moyen, et sa pente a le signe de .
- Regarder les résidus : dispersés sans forme, le modèle affine convient ; dessinant une courbe, il ne convient pas, quel que soit .
- Ne jamais conclure à une causalité à partir d'une corrélation. L'écrire noir sur blanc est souvent une question à part entière.
- Pour un intervalle de confiance, rappeler la taille de l'échantillon et vérifier les conditions : c'est qui fait la précision.
- Interpoler, extrapoler seulement en le disant, et vérifier que la prévision garde un sens physique.
Synthèse
- Covariance : le sens du lien. Corrélation , entre −1 et 1 : sa force.
- Corrélation ≠ causalité, et ≠ indépendance. Regarder toujours le nuage, puis les résidus.
- se lit comme la part de la variation de que la droite explique : n'en explique que 64 %.
- Régression : , . La droite passe par le point moyen.
- Une droite ne vaut que sur le domaine observé : extrapoler loin des mesures produit des prévisions absurdes.
- Intervalle de confiance à 95 % d'une proportion : , ou plus prudent.
- Intervalle de confiance à 95 % d'une moyenne : , avec calculé en divisant par .
- Le 95 % qualifie la méthode, pas l'intervalle qu'on a sous les yeux. Pour deux fois plus de précision, quatre fois plus de données.
Mettre en pratique
Corrélation, droite des moindres carrés et intervalle de confiance.
- La droite et son point moyenNiveau 3
- Diviser l'incertitude par deuxNiveau 4
- Ce qu'un coefficient de corrélation expliqueNiveau 3