Lorsqu'on étudie simultanément deux caractères X et Y sur N individus, on obtient N couples (xᵢ ; yᵢ).
Le nuage de points est la représentation graphique de ces N couples dans un repère orthogonal.
Le point moyen (centre de gravité du nuage) est G(x̄ ; ȳ) où :
x̄ = (Σ nᵢ xᵢ) / N et ȳ = (Σ nᵢ yᵢ) / N
Propriété fondamentale : toute droite de régression passe par le point moyen G.
La droite de régression de Y en X est la droite y = ax + b qui minimise la somme des carrés des écarts verticaux. Elle passe obligatoirement par G(x̄;ȳ).
Coefficients :
a = Cov(X,Y) / Var(X) et b = ȳ − a·x̄
avec :
Cov(X,Y) = (Σ nᵢ xᵢ yᵢ)/N − x̄·ȳ
Var(X) = (Σ nᵢ xᵢ²)/N − x̄²
r = Cov(X,Y) / (σX · σY) avec σX=√Var(X), σY=√Var(Y)
• r ∈ [−1 ; 1]
• |r| proche de 1 : forte corrélation linéaire
• |r| proche de 0 : faible corrélation (ou pas de relation linéaire)
• r > 0 : corrélation positive (Y croît quand X croît)
• r < 0 : corrélation négative
La méthode de Mayer est une méthode pratique d'ajustement :
1. Ordonner les points par abscisse croissante.
2. Partager en deux groupes de taille égale (ou quasi-égale).
3. Calculer le point moyen de chaque groupe : G₁(x̄₁;ȳ₁) et G₂(x̄₂;ȳ₂).
4. La droite de Mayer est la droite passant par G₁ et G₂.
Pente : a = (ȳ₂ − ȳ₁)/(x̄₂ − x̄₁) et b = ȳ₁ − a·x̄₁
• Plus simple à calculer que la droite des moindres carrés.
• Donne une bonne approximation de la tendance générale.
• Moins précise que la méthode des moindres carrés.
La droite y=ax+b permet de prévoir y connaissant x (interpolation ou extrapolation).
Attention : la corrélation n'implique pas la causalité. Deux variables peuvent être corrélées sans lien de cause à effet direct.
L'extrapolation loin des données observées est hasardeuse.
Un étudiant mesure la durée d'étude X (en h) et la note Y (sur 20) sur 6 séances :
| X (h) | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| Y (note) | 6 | 9 | 11 | 13 | 16 | 17 |
(Suite de l'exercice 1)
(Suite — données: x̄=3,5, ȳ=12, Cov=6,5, σX≈1,708)
(Suite — 6 points de données : (1;6),(2;9),(3;11),(4;13),(5;16),(6;17))
Prix X (en milliers de F) et quantités vendues Y (en dizaines) d'un produit :
| X | 10 | 15 | 20 | 25 | 30 |
|---|---|---|---|---|---|
| Y | 50 | 40 | 35 | 20 | 15 |
10 questions · Correction immédiate
Le point moyen G(x̄;ȳ) est :
Cov(X,Y) = Σnᵢxᵢyᵢ/N − x̄ȳ. Si X et Y sont indépendants :
La pente a de la droite de régression de Y en X vaut :
r = −0,95 indique :
La méthode de Mayer consiste à :
r = 1 signifie que :
L'ordonnée à l'origine b de la droite de régression est :
Extrapoler la droite de régression très loin des données :
x̄=5, ȳ=10, a=2. L'ordonnée à l'origine b vaut :
Si r=0, le nuage de points ressemble à :