Méthodes linéaires multivariées · Chapitre 1

Estimation des paramètres

L'estimateur des moindres carrés ordinaires β̂ = (X'X)⁻¹X'y, et le théorème de Gauss-Markov qui en garantit l'optimalité parmi les estimateurs linéaires sans biais.

🎓 Niveau L3 Maths / 1ᵉ année ingénieur ⏱ Cours ~45 min ✎ 20 exercices ✓ QCM 10 questions 📄 2 sujets d'annales corrigés

1Le principe des moindres carrés

Comment choisir le « meilleur » $\beta$ parmi toutes les valeurs possibles ? Le critère le plus naturel consiste à minimiser la somme des carrés des résidus — un problème d'optimisation sans contrainte (chapitre correspondant du cours d'optimisation, prérequis) :

$$\min_\beta \ \text{SSE}(\beta) = \sum_{i=1}^n\big(y_i-x_i^T\beta\big)^2 = \|y-X\beta\|^2$$

où $x_i^T$ désigne la $i$-ème ligne de $X$. On appelle cette quantité la somme des carrés des résidus (Sum of Squared Errors, SSE).

2Résolution du problème d'optimisation

En développant $\text{SSE}(\beta)=(y-X\beta)^T(y-X\beta)$ et en annulant le gradient par rapport à $\beta$ (chapitre « Conditions d'optimalité », condition du premier ordre) :

$$\nabla_\beta\text{SSE}(\beta) = -2X^T(y-X\beta) = 0$$

Équations normales

$$X^TX\,\beta = X^Ty$$

Si $X^TX$ est inversible (ce qui requiert que les colonnes de $X$ soient linéairement indépendantes — l'absence de colinéarité parfaite, chapitre « Qualité d'ajustement et diagnostics »), on obtient l'estimateur des moindres carrés ordinaires :

Estimateur des moindres carrés ordinaires (MCO)

$$\hat\beta = (X^TX)^{-1}X^Ty$$

On vérifie (Hessienne $\nabla^2\text{SSE}=2X^TX$, semi-définie positive, chapitre « Conditions d'optimalité ») qu'il s'agit bien d'un minimum — global de surcroît, la fonction $\text{SSE}$ étant convexe.

3Exemple résolu

Exemple résolu

Pour $X=\begin{pmatrix}1&1&2\\1&2&1\\1&3&4\\1&4&3\\1&5&5\end{pmatrix}$ et $y=(5,6,12,13,18)^T$ :

$X^TX=\begin{pmatrix}5&15&15\\15&55&53\\15&53&55\end{pmatrix}$, $X^Ty=(54,\,195,\,193)^T$.

En résolvant le système linéaire $X^TX\hat\beta=X^Ty$ (chapitre « Résolution des systèmes linéaires ») : $\hat\beta\approx(0{,}133,\,2{,}278,\,1{,}278)^T$.

4Cadre de Gauss-Markov

Théorème de Gauss-Markov

Sous les hypothèses du chapitre précédent ($\mathbb E[\varepsilon]=0$, $\text{Var}(\varepsilon)=\sigma^2I_n$) — sans supposer la normalité des erreurs — l'estimateur $\hat\beta$ des moindres carrés est BLUE (Best Linear Unbiased Estimator) : parmi tous les estimateurs linéaires et sans biais de $\beta$, $\hat\beta$ est celui de variance minimale.

Deux propriétés clés découlent directement de ce cadre :

Sans biais

$\mathbb E[\hat\beta]=\beta$ : en moyenne (sur un grand nombre d'échantillons hypothétiques), l'estimateur retrouve la vraie valeur des paramètres.

Matrice de variance-covariance

$$\text{Var}(\hat\beta) = \sigma^2\,(X^TX)^{-1}$$

où $\sigma^2$ (inconnue en pratique) est estimée par $\hat\sigma^2=\dfrac{\text{SSE}}{n-p-1}$ (le dénominateur $n-p-1$, plutôt que $n$, corrige le biais dû à l'estimation de $p+1$ paramètres — un principe similaire à la correction de Bessel pour la variance empirique, chapitre « Statistiques »).

5Exemple résolu — variance des estimateurs

Exemple résolu

Pour l'exemple du §3, les résidus sont $\hat\varepsilon\approx(0{,}033,\,0{,}033,\,-0{,}078,\,-0{,}078,\,0{,}089)^T$, avec $\text{SSE}\approx0{,}0222$.

$n=5,\,p=2\Rightarrow\hat\sigma^2=\dfrac{0{,}0222}{5-2-1}=\dfrac{0{,}0222}2\approx0{,}0111$.

Les écarts-types estimés des coefficients sont $\text{SE}(\hat\beta_0)\approx0{,}115$, $\text{SE}(\hat\beta_1)\approx0{,}056$, $\text{SE}(\hat\beta_2)\approx0{,}056$ — ces quantités serviront directement à construire les tests de significativité du chapitre suivant.

6Propriété géométrique

Interprétation géométrique

$\hat y=X\hat\beta$ est la projection orthogonale de $y$ sur le sous-espace vectoriel engendré par les colonnes de $X$. Le vecteur des résidus $\hat\varepsilon=y-\hat y$ est orthogonal à ce sous-espace, ce qui explique pourquoi $\displaystyle\sum_{i=1}^n\hat\varepsilon_i=0$ dès que $X$ contient une colonne de $1$ (l'intercept) — une conséquence directe des équations normales, déjà observée numériquement au §5.

Exercice 1 — Écrire la fonction à minimiser

Facile

Écrire la somme des carrés des résidus $\text{SSE}(\beta)$ sous forme matricielle.

Voir la correction

$\text{SSE}(\beta)=\|y-X\beta\|^2=(y-X\beta)^T(y-X\beta)$ (cours §1).

Exercice 2 — Écrire les équations normales

Facile

Écrire les équations normales obtenues en annulant le gradient de $\text{SSE}(\beta)$.

Voir la correction

$X^TX\beta=X^Ty$ (cours §2).

Exercice 3 — Écrire l'estimateur MCO

Facile

En déduire la formule de l'estimateur des moindres carrés ordinaires $\hat\beta$.

Voir la correction

$\hat\beta=(X^TX)^{-1}X^Ty$ (cours §2).

Exercice 4 — Calculer X'X

Moyen

Pour $X=\begin{pmatrix}1&1\\1&2\\1&3\\1&4\end{pmatrix}$, calculer $X^TX$.

Voir la correction

$X^TX=\begin{pmatrix}4&10\\10&30\end{pmatrix}$.

Exercice 5 — Calculer X'y

Moyen

Pour le $X$ de l'exercice 4 et $y=(2,4,5,8)^T$, calculer $X^Ty$.

Voir la correction

$X^Ty=(2+4+5+8,\ 2+8+15+32)^T=(19,\,57)^T$.

Exercice 6 — Résoudre le système normal

Moyen

Résoudre $X^TX\hat\beta=X^Ty$ pour les exercices 4-5.

Voir la correction

$\begin{pmatrix}4&10\\10&30\end{pmatrix}\hat\beta=\begin{pmatrix}19\\57\end{pmatrix}$. En résolvant (chapitre « Résolution des systèmes linéaires ») : $\hat\beta\approx(0,\,1{,}9)^T$.

Exercice 7 — Interpréter l'estimateur trouvé

Facile

Pour l'exercice 6, écrire l'équation de la droite de régression ajustée.

Voir la correction

$\hat y=0+1{,}9x=1{,}9x$ (une droite passant quasiment par l'origine, avec une pente de $1{,}9$).

Exercice 8 — Vérifier la somme des résidus

Moyen

Pour l'exercice 6-7, calculer les résidus et vérifier que leur somme est nulle.

Voir la correction

Valeurs prédites : $(1{,}9,\,3{,}8,\,5{,}7,\,7{,}6)$. Résidus : $(0{,}1,\,0{,}2,\,-0{,}7,\,0{,}4)$.

Somme $=0{,}1+0{,}2-0{,}7+0{,}4=0$ ✓ (cours §6, propriété géométrique).

Exercice 9 — Interpréter l'absence de biais

Moyen

Que signifie concrètement $\mathbb E[\hat\beta]=\beta$, si l'on répétait la collecte de données un grand nombre de fois ?

Voir la correction

En moyenne sur un grand nombre d'échantillons hypothétiques (mêmes valeurs de $x$, mais bruit $\varepsilon$ différent à chaque fois), la moyenne des estimations $\hat\beta$ obtenues coïnciderait exactement avec la vraie valeur $\beta$ — même si, pour un échantillon particulier, $\hat\beta$ diffère toujours un peu de $\beta$ (cours §4).

Exercice 10 — Calculer la variance des estimateurs

Moyen

Pour l'exercice 8 (SSE à calculer), $n=4,\,p=1$, calculer $\hat\sigma^2$ puis $\text{Var}(\hat\beta)=\hat\sigma^2(X^TX)^{-1}$.

Voir la correction

$\text{SSE}=0{,}1^2+0{,}2^2+0{,}7^2+0{,}4^2=0{,}01+0{,}04+0{,}49+0{,}16=0{,}7$. $\hat\sigma^2=0{,}7/(4-1-1)=0{,}35$.

$(X^TX)^{-1}=\begin{pmatrix}1{,}5&-0{,}5\\-0{,}5&0{,}2\end{pmatrix}$ (à partir de $X^TX=\begin{pmatrix}4&10\\10&30\end{pmatrix}$, déterminant $=20$).

$\text{Var}(\hat\beta)=0{,}35\times\begin{pmatrix}1{,}5&-0{,}5\\-0{,}5&0{,}2\end{pmatrix}=\begin{pmatrix}0{,}525&-0{,}175\\-0{,}175&0{,}07\end{pmatrix}$.

Exercice 11 — Calculer les écarts-types

Moyen

Pour l'exercice 10, calculer $\text{SE}(\hat\beta_0)$ et $\text{SE}(\hat\beta_1)$.

Voir la correction

$\text{SE}(\hat\beta_0)=\sqrt{0{,}525}\approx0{,}725$. $\text{SE}(\hat\beta_1)=\sqrt{0{,}07}\approx0{,}265$.

Exercice 12 — Pourquoi diviser par n-p-1

Moyen

Pourquoi $\hat\sigma^2=\text{SSE}/(n-p-1)$ plutôt que simplement $\text{SSE}/n$ ?

Voir la correction

Estimer $p+1$ paramètres « consomme » $p+1$ degrés de liberté du jeu de données : diviser par $n-p-1$ (plutôt que $n$) corrige le biais qui résulterait sinon d'une sous-estimation systématique de $\sigma^2$ — un principe analogue à la correction de Bessel ($n-1$ au lieu de $n$) pour la variance empirique (chapitre « Statistiques »).

Exercice 13 — Nature du point critique

Moyen

Pourquoi peut-on affirmer que $\hat\beta$ correspond à un minimum global de $\text{SSE}$, et non simplement local ?

Voir la correction

La Hessienne de $\text{SSE}$ est $2X^TX$, une matrice semi-définie positive pour tout $X$ (chapitre « Conditions d'optimalité ») : $\text{SSE}$ est donc une fonction convexe de $\beta$, garantissant (chapitre « Optimum local et optimum global ») que tout minimum local est automatiquement global.

Exercice 14 — Signification de BLUE

Moyen

Le théorème de Gauss-Markov affirme que $\hat\beta$ est BLUE. Expliquer chaque lettre de cet acronyme.

Voir la correction

Best (le meilleur, au sens de la variance minimale) Linear (parmi les estimateurs linéaires en $y$) Unbiased (sans biais, $\mathbb E[\hat\beta]=\beta$) Estimator (estimateur) — cours §4.

Exercice 15 — Application : calculer sigma² estimé

Facile

Pour $\text{SSE}=12$, $n=20$, $p=3$, calculer $\hat\sigma^2$.

Voir la correction

$\hat\sigma^2=\dfrac{12}{20-3-1}=\dfrac{12}{16}=0{,}75$.

Exercice 16 — Vrai ou faux

Facile

Vrai ou faux : « le théorème de Gauss-Markov suppose que les erreurs suivent une loi normale ».

Voir la correction

Faux (cours §4) : le théorème ne requiert que $\mathbb E[\varepsilon]=0$ et $\text{Var}(\varepsilon)=\sigma^2I_n$, sans hypothèse de normalité — celle-ci ne sera nécessaire qu'au chapitre suivant, pour construire des tests de significativité exacts (et non plus seulement asymptotiques).

Exercice 17 — Interprétation géométrique

Moyen

Pourquoi dit-on que $\hat y=X\hat\beta$ est une « projection orthogonale » de $y$ ?

Voir la correction

Parmi tous les vecteurs du sous-espace engendré par les colonnes de $X$ (toutes les combinaisons linéaires possibles des variables explicatives), $\hat y=X\hat\beta$ est celui qui minimise la distance euclidienne $\|y-X\beta\|$ à $y$ (cours §6) — exactement la définition géométrique d'une projection orthogonale (chapitre « Norme euclidienne et produit scalaire »).

Exercice 18 — Calculer un résidu individuel

Moyen

Pour $\hat\beta=(0{,}556,\,1{,}889,\,1{,}444)^T$ et une observation $x=(1,4,2)$, $y=11$, calculer le résidu correspondant.

Voir la correction

$\hat y=0{,}556+1{,}889\times4+1{,}444\times2=0{,}556+7{,}556+2{,}889\approx11$.

Résidu $=11-11=0$ (ajustement quasi-parfait pour cette observation).

Exercice 19 — Colinéarité et non-inversibilité

Difficile

Si deux colonnes de $X$ sont parfaitement colinéaires (proportionnelles), pourquoi $X^TX$ n'est-elle pas inversible, empêchant le calcul de $\hat\beta$ par la formule du cours §2 ?

Voir la correction

Si deux colonnes de $X$ sont proportionnelles, les colonnes de $X$ ne sont pas linéairement indépendantes (chapitre « Matrices et vecteurs ») : le rang de $X$ est alors strictement inférieur à $p+1$, ce qui entraîne que $X^TX$ (de même rang que $X$) est également de rang déficient — donc non inversible. Ce problème, appelé colinéarité parfaite, sera approfondi au chapitre « Qualité d'ajustement et diagnostics ».

Exercice 20 — Synthèse

Difficile

Pour $X=\begin{pmatrix}1&1&1\\1&2&3\\1&3&2\\1&4&5\\1&5&4\end{pmatrix}$ et $y=(4{,}2,\,8{,}8,\,8{,}3,\,14{,}6,\,14{,}5)^T$, on admet $\hat\beta\approx(1{,}18,\,1{,}333,\,1{,}633)^T$. (a) Calculer les valeurs prédites. (b) Calculer les résidus. (c) Calculer $\text{SSE}$ et $\hat\sigma^2$ (avec $n=5,\,p=2$).

Voir la correction

(a) $\hat y\approx(4{,}147,\,8{,}747,\,8{,}447,\,14{,}680,\,14{,}380)$ (en utilisant les valeurs arrondies de $\hat\beta$).

(b) Résidus $\approx(0{,}053,\,0{,}053,\,-0{,}147,\,-0{,}080,\,0{,}120)$.

(c) $\text{SSE}\approx0{,}048$. $\hat\sigma^2=0{,}048/(5-2-1)=0{,}024$.

Progression Score : 0 / 10

Sujet 1 — Contrôle de connaissances

Méthodes linéaires multivariées · 3iL Ingénieurs · Durée indicative : 35 min

Exercice A (18 points) — Pour $X=\begin{pmatrix}1&2\\1&4\\1&6\\1&8\end{pmatrix}$ et $y=(3,\,7,\,8,\,13)^T$.

1. Calculer $X^TX$ et $X^Ty$. (5 pts)

2. Résoudre le système normal pour obtenir $\hat\beta$. (5 pts)

3. Calculer les résidus, $\text{SSE}$, puis $\hat\sigma^2$ (avec $n=4,\,p=1$). (6 pts)

4. Calculer $\text{Var}(\hat\beta)$ et les écarts-types $\text{SE}(\hat\beta_0),\,\text{SE}(\hat\beta_1)$. (2 pts)

Exercice B — Question de cours (4 points)

Expliquer pourquoi l'estimateur MCO est qualifié de « linéaire » dans l'énoncé du théorème de Gauss-Markov.

Voir le corrigé complet
  1. A.1. $X^TX=\begin{pmatrix}4&20\\20&120\end{pmatrix}$. $X^Ty=(31,\,186)^T$.
  2. A.2. $\hat\beta\approx(0,\,1{,}55)^T$.
  3. A.3. Résidus $\approx(-0{,}1,\,0{,}8,\,-1{,}3,\,0{,}6)$. $\text{SSE}\approx2{,}7$. $\hat\sigma^2=2{,}7/2=1{,}35$.
  4. A.4. $\text{Var}(\hat\beta)\approx\begin{pmatrix}2{,}025&-0{,}338\\-0{,}338&0{,}068\end{pmatrix}$. $\text{SE}(\hat\beta_0)\approx1{,}423$, $\text{SE}(\hat\beta_1)\approx0{,}260$.
  5. B. L'estimateur $\hat\beta=(X^TX)^{-1}X^Ty$ s'écrit comme une combinaison linéaire des observations $y_i$ (la matrice $(X^TX)^{-1}X^T$ étant fixée une fois $X$ connu) : $\hat\beta=Ay$ où $A=(X^TX)^{-1}X^T$ ne dépend pas de $y$. C'est cette propriété de linéarité par rapport aux données observées qui est comparée, dans le théorème de Gauss-Markov, à celle de tout autre estimateur linéaire possible de $\beta$.

Sujet 2 — Application ingénieur : estimation de prix immobiliers

Méthodes linéaires multivariées · 3iL Ingénieurs · Durée indicative : 30 min

Un promoteur estime le prix de vente ($y$, en milliers d'euros) d'appartements en fonction de leur surface ($x_1$, en m²) et de leur nombre de chambres ($x_2$), sur 6 biens vendus récemment. On donne $X=\begin{pmatrix}1&50&2\\1&70&3\\1&90&3\\1&60&2\\1&100&4\\1&80&3\end{pmatrix}$, $y=(150,\,210,\,260,\,180,\,300,\,240)^T$.

1. On admet $\hat\beta\approx(4{,}32,\,2{,}57,\,9{,}32)^T$. Interpréter chacun de ces trois coefficients en termes concrets pour le promoteur. (6 pts)

2. Calculer la valeur prédite pour un appartement de $75$ m² et $3$ chambres. (5 pts)

3. Sachant que $\text{SSE}\approx34{,}09$, calculer $\hat\sigma^2$ (avec $n=6,\,p=2$). (5 pts)

4. Le promoteur envisage de collecter des données sur davantage de biens pour affiner son modèle. D'après le cadre de Gauss-Markov, cela améliorerait-il nécessairement la précision de $\hat\beta$ ? Justifier. (4 pts)

Voir le corrigé complet
  1. 1. $\hat\beta_0\approx4{,}32$ : prix de base théorique (surface et chambres nulles, extrapolation sans réelle signification physique). $\hat\beta_1\approx2{,}57$ : chaque m² supplémentaire ajoute environ $2\,570$€ au prix, toutes choses égales par ailleurs. $\hat\beta_2\approx9{,}32$ : chaque chambre supplémentaire ajoute environ $9\,320$€, à surface égale.
  2. 2. $\hat y=4{,}32+2{,}57\times75+9{,}32\times3\approx4{,}32+192{,}75+27{,}96\approx225{,}03$ milliers d'euros.
  3. 3. $\hat\sigma^2=34{,}09/(6-2-1)=34{,}09/3\approx11{,}36$.
  4. 4. Oui, généralement : $\text{Var}(\hat\beta)=\sigma^2(X^TX)^{-1}$ diminue typiquement lorsque $n$ augmente (les termes de $X^TX$ croissent avec le nombre d'observations, réduisant ceux de son inverse) — davantage de données réduit donc, en général, la variance de l'estimateur, le rendant plus précis (plus proche, en moyenne, de la vraie valeur $\beta$), conformément au cadre de Gauss-Markov (cours §4).
← Retour aux enseignements Une question sur ce chapitre ? →