Méthodes linéaires multivariées · Chapitre 1

Qualité d'ajustement et diagnostics

Au-delà du R² : R² ajusté, intervalles de prédiction, analyse des résidus et VIF pour détecter la colinéarité — les outils pour valider et affiner un modèle de régression.

🎓 Niveau L3 Maths / 1ᵉ année ingénieur ⏱ Cours ~45 min ✎ 20 exercices ✓ QCM 10 questions 📄 2 sujets d'annales corrigés

1Au-delà du R²

Le chapitre précédent a introduit $R^2=\text{SSR}/\text{SST}$ comme mesure de la qualité d'ajustement. Ce chapitre en présente les limites, ainsi que les outils de diagnostic permettant de vérifier la validité du modèle et d'en améliorer la construction.

2Le piège du R² ajusté

R² augmente mécaniquement avec p

Ajouter n'importe quelle variable explicative à un modèle, même totalement dénuée de sens, ne peut jamais faire diminuer $R^2$ (au pire, son coefficient estimé sera nul). $R^2$ seul encourage donc à surcharger le modèle de variables inutiles.

R² ajusté

$$R^2_{\text{ajusté}} = 1-(1-R^2)\frac{n-1}{n-p-1}$$

Cette version pénalise l'ajout de variables : contrairement à $R^2$, $R^2_{\text{ajusté}}$ peut diminuer si la variable ajoutée n'améliore pas suffisamment l'ajustement pour compenser la perte d'un degré de liberté.

Exemple résolu

Pour $R^2=0{,}75$, $n=20$, $p=5$ : $R^2_{\text{ajusté}}=1-(1-0{,}75)\times\dfrac{19}{14}\approx1-0{,}339\approx0{,}661$ — sensiblement inférieur au $R^2$ brut, reflétant le coût de la complexité du modèle.

3Prédiction et intervalles

Pour une nouvelle observation $x_0=(1,x_{01},\dots,x_{0p})$, on distingue deux questions différentes :

Intervalle de confiance vs intervalle de prédiction

L'intervalle de confiance porte sur la valeur moyenne $\mathbb E[y|x_0]=x_0^T\beta$ ; l'intervalle de prédiction porte sur une observation individuelle future $y_0$, nécessairement plus large (il intègre en plus la variabilité résiduelle $\varepsilon_0$).

Formules

$$\text{IC : } x_0^T\hat\beta \pm t_{n-p-1,0{,}975}\,\hat\sigma\sqrt{x_0^T(X^TX)^{-1}x_0}$$

$$\text{IP : } x_0^T\hat\beta \pm t_{n-p-1,0{,}975}\,\hat\sigma\sqrt{1+x_0^T(X^TX)^{-1}x_0}$$

Exemple résolu

Pour l'exemple des chapitres précédents, en $x_0=(1,3,3)$ : $\hat y_0=10{,}8$.

IC à 95% (moyenne) $\approx[10{,}60,\,11{,}00]$, bien plus étroit que l'IP à 95% (observation individuelle) $\approx[10{,}30,\,11{,}30]$ — l'écart entre les deux illustre directement le « $+1$ » sous la racine de la formule de l'IP.

4Analyse des résidus

Les hypothèses du modèle (chapitre « Écriture matricielle ») doivent être vérifiées empiriquement, typiquement via des graphiques de résidus (résidus en fonction des valeurs prédites) :

Diagnostic visuelInterprétation
Nuage aléatoire, sans structureHypothèses respectées
Forme en entonnoir (dispersion croissante)Violation de l'homoscédasticité
Tendance courbe (non linéaire)Relation mal spécifiée (terme manquant, transformation nécessaire)

5Colinéarité et VIF

Facteur d'inflation de la variance (VIF)

Pour détecter une colinéarité partielle (pas nécessairement parfaite, chapitre précédent) entre variables explicatives, on régresse chaque variable $x_j$ sur toutes les autres, et on calcule :

$$\text{VIF}_j = \frac1{1-R_j^2}$$

où $R_j^2$ est le coefficient de détermination de cette régression auxiliaire. Un $\text{VIF}_j$ élevé (souvent $\gt10$) signale une forte colinéarité impliquant $x_j$.

Exemple résolu

Pour deux variables $x_1$ et $x_2$ presque parfaitement proportionnelles ($x_2\approx2x_1$), la régression de $x_2$ sur $x_1$ donne $R_2^2\approx0{,}998$, soit $\text{VIF}_2=1/(1-0{,}998)=1/0{,}002=500$ — une valeur extrême, révélant une colinéarité quasiment parfaite entre les deux variables, qui rendrait $(X^TX)^{-1}$ numériquement instable (chapitre « Estimation des paramètres »).

6Sélection de variables

Face à un grand nombre de variables candidates, plusieurs stratégies permettent de sélectionner un sous-ensemble pertinent : la sélection pas à pas (ajout ou retrait successif de variables selon leur significativité ou leur effet sur $R^2_{\text{ajusté}}$), ou des critères d'information (AIC, BIC) pénalisant la complexité du modèle de façon plus ou moins stricte. Ce chapitre clôt le panorama de la régression linéaire multiple ; le chapitre suivant généralise le cadre aux modèles linéaires généralisés (GLM), pour des variables à expliquer non continues.

Exercice 1 — Calculer le R² ajusté

Moyen

Pour $R^2=0{,}85$, $n=30$, $p=6$, calculer $R^2_{\text{ajusté}}$.

Voir la correction

$R^2_{\text{ajusté}}=1-(1-0{,}85)\times\dfrac{29}{23}\approx1-0{,}189\approx0{,}811$.

Exercice 2 — Comparer R² et R² ajusté

Facile

Pour l'exercice 1, $R^2_{\text{ajusté}}$ est-il inférieur ou supérieur à $R^2$ ? Est-ce toujours le cas ?

Voir la correction

Inférieur ($0{,}811\lt0{,}85$) — c'est toujours le cas dès que $p\ge1$ (cours §2) : le R² ajusté pénalise systématiquement la complexité du modèle.

Exercice 3 — Effet d'une variable inutile

Moyen

Un statisticien ajoute une variable totalement aléatoire (sans lien réel avec $y$) à un modèle. Que devient $R^2$ ? Et $R^2_{\text{ajusté}}$ probablement ?

Voir la correction

$R^2$ augmente (même très légèrement, cours §2, encart) — il ne peut jamais diminuer. $R^2_{\text{ajusté}}$, en revanche, diminuera probablement, car le gain marginal de $R^2$ ne suffira pas à compenser la perte d'un degré de liberté supplémentaire.

Exercice 4 — Calculer un VIF

Moyen

Pour une variable $x_j$ dont la régression sur les autres variables donne $R_j^2=0{,}9$, calculer $\text{VIF}_j$.

Voir la correction

$\text{VIF}_j=1/(1-0{,}9)=1/0{,}1=10$.

Exercice 5 — Interpréter un VIF

Facile

Pour l'exercice 4 ($\text{VIF}_j=10$), cette variable pose-t-elle un problème de colinéarité ?

Voir la correction

$\text{VIF}_j=10$ est généralement considéré comme le seuil d'alerte (cours §5) : cette variable est fortement liée aux autres variables explicatives, un signe de colinéarité potentiellement problématique à examiner de plus près.

Exercice 6 — Comparer deux niveaux de colinéarité

Moyen

Comparer $\text{VIF}_j$ pour $R_j^2=0{,}6$ et $R_j^2=0{,}95$.

Voir la correction

$R_j^2=0{,}6$ : $\text{VIF}_j=1/0{,}4=2{,}5$ (acceptable).

$R_j^2=0{,}95$ : $\text{VIF}_j=1/0{,}05=20$ (très élevé, colinéarité sévère) — un écart considérable, illustrant la sensibilité extrême du VIF lorsque $R_j^2$ approche $1$.

Exercice 7 — Distinguer IC et IP

Facile

Un client demande : « quel est l'intervalle probable du prix de mon appartement ? » S'agit-il d'un intervalle de confiance ou de prédiction ?

Voir la correction

D'un intervalle de prédiction (cours §3) : le client s'intéresse à une observation individuelle spécifique (son appartement), pas à la moyenne théorique de tous les appartements ayant les mêmes caractéristiques.

Exercice 8 — Comparer les largeurs IC et IP

Facile

Pourquoi l'intervalle de prédiction est-il toujours plus large que l'intervalle de confiance, pour un même point $x_0$ ?

Voir la correction

La formule de l'IP contient un terme supplémentaire « $+1$ » sous la racine carrée (cours §3), reflétant la variabilité additionnelle du terme d'erreur $\varepsilon_0$ d'une observation individuelle — variabilité qui n'existe pas pour la valeur moyenne théorique $\mathbb E[y|x_0]$, une quantité fixe (non aléatoire).

Exercice 9 — Interpréter un graphique en entonnoir

Moyen

Un graphique des résidus en fonction des valeurs prédites montre une dispersion des résidus qui augmente avec la valeur prédite. Quelle hypothèse du modèle est probablement violée ?

Voir la correction

L'hypothèse d'homoscédasticité (variance constante des erreurs, chapitre « Écriture matricielle ») — cette forme en entonnoir est la signature visuelle classique de son inobservation (cours §4, tableau).

Exercice 10 — Interpréter une tendance courbe

Moyen

Un graphique des résidus montre une tendance en forme de U (résidus négatifs aux extrémités, positifs au centre). Que suggère ce motif ?

Voir la correction

Une relation mal spécifiée (cours §4, tableau) : la vraie relation entre $x$ et $y$ n'est probablement pas linéaire, suggérant qu'un terme quadratique (ou une autre transformation) devrait être ajouté au modèle pour mieux capturer la courbure observée.

Exercice 11 — Identifier les composants de la formule IP

Moyen

Dans la formule de l'intervalle de prédiction, à quoi correspond le terme $x_0^T(X^TX)^{-1}x_0$ ?

Voir la correction

Ce terme quantifie l'incertitude liée à l'estimation de $\beta$ elle-même (via $\text{Var}(\hat\beta)=\sigma^2(X^TX)^{-1}$, chapitre « Estimation des paramètres »), projetée dans la direction $x_0$ — plus $x_0$ est « éloigné » du centre du nuage de points d'apprentissage, plus ce terme (et donc l'incertitude de prédiction) est grand.

Exercice 12 — Vrai ou faux

Facile

Vrai ou faux : « ajouter une variable explicative à un modèle peut faire diminuer $R^2$ ».

Voir la correction

Faux (cours §2, encart) : $R^2$ ne peut jamais diminuer lorsqu'on ajoute une variable, aussi inutile soit-elle — seul $R^2_{\text{ajusté}}$ peut diminuer dans ce cas.

Exercice 13 — Choisir entre deux modèles avec R²

Moyen

Pourquoi comparer deux modèles de complexité différente uniquement sur leur $R^2$ brut serait-il trompeur ?

Voir la correction

Le modèle le plus complexe (plus grand $p$) aura presque toujours un $R^2$ au moins aussi élevé, indépendamment de la pertinence réelle des variables ajoutées (cours §2) — comparer les $R^2_{\text{ajustés}}$ (ou des critères comme AIC/BIC, cours §6) permet une comparaison plus équitable, tenant compte du nombre de paramètres utilisés.

Exercice 14 — Comparer deux modèles via R² ajusté

Difficile

Modèle A : $R^2=0{,}80$, $n=25$, $p=4$. Modèle B : $R^2=0{,}82$, $n=25$, $p=7$. Calculer $R^2_{\text{ajusté}}$ pour chacun, et déterminer lequel est préférable selon ce critère.

Voir la correction

Modèle A : $R^2_{\text{ajusté}}=1-(1-0{,}80)\times\dfrac{24}{20}=1-0{,}24=0{,}76$.

Modèle B : $R^2_{\text{ajusté}}=1-(1-0{,}82)\times\dfrac{24}{17}\approx1-0{,}254\approx0{,}746$.

Malgré un $R^2$ brut plus élevé, le modèle B a un $R^2_{\text{ajusté}}$ légèrement inférieur à celui du modèle A : les 3 variables supplémentaires du modèle B n'apportent pas suffisamment d'amélioration pour justifier leur complexité additionnelle — le modèle A est préférable selon ce critère.

Exercice 15 — Effet de la colinéarité sur l'interprétation

Moyen

En présence d'une forte colinéarité entre deux variables, pourquoi devient-il difficile d'interpréter individuellement chaque coefficient $\hat\beta_j$ ?

Voir la correction

Lorsque deux variables varient de façon très similaire, il devient statistiquement difficile de distinguer la contribution propre de chacune à l'explication de $y$ — les coefficients estimés deviennent instables (grande variance, cours §5) et peuvent même changer de signe pour de petites variations des données, rendant leur interprétation individuelle peu fiable.

Exercice 16 — Seuil usuel du VIF

Facile

Quel est le seuil de VIF généralement considéré comme préoccupant ?

Voir la correction

$\text{VIF}\gt10$ (cours §5) est une règle empirique courante, bien que certains praticiens utilisent des seuils plus stricts (par exemple $5$) selon le contexte et les enjeux de l'analyse.

Exercice 17 — Principe de la sélection pas à pas

Moyen

Décrire brièvement le principe d'une sélection de variables « ascendante » (forward selection).

Voir la correction

On part d'un modèle vide (intercept seul), puis on ajoute itérativement la variable qui améliore le plus le critère choisi (par exemple $R^2_{\text{ajusté}}$, ou la significativité du test de Fisher/Student) — le processus s'arrête lorsqu'aucune variable supplémentaire n'apporte d'amélioration suffisante (cours §6).

Exercice 18 — Rôle des critères AIC/BIC

Moyen

En quoi les critères AIC et BIC ressemblent-ils conceptuellement au R² ajusté ?

Voir la correction

Comme le $R^2_{\text{ajusté}}$ (cours §2), les critères AIC et BIC combinent une mesure de la qualité d'ajustement du modèle avec une pénalité croissante avec le nombre de paramètres — l'objectif commun étant d'éviter de sélectionner un modèle inutilement complexe qui ne généraliserait pas bien à de nouvelles données (chapitre « Optimum local et optimum global » du cours d'optimisation, notion de sur-ajustement).

Exercice 19 — Application : diagnostic complet

Moyen

Un modèle a un $R^2$ élevé mais un graphique de résidus en entonnoir et un $\text{VIF}$ maximal de $15$. Résumer les deux problèmes identifiés et leurs implications respectives.

Voir la correction

Le graphique en entonnoir signale une violation de l'homoscédasticité (chapitre « Écriture matricielle »), remettant en question la validité des tests statistiques usuels (Fisher, Student, chapitre précédent) qui supposent cette hypothèse. Le $\text{VIF}=15$ signale une colinéarité préoccupante, rendant les coefficients individuels instables et difficiles à interpréter (exercice 15) — malgré un bon ajustement global ($R^2$ élevé), ces deux diagnostics invitent à revoir la spécification du modèle avant toute conclusion définitive.

Exercice 20 — Synthèse

Difficile

Un modèle a $R^2=0{,}88$, $n=40$, $p=8$. (a) Calculer $R^2_{\text{ajusté}}$. (b) Une variable du modèle a $R_j^2=0{,}85$ (régression sur les autres variables) : calculer son VIF et conclure. (c) Cette variable devrait-elle être reconsidérée dans le modèle ?

Voir la correction

(a) $R^2_{\text{ajusté}}=1-(1-0{,}88)\times\dfrac{39}{31}\approx1-0{,}151\approx0{,}849$.

(b) $\text{VIF}_j=1/(1-0{,}85)=1/0{,}15\approx6{,}67$ — en dessous du seuil usuel de $10$, mais déjà notable.

(c) Bien que sous le seuil critique de $10$, un VIF de $6{,}67$ mérite une attention particulière : il serait prudent d'examiner la significativité individuelle de cette variable (test de Student, chapitre précédent) et sa corrélation avec les autres, avant de décider de la conserver, la simplifier, ou la retirer du modèle.

Progression Score : 0 / 10

Sujet 1 — Contrôle de connaissances

Méthodes linéaires multivariées · 3iL Ingénieurs · Durée indicative : 30 min

Exercice A (16 points) — Un modèle a $R^2=0{,}78$, $n=22$, $p=5$.

1. Calculer $R^2_{\text{ajusté}}$. (5 pts)

2. Une variable du modèle a $R_j^2=0{,}75$ (régression sur les autres variables). Calculer son VIF et conclure sur la présence de colinéarité. (6 pts)

3. Le graphique des résidus de ce modèle montre une dispersion croissante avec les valeurs prédites. Quelle hypothèse est probablement violée, et quelle conséquence cela a-t-il sur la fiabilité des tests de significativité (chapitre précédent) ? (5 pts)

Exercice B — Question de cours (4 points)

Expliquer pourquoi un intervalle de prédiction est toujours plus large qu'un intervalle de confiance pour un même point $x_0$.

Voir le corrigé complet
  1. A.1. $R^2_{\text{ajusté}}=1-(1-0{,}78)\times\dfrac{21}{16}\approx1-0{,}289\approx0{,}711$.
  2. A.2. $\text{VIF}_j=1/(1-0{,}75)=4$ — en dessous du seuil usuel de $10$, un niveau de colinéarité acceptable.
  3. A.3. L'hypothèse d'homoscédasticité est probablement violée (cours §4). Les tests de Fisher et de Student (chapitre précédent), qui reposent sur cette hypothèse pour établir la distribution exacte de leurs statistiques, deviennent alors potentiellement peu fiables : les $p$-valeurs calculées pourraient être trompeuses, sous-estimant ou surestimant la véritable incertitude des coefficients.
  4. B. L'intervalle de confiance porte sur la valeur moyenne théorique $\mathbb E[y|x_0]$, une quantité fixe (non aléatoire) dont seule l'estimation $\hat\beta$ introduit de l'incertitude. L'intervalle de prédiction porte sur une observation individuelle future $y_0=x_0^T\beta+\varepsilon_0$, qui comporte une source d'incertitude supplémentaire : le terme d'erreur aléatoire $\varepsilon_0$ propre à cette observation — d'où le terme additionnel « +1 » sous la racine de sa formule (cours §3).

Sujet 2 — Application ingénieur : sélection d'un modèle de prédiction salariale

Méthodes linéaires multivariées · 3iL Ingénieurs · Durée indicative : 30 min

Un cabinet RH compare deux modèles de prédiction salariale sur $n=30$ employés : le modèle A ($R^2=0{,}70$, $p=3$ variables) et le modèle B ($R^2=0{,}74$, $p=6$ variables, incluant 3 variables supplémentaires).

1. Calculer $R^2_{\text{ajusté}}$ pour chaque modèle. (8 pts)

2. Lequel des deux modèles recommanderiez-vous, et pourquoi ? (4 pts)

3. Dans le modèle B, la variable « années d'ancienneté » a un $R_j^2=0{,}92$ (régression sur les autres variables, notamment « âge » et « niveau hiérarchique »). Calculer son VIF et commenter. (5 pts)

4. Le cabinet RH s'inquiète : « si le VIF de l'ancienneté est si élevé, son coefficient est-il forcément erroné ? » Répondre en nuançant. (3 pts)

Voir le corrigé complet
  1. 1. Modèle A : $R^2_{\text{ajusté}}=1-(1-0{,}70)\times\dfrac{29}{26}\approx1-0{,}335\approx0{,}665$. Modèle B : $R^2_{\text{ajusté}}=1-(1-0{,}74)\times\dfrac{29}{23}\approx1-0{,}328\approx0{,}672$.
  2. 2. Les deux $R^2_{\text{ajustés}}$ sont très proches ($0{,}665$ contre $0{,}672$) : le gain apporté par les 3 variables supplémentaires du modèle B est marginal une fois la complexité pénalisée — le modèle A, plus simple et presque aussi performant, serait généralement préféré (principe de parcimonie).
  3. 3. $\text{VIF}=1/(1-0{,}92)=12{,}5$ — au-dessus du seuil usuel de $10$, signalant une colinéarité préoccupante (probablement avec l'âge, l'ancienneté et l'âge étant naturellement très corrélés).
  4. 4. Non, pas nécessairement erroné : un VIF élevé signifie que le coefficient est estimé avec une grande variance (peu de précision, chapitre « Estimation des paramètres »), pas qu'il soit systématiquement faux (l'estimateur reste sans biais, cadre de Gauss-Markov). Le risque principal est une instabilité de l'estimation (le coefficient pourrait varier fortement avec de nouvelles données) et une difficulté à interpréter isolément l'effet de l'ancienneté, dilué avec celui de l'âge.
← Retour aux enseignements Une question sur ce chapitre ? →