La frontière logistique est toujours un hyperplan : géométrie, distance et confiance de prédiction, et les limites de la séparabilité linéaire.
La frontière de décision est l'ensemble des points $x$ où le modèle est parfaitement indécis, c'est-à-dire $\hat p(x)=s$ (le seuil de décision, chapitre précédent). Pour $s=0{,}5$ et le lien logit, cela équivaut exactement à $\eta=x^T\beta=0$.
En dimension 2 (deux variables explicatives $x_1,x_2$), cette frontière est une droite ; en dimension $n$ quelconque, un hyperplan — une conséquence directe de la linéarité du prédicteur $\eta=X\beta$ (chapitre « Fonctions de lien »).
Pour $\beta=(\beta_0,\beta_1,\beta_2)$ et un seuil $s=0{,}5$, la frontière $\beta_0+\beta_1x_1+\beta_2x_2=0$ s'écrit, en isolant $x_2$ :
$$x_2 = -\frac{\beta_0+\beta_1x_1}{\beta_2}$$
une droite dans le plan $(x_1,x_2)$.
Pour $\beta=(-4,\,1,\,2)^T$, la frontière est $x_2=\dfrac{4-x_1}2$.
Pour $x_1=0,\,2,\,4,\,6$ : $x_2=2,\,1,\,0,\,-1$ — une droite de pente $-1/2$, décroissante dans le plan.
Pour $\beta=(-4,\,1,\,2)^T$ (§2), classons le point $(1,1)$ : $\eta=-4+1+2=-1\lt0\Rightarrow\hat y=0$.
Le point $(1,3)$ : $\eta=-4+1+6=3\ge0\Rightarrow\hat y=1$ — géométriquement, $(1,1)$ se situe « sous » la frontière (côté classe $0$), $(1,3)$ « au-dessus » (côté classe $1$).
Pour une frontière $\beta_1x_1+\beta_2x_2+\beta_0=0$, la distance euclidienne d'un point $(x_1,x_2)$ à cette droite (chapitre « Norme euclidienne et produit scalaire ») est :
$$d = \frac{|\beta_1x_1+\beta_2x_2+\beta_0|}{\sqrt{\beta_1^2+\beta_2^2}}$$
Plus un point est éloigné de la frontière, plus $|\eta|$ est grand, donc plus $\hat p$ est proche de $0$ ou de $1$ — la distance à la frontière est ainsi directement liée à la confiance de la prédiction (chapitre précédent, exercice 17).
Pour $\beta=(-4,1,2)$, les points $(5,0)$ et $(1,1)$ sont tous deux à une distance $\approx0{,}447$ de la frontière (mais de part et d'autre) — une confiance de prédiction similaire en valeur absolue, bien que dans des classes opposées.
La régression logistique produit toujours une frontière linéaire (une droite, un plan, un hyperplan). Si les deux classes ne sont pas linéairement séparables — par exemple, une classe entourant complètement l'autre — aucun choix de $\beta$ ne peut produire une frontière parfaitement adaptée : le modèle commettra nécessairement des erreurs de classification, quelle que soit la qualité de l'estimation.
Des extensions (ajout de termes polynomiaux $x_1^2,\,x_1x_2$..., ou des modèles non linéaires comme les arbres de décision ou les réseaux de neurones) permettent de dépasser cette limitation, mais sortent du cadre de ce cours centré sur les méthodes linéaires.
En dimension 2, la frontière de décision de la régression logistique est une droite (dorée) : les points d'une classe (vert) se trouvent d'un côté, ceux de l'autre classe (bleu) de l'autre côté — un cas idéal de séparabilité linéaire parfaite.
Pour $\beta=(-6,\,2,\,1)^T$, écrire l'équation de la frontière de décision.
$-6+2x_1+x_2=0$, soit $x_2=6-2x_1$ (cours §2).
Pour l'exercice 1, calculer $x_2$ pour $x_1=0,\,2,\,3$.
$x_1=0$ : $x_2=6$. $x_1=2$ : $x_2=2$. $x_1=3$ : $x_2=0$.
Pour $\beta=(-6,\,2,\,1)^T$, classer le point $(1,5)$.
$\eta=-6+2\times1+5=1\ge0\Rightarrow\hat y=1$.
Pour le même $\beta$, classer le point $(4,1)$.
$\eta=-6+2\times4+1=3\ge0\Rightarrow\hat y=1$.
Pour $\beta=(-6,\,2,\,1)^T$, calculer la distance du point $(0,0)$ à la frontière.
$d=\dfrac{|2\times0+1\times0-6|}{\sqrt{2^2+1^2}}=\dfrac6{\sqrt5}\approx2{,}683$.
Pour le même $\beta$, calculer la distance du point $(5,5)$ et comparer à celle de $(0,0)$ (exercice 5).
$d(5,5)=\dfrac{|10+5-6|}{\sqrt5}=\dfrac9{\sqrt5}\approx4{,}025$.
$(5,5)$ est plus éloigné de la frontière que $(0,0)$ ($4{,}025\gt2{,}683$) : la prédiction pour $(5,5)$ est donc plus « confiante » (probabilité plus proche de $0$ ou $1$).
Que vaut $\hat p$ pour un point exactement sur la frontière de décision (seuil $0{,}5$) ?
$\hat p=0{,}5$ exactement (cours §1) : par définition, la frontière est l'ensemble des points où le modèle est parfaitement indécis entre les deux classes.
Pour $\beta=(-6,\,2,\,1)^T$, calculer la pente de la droite frontière $x_2=-\beta_1x_1/\beta_2-\beta_0/\beta_2$.
Pente $=-\beta_1/\beta_2=-2/1=-2$.
Un modèle sépare des pièces bonnes et défectueuses selon deux mesures $x_1,x_2$, avec une frontière $x_2=10-x_1$. Une pièce mesurée en $(3,8)$ est-elle du côté « classe 1 » ($x_1+x_2\ge10$) ou « classe 0 » ?
$3+8=11\ge10$ : la pièce est du côté « classe 1 ».
Si les points d'une classe entourent complètement ceux de l'autre classe (disposition circulaire), une frontière linéaire (droite) peut-elle parfaitement les séparer ?
Non (cours §5) : aucune droite ne peut séparer parfaitement une configuration circulaire de ce type — le modèle logistique linéaire commettra nécessairement des erreurs, quelle que soit la qualité de l'estimation de $\beta$.
Pour $\eta=-2{,}5$ en un point donné, ce point est-il du côté classe 0 ou classe 1 ?
Classe 0 ($\eta\lt0$, donc $\hat p\lt0{,}5$).
Un modèle de score de crédit sépare les bons et mauvais payeurs par une frontière linéaire dans l'espace (revenu, endettement). Un client avec un score très éloigné de la frontière (du côté « bon payeur ») mérite-t-il un examen humain approfondi supplémentaire ?
Probablement pas prioritairement : un point très éloigné de la frontière correspond à une prédiction à forte confiance (cours §4) — les ressources d'examen humain seraient mieux allouées aux clients proches de la frontière, où l'incertitude du modèle est la plus grande.
Vrai ou faux : « la frontière de décision de la régression logistique est toujours une courbe non linéaire ».
Faux (cours §1) : la frontière est toujours linéaire (une droite en dimension 2, un hyperplan en dimension supérieure), une conséquence directe de la linéarité du prédicteur $\eta=X\beta$.
Si $\beta_2$ change de signe (toutes choses égales par ailleurs), comment cela affecte-t-il la classification des points par rapport à la frontière ?
Les points auparavant classés $1$ (côté $\eta\ge0$) deviendraient classés $0$, et inversement : changer le signe de $\beta_2$ inverse effectivement l'orientation de la région de décision par rapport à la frontière géométrique (qui, elle, reste la même droite si les autres coefficients sont ajustés en conséquence).
Si un modèle linéaire n'arrive pas à bien séparer les données, quelle piste simple (déjà évoquée au cours §5) pourrait être explorée sans changer de famille de modèle ?
Ajouter des termes polynomiaux ou d'interaction (par exemple $x_1^2$, $x_1x_2$) comme nouvelles variables explicatives (cours §5) : la frontière reste linéaire dans cet espace de variables augmenté, mais elle devient non linéaire dans l'espace original $(x_1,x_2)$ — une technique simple pour étendre la flexibilité du modèle sans changer fondamentalement de méthode.
Pour $\beta=(-3,\,1,\,1)^T$, calculer $\eta$ au point $(2,0)$.
$\eta=-3+2+0=-1$ (classe $0$, car $\eta\lt0$).
Un ingénieur observe qu'un point de test se situe très près de la frontière de décision d'un modèle de diagnostic de panne. Quelle action pratique cela suggère-t-il ?
Un point proche de la frontière signale une prédiction incertaine (cours §4) : il serait prudent de recueillir des mesures supplémentaires ou de programmer une inspection manuelle avant de se fier uniquement à la décision automatique du modèle, contrairement à un point très éloigné où la confiance est plus élevée.
Pour un modèle à $5$ variables explicatives, la frontière de décision est-elle une droite ?
Non : c'est un hyperplan de dimension $4$ dans un espace à $5$ dimensions (cours §1) — la notion de « droite » ne s'applique qu'au cas particulier de $2$ variables explicatives.
Expliquer pourquoi la distance à la frontière et la probabilité prédite $\hat p$ ne sont pas reliées par une simple relation linéaire, malgré leur lien qualitatif commun.
La distance est proportionnelle à $|\eta|$ (à une constante de normalisation près, cours §4), mais $\hat p=1/(1+e^{-\eta})$ est une fonction non linéaire (sigmoïde) de $\eta$ : une même variation de distance produit un effet très différent sur $\hat p$ selon que l'on se trouve près de la frontière (où la sigmoïde est la plus pentue) ou loin d'elle (où elle sature, chapitre « Fonctions de lien », exercice 17 et 19).
Pour $\beta=(-8,\,1,\,3)^T$ : (a) écrire l'équation de la frontière et calculer $x_2$ pour $x_1=2$. (b) classer les points $(2,1)$ et $(2,3)$. (c) calculer la distance du point $(2,1)$ à la frontière.
(a) $-8+x_1+3x_2=0\Rightarrow x_2=(8-x_1)/3$. Pour $x_1=2$ : $x_2=2$.
(b) $(2,1)$ : $\eta=-8+2+3=-3\lt0\Rightarrow$ classe $0$. $(2,3)$ : $\eta=-8+2+9=3\ge0\Rightarrow$ classe $1$.
(c) $d=\dfrac{|1\times2+3\times1-8|}{\sqrt{1^2+3^2}}=\dfrac3{\sqrt{10}}\approx0{,}949$.
Exercice A — Pour $\beta=(-10,\,2,\,2)^T$.
1. Écrire l'équation de la frontière de décision et calculer $x_2$ pour $x_1=1$.
2. Classer les points $(2,2)$ et $(6,1)$.
3. Calculer la distance du point $(2,2)$ à la frontière.
Exercice B — Question de cours
Un ingénieur observe deux classes de données organisées en cercles concentriques (une classe au centre, l'autre en périphérie). Expliquer pourquoi la régression logistique standard échouera nécessairement à bien les séparer, et proposer une piste d'amélioration simple.
Une chaîne de production trie des composants électroniques selon deux mesures ($x_1$ : résistance, $x_2$ : capacité), avec un modèle de frontière $\beta=(-5,\,0{,}5,\,1{,}5)^T$.
1. Classer les composants $(3,2)$ et $(8,1)$.
2. Calculer la distance du composant $(3,2)$ à la frontière, et commenter le niveau de confiance de cette classification par rapport à celle du composant $(8,1)$ (dont la distance est d'environ $0{,}316$ également, à vérifier).
3. Un opérateur observe qu'un composant testé se situe à une distance quasi nulle de la frontière. Quelle recommandation pratique lui feriez-vous ?