De la probabilité à la décision : la règle de seuillage, un choix qui dépend fondamentalement des coûts relatifs des erreurs selon le contexte applicatif.
La régression logistique (chapitre précédent) prédit une probabilité $\hat p\in[0,1]$. La classification supervisée va une étape plus loin : elle transforme cette probabilité en une décision catégorielle — attribuer chaque observation à l'une des classes possibles ($0$ ou $1$, ou plus généralement, une parmi $K$ classes).
En classification supervisée, on dispose d'un jeu de données d'entraînement $(x_i,y_i)_{i=1}^n$ où $y_i$ appartient à un ensemble fini de classes (contrairement à la régression, où $y_i$ est continue). L'objectif est d'apprendre une règle de décision $\hat f(x)$ prédisant la classe d'une nouvelle observation $x$.
« Supervisée » signifie que l'algorithme dispose, pendant l'entraînement, des vraies étiquettes $y_i$ — par opposition à l'apprentissage non supervisé (regroupement de données sans étiquette), hors du cadre de ce cours.
À partir d'une probabilité prédite $\hat p(x)$ (régression logistique, chapitre précédent), la règle de décision la plus simple applique un seuil $s$ (souvent $s=0{,}5$) :
$$\hat y = \begin{cases}1 & \text{si } \hat p(x)\ge s\\0 & \text{sinon}\end{cases}$$
Pour $\hat\beta=(-3,\,0{,}8)^T$ et des observations $x=2,4,5,7$ : $\hat p=(0{,}198,\,0{,}550,\,0{,}731,\,0{,}931)$.
Avec un seuil $s=0{,}5$ : $\hat y=(0,\,1,\,1,\,1)$ — seule la première observation est classée $0$.
Le seuil $s=0{,}5$ n'a rien d'obligatoire : il doit être choisi selon les coûts relatifs des erreurs. En dépistage médical, on préfère souvent un seuil bas (accepter plus de faux positifs pour ne rater aucun cas réel) ; en détection de fraude à fort volume, on peut préférer un seuil élevé (limiter les fausses alertes coûteuses en traitement manuel).
Pour les mêmes probabilités $(0{,}198,\,0{,}550,\,0{,}731,\,0{,}931)$, un seuil $s=0{,}7$ donne $\hat y=(0,\,0,\,1,\,1)$ — la deuxième observation change de classe prédite par rapport au seuil $0{,}5$, illustrant la sensibilité des décisions au choix du seuil (chapitre « Évaluation des performances » pour quantifier cet arbitrage).
Pour $K\gt2$ classes, plusieurs stratégies étendent le cadre binaire :
| Stratégie | Principe |
|---|---|
| Un-contre-tous (one-vs-rest) | $K$ modèles binaires, chacun séparant une classe des $K-1$ autres ; on retient la classe au score le plus élevé |
| Régression logistique multinomiale | Généralisation directe du modèle logistique à $K$ classes simultanément, via une fonction softmax |
Chaque observation reçoit une probabilité $\hat p(x)$ (position horizontale) ; le seuil $s$ partage l'axe en deux régions de décision — déplacer le seuil change directement les classes prédites, sans modifier le modèle sous-jacent.
Pour $\hat\beta=(-2,\,0{,}5)^T$ et $x=3$, calculer $\hat p$ puis la classe prédite (seuil $s=0{,}5$).
$\eta=-2+0{,}5\times3=-0{,}5$. $\hat p=\dfrac1{1+e^{0{,}5}}\approx0{,}378$.
$\hat p\lt0{,}5\Rightarrow\hat y=0$.
Pour l'exercice 1 ($\hat\beta=(-2,\,0{,}5)^T$), classer $x=5$ et $x=8$ (seuil $s=0{,}5$).
$x=5$ : $\eta=0{,}5$, $\hat p\approx0{,}622\ge0{,}5\Rightarrow\hat y=1$.
$x=8$ : $\eta=2$, $\hat p\approx0{,}881\ge0{,}5\Rightarrow\hat y=1$.
Pourquoi un médecin pourrait-il préférer un seuil de décision plus bas que $0{,}5$ pour un test de dépistage d'une maladie grave ?
Un seuil plus bas augmente la sensibilité du test (moins de cas réels manqués, quitte à accepter davantage de fausses alertes) — dans un contexte où manquer un cas réel (faux négatif) a des conséquences bien plus graves qu'une fausse alerte (faux positif, qui déclenchera simplement des examens complémentaires), cette asymétrie des coûts justifie de déplacer le seuil (cours §4).
Pourquoi une banque traitant des millions de transactions pourrait-elle préférer un seuil élevé pour signaler une transaction comme frauduleuse ?
Un seuil élevé réduit le nombre de fausses alertes (transactions légitimes signalées à tort), chacune nécessitant une vérification manuelle coûteuse en temps et en ressources — à très grand volume, même un faible taux de fausses alertes représenterait un nombre absolu considérable de vérifications inutiles.
Pour $\hat\beta=(1,\,-0{,}6)^T$ et $x=3$, calculer $\hat p$ puis $\hat y$ (seuil $0{,}5$).
$\eta=1-0{,}6\times3=-0{,}8$. $\hat p=\dfrac1{1+e^{0{,}8}}\approx0{,}310$.
$\hat y=0$ (car $\hat p\lt0{,}5$).
Un algorithme reçoit un jeu de photos d'animaux sans étiquette indiquant l'espèce, et doit les regrouper par similarité. S'agit-il de classification supervisée ?
Non (cours §2) : sans étiquettes connues pendant l'entraînement, il s'agit d'apprentissage non supervisé (regroupement, ou clustering) — hors du cadre de ce cours, qui suppose les vraies classes $y_i$ disponibles à l'entraînement.
Pour classer des images en 4 catégories (chat, chien, oiseau, poisson) par la stratégie un-contre-tous, combien de modèles binaires faut-il entraîner ?
4 modèles (cours §5) : un modèle « chat contre le reste », un « chien contre le reste », etc. — la classe finale retenue est celle dont le modèle binaire correspondant produit le score (probabilité) le plus élevé.
Pour $\hat p=(0{,}15,\,0{,}48,\,0{,}52,\,0{,}9)$, donner les classes prédites avec un seuil $s=0{,}5$.
$\hat y=(0,\,0,\,1,\,1)$ — seule la troisième valeur ($0{,}52$), tout juste au-dessus du seuil, est classée $1$ malgré sa proximité avec la frontière de décision.
Pour $\hat p=0{,}42$, la classe prédite change-t-elle entre un seuil $s=0{,}3$ et un seuil $s=0{,}5$ ?
Oui : avec $s=0{,}3$, $\hat p=0{,}42\ge0{,}3\Rightarrow\hat y=1$ ; avec $s=0{,}5$, $\hat p=0{,}42\lt0{,}5\Rightarrow\hat y=0$ — un exemple concret montrant qu'une même probabilité prédite peut conduire à des décisions opposées selon le seuil choisi.
Parmi « détecter un spam » et « détecter une tumeur maligne », lequel justifierait plutôt un seuil de décision bas (favorisant la détection au prix de plus de fausses alertes) ?
La détection de tumeur maligne (cours §4) : manquer un cas réel (faux négatif) a des conséquences potentiellement vitales, bien plus graves qu'un examen complémentaire inutile déclenché par une fausse alerte — contrairement au spam, où classer par erreur un email légitime comme spam (faux positif) est plus gênant qu'un seuil bas ne le justifierait.
Pour la régression logistique multinomiale, la fonction softmax généralise la fonction logistique. Sans détailler la formule, quelle propriété fondamentale les sorties de la fonction softmax doivent-elles vérifier pour $K$ classes ?
Les $K$ probabilités produites doivent être positives et sommer exactement à $1$ (cours §5) — exactement l'analogue multiclasse de la contrainte $p+(1-p)=1$ déjà présente implicitement dans le cas binaire.
Vrai ou faux : « le seuil de décision de 0,5 est une règle mathématique obligatoire en classification binaire ».
Faux (cours §4) : $0{,}5$ n'est qu'un choix par défaut raisonnable en l'absence d'information sur les coûts relatifs des erreurs — le seuil optimal dépend du contexte applicatif et peut légitimement s'écarter de $0{,}5$.
Si $\hat p=0{,}5$ exactement et $s=0{,}5$, quelle classe est prédite selon la convention $\hat p\ge s\Rightarrow\hat y=1$ ?
$\hat y=1$ (cours §3, convention avec inégalité large) — un cas limite rare en pratique (probabilité continue), mais qui doit être défini sans ambiguïté dans l'implémentation.
Une plateforme de streaming prédit la probabilité qu'un utilisateur aime un film, pour décider de le recommander ou non. Quel type d'erreur (faux positif ou faux négatif) est probablement le moins coûteux ici, par rapport à un contexte médical ?
Un faux positif (recommander un film qui ne plaira pas) est ici relativement peu coûteux — l'utilisateur l'ignorera simplement — contrairement à un contexte médical où les erreurs peuvent avoir des conséquences graves. Cela justifie potentiellement un seuil de recommandation plus permissif (plus bas) que dans un contexte à enjeux élevés.
Pour $\hat p=(0{,}35,\,0{,}55,\,0{,}65,\,0{,}85)$, comparer les classes prédites pour $s=0{,}5$ et $s=0{,}7$.
$s=0{,}5$ : $\hat y=(0,\,1,\,1,\,1)$.
$s=0{,}7$ : $\hat y=(0,\,0,\,0,\,1)$ — un seuil plus strict réduit fortement le nombre d'observations classées en $1$, illustrant l'impact direct du choix du seuil sur le nombre de prédictions positives.
Prédire le prix d'une maison est-il un problème de classification ou de régression ? Et prédire si une maison se vendra en moins de 30 jours ?
Prix (valeur continue) : régression (chapitre 1). Vente en moins de 30 jours (oui/non) : classification (ce chapitre) — la nature de la variable à expliquer détermine directement le cadre méthodologique approprié.
Pourquoi une observation avec $\hat p=0{,}51$ mérite-t-elle probablement plus de prudence dans l'interprétation qu'une observation avec $\hat p=0{,}98$, bien que les deux soient classées $1$ (seuil $0{,}5$) ?
$\hat p=0{,}51$ est très proche de la frontière de décision : une légère variation des données ou du modèle pourrait facilement faire basculer la prédiction vers la classe $0$ — alors que $\hat p=0{,}98$ traduit une confiance nettement plus forte du modèle dans sa prédiction, plus robuste aux petites perturbations.
Un modèle prédit la probabilité de panne d'une machine dans les 7 prochains jours. Un seuil bas de déclenchement d'une maintenance préventive serait-il justifié si le coût d'une panne imprévue est très élevé par rapport au coût d'une maintenance inutile ?
Oui : un seuil bas favorise la détection de pannes potentielles (moins de faux négatifs, donc moins de pannes imprévues manquées), au prix de davantage de maintenances déclenchées inutilement (faux positifs) — un compromis justifié précisément lorsque le coût d'un faux négatif dépasse largement celui d'un faux positif (cours §4).
Quel est l'avantage conceptuel de la régression logistique multinomiale par rapport à la stratégie un-contre-tous pour un problème à $K$ classes ?
La régression multinomiale estime simultanément tous les paramètres dans un cadre probabiliste cohérent, garantissant que les $K$ probabilités prédites somment exactement à $1$ (cours, exercice 11) — la stratégie un-contre-tous, elle, entraîne $K$ modèles indépendants dont les scores ne sont pas nécessairement calibrés de façon cohérente entre eux, pouvant produire des ambiguïtés en cas de scores proches entre plusieurs classes.
Pour $\hat\beta=(-1{,}5,\,0{,}4,\,0{,}2)^T$ et une observation $x=(1,4,3)^T$ : (a) calculer $\hat p$. (b) donner la classe prédite avec $s=0{,}5$. (c) donner la classe prédite avec $s=0{,}7$. (d) commenter la différence entre (b) et (c).
(a) $\eta=-1{,}5+0{,}4\times4+0{,}2\times3=-1{,}5+1{,}6+0{,}6=0{,}7$. $\hat p=\dfrac1{1+e^{-0{,}7}}\approx0{,}668$.
(b) $0{,}668\ge0{,}5\Rightarrow\hat y=1$.
(c) $0{,}668\lt0{,}7\Rightarrow\hat y=0$.
(d) La classe prédite change selon le seuil choisi ($1$ pour $s=0{,}5$, $0$ pour $s=0{,}7$) : cette observation se situe dans une zone d'incertitude relative, où la décision finale dépend sensiblement du compromis coûts/bénéfices retenu pour fixer le seuil (cours §4).
Exercice A — Pour $\hat\beta=(-2{,}5,\,0{,}6)^T$, observations $x=3$ et $x=5$.
1. Calculer $\hat p$ pour chacune des deux observations.
2. Donner la classe prédite pour chacune (seuil $s=0{,}5$).
3. Le seuil est abaissé à $s=0{,}3$. Les classes prédites changent-elles ?
Exercice B — Question de cours
Un directeur des risques d'une banque doit choisir le seuil de décision d'un modèle de détection de fraude. Expliquer la démarche à suivre pour ce choix, sans se contenter d'appliquer $s=0{,}5$ par défaut.
Une chaîne de production utilise un modèle de classification pour détecter des pièces défectueuses, avec $\hat\beta=(-1,\,0{,}3,\,0{,}5)^T$ (intercept, deux mesures de qualité $x_1,x_2$).
1. Pour une pièce avec $x_1=2,\,x_2=3$, calculer $\hat p$ (probabilité de défaut).
2. Donner la décision de classification pour $s=0{,}5$ puis $s=0{,}6$.
3. Écarter une pièce à tort (faux positif) coûte peu (un contrôle manuel supplémentaire), mais laisser passer une pièce réellement défectueuse (faux négatif) coûte très cher (rappel produit, image de marque). Quel type de seuil ce contexte suggère-t-il ?
4. Pourquoi ne peut-on pas simplement choisir un seuil de $0$ pour ne jamais manquer une pièce défectueuse ?