Méthodes linéaires multivariées · Chapitre 3

Classification supervisée

De la probabilité à la décision : la règle de seuillage, un choix qui dépend fondamentalement des coûts relatifs des erreurs selon le contexte applicatif.

🎓 Niveau L3 Maths / 1ᵉ année ingénieur ⏱ Cours ~45 min ✎ 20 exercices ✓ QCM 10 questions 📄 2 sujets d'annales corrigés

1De la régression à la classification

La régression logistique (chapitre précédent) prédit une probabilité $\hat p\in[0,1]$. La classification supervisée va une étape plus loin : elle transforme cette probabilité en une décision catégorielle — attribuer chaque observation à l'une des classes possibles ($0$ ou $1$, ou plus généralement, une parmi $K$ classes).

2Cadre général

Définition — apprentissage supervisé

En classification supervisée, on dispose d'un jeu de données d'entraînement $(x_i,y_i)_{i=1}^n$ où $y_i$ appartient à un ensemble fini de classes (contrairement à la régression, où $y_i$ est continue). L'objectif est d'apprendre une règle de décision $\hat f(x)$ prédisant la classe d'une nouvelle observation $x$.

« Supervisée » signifie que l'algorithme dispose, pendant l'entraînement, des vraies étiquettes $y_i$ — par opposition à l'apprentissage non supervisé (regroupement de données sans étiquette), hors du cadre de ce cours.

3Règle de décision par seuillage

Règle de décision standard

À partir d'une probabilité prédite $\hat p(x)$ (régression logistique, chapitre précédent), la règle de décision la plus simple applique un seuil $s$ (souvent $s=0{,}5$) :

$$\hat y = \begin{cases}1 & \text{si } \hat p(x)\ge s\\0 & \text{sinon}\end{cases}$$

Exemple résolu

Pour $\hat\beta=(-3,\,0{,}8)^T$ et des observations $x=2,4,5,7$ : $\hat p=(0{,}198,\,0{,}550,\,0{,}731,\,0{,}931)$.

Avec un seuil $s=0{,}5$ : $\hat y=(0,\,1,\,1,\,1)$ — seule la première observation est classée $0$.

4Le seuil n'est pas figé

Choisir le seuil selon le contexte

Le seuil $s=0{,}5$ n'a rien d'obligatoire : il doit être choisi selon les coûts relatifs des erreurs. En dépistage médical, on préfère souvent un seuil bas (accepter plus de faux positifs pour ne rater aucun cas réel) ; en détection de fraude à fort volume, on peut préférer un seuil élevé (limiter les fausses alertes coûteuses en traitement manuel).

Exemple résolu

Pour les mêmes probabilités $(0{,}198,\,0{,}550,\,0{,}731,\,0{,}931)$, un seuil $s=0{,}7$ donne $\hat y=(0,\,0,\,1,\,1)$ — la deuxième observation change de classe prédite par rapport au seuil $0{,}5$, illustrant la sensibilité des décisions au choix du seuil (chapitre « Évaluation des performances » pour quantifier cet arbitrage).

5Au-delà de deux classes

Pour $K\gt2$ classes, plusieurs stratégies étendent le cadre binaire :

StratégiePrincipe
Un-contre-tous (one-vs-rest)$K$ modèles binaires, chacun séparant une classe des $K-1$ autres ; on retient la classe au score le plus élevé
Régression logistique multinomialeGénéralisation directe du modèle logistique à $K$ classes simultanément, via une fonction softmax

6Illustration graphique

De la probabilité à la décision
seuil s classe 0 classe 1 0 1

Chaque observation reçoit une probabilité $\hat p(x)$ (position horizontale) ; le seuil $s$ partage l'axe en deux régions de décision — déplacer le seuil change directement les classes prédites, sans modifier le modèle sous-jacent.

Exercice 1 — Appliquer la règle de décision

Moyen

Pour $\hat\beta=(-2,\,0{,}5)^T$ et $x=3$, calculer $\hat p$ puis la classe prédite (seuil $s=0{,}5$).

Voir la correction

$\eta=-2+0{,}5\times3=-0{,}5$. $\hat p=\dfrac1{1+e^{0{,}5}}\approx0{,}378$.

$\hat p\lt0{,}5\Rightarrow\hat y=0$.

Exercice 2 — Classer plusieurs observations

Moyen

Pour l'exercice 1 ($\hat\beta=(-2,\,0{,}5)^T$), classer $x=5$ et $x=8$ (seuil $s=0{,}5$).

Voir la correction

$x=5$ : $\eta=0{,}5$, $\hat p\approx0{,}622\ge0{,}5\Rightarrow\hat y=1$.

$x=8$ : $\eta=2$, $\hat p\approx0{,}881\ge0{,}5\Rightarrow\hat y=1$.

Exercice 3 — Application : dépistage médical

Moyen

Pourquoi un médecin pourrait-il préférer un seuil de décision plus bas que $0{,}5$ pour un test de dépistage d'une maladie grave ?

Voir la correction

Un seuil plus bas augmente la sensibilité du test (moins de cas réels manqués, quitte à accepter davantage de fausses alertes) — dans un contexte où manquer un cas réel (faux négatif) a des conséquences bien plus graves qu'une fausse alerte (faux positif, qui déclenchera simplement des examens complémentaires), cette asymétrie des coûts justifie de déplacer le seuil (cours §4).

Exercice 4 — Application : détection de fraude

Moyen

Pourquoi une banque traitant des millions de transactions pourrait-elle préférer un seuil élevé pour signaler une transaction comme frauduleuse ?

Voir la correction

Un seuil élevé réduit le nombre de fausses alertes (transactions légitimes signalées à tort), chacune nécessitant une vérification manuelle coûteuse en temps et en ressources — à très grand volume, même un faible taux de fausses alertes représenterait un nombre absolu considérable de vérifications inutiles.

Exercice 5 — Calculer une prédiction complète

Moyen

Pour $\hat\beta=(1,\,-0{,}6)^T$ et $x=3$, calculer $\hat p$ puis $\hat y$ (seuil $0{,}5$).

Voir la correction

$\eta=1-0{,}6\times3=-0{,}8$. $\hat p=\dfrac1{1+e^{0{,}8}}\approx0{,}310$.

$\hat y=0$ (car $\hat p\lt0{,}5$).

Exercice 6 — Distinguer supervisé et non supervisé

Facile

Un algorithme reçoit un jeu de photos d'animaux sans étiquette indiquant l'espèce, et doit les regrouper par similarité. S'agit-il de classification supervisée ?

Voir la correction

Non (cours §2) : sans étiquettes connues pendant l'entraînement, il s'agit d'apprentissage non supervisé (regroupement, ou clustering) — hors du cadre de ce cours, qui suppose les vraies classes $y_i$ disponibles à l'entraînement.

Exercice 7 — Principe du un-contre-tous

Moyen

Pour classer des images en 4 catégories (chat, chien, oiseau, poisson) par la stratégie un-contre-tous, combien de modèles binaires faut-il entraîner ?

Voir la correction

4 modèles (cours §5) : un modèle « chat contre le reste », un « chien contre le reste », etc. — la classe finale retenue est celle dont le modèle binaire correspondant produit le score (probabilité) le plus élevé.

Exercice 8 — Classer un ensemble d'observations

Moyen

Pour $\hat p=(0{,}15,\,0{,}48,\,0{,}52,\,0{,}9)$, donner les classes prédites avec un seuil $s=0{,}5$.

Voir la correction

$\hat y=(0,\,0,\,1,\,1)$ — seule la troisième valeur ($0{,}52$), tout juste au-dessus du seuil, est classée $1$ malgré sa proximité avec la frontière de décision.

Exercice 9 — Effet d'un changement de seuil

Moyen

Pour $\hat p=0{,}42$, la classe prédite change-t-elle entre un seuil $s=0{,}3$ et un seuil $s=0{,}5$ ?

Voir la correction

Oui : avec $s=0{,}3$, $\hat p=0{,}42\ge0{,}3\Rightarrow\hat y=1$ ; avec $s=0{,}5$, $\hat p=0{,}42\lt0{,}5\Rightarrow\hat y=0$ — un exemple concret montrant qu'une même probabilité prédite peut conduire à des décisions opposées selon le seuil choisi.

Exercice 10 — Choisir un scénario adapté au seuil bas

Moyen

Parmi « détecter un spam » et « détecter une tumeur maligne », lequel justifierait plutôt un seuil de décision bas (favorisant la détection au prix de plus de fausses alertes) ?

Voir la correction

La détection de tumeur maligne (cours §4) : manquer un cas réel (faux négatif) a des conséquences potentiellement vitales, bien plus graves qu'un examen complémentaire inutile déclenché par une fausse alerte — contrairement au spam, où classer par erreur un email légitime comme spam (faux positif) est plus gênant qu'un seuil bas ne le justifierait.

Exercice 11 — Principe de la fonction softmax

Difficile

Pour la régression logistique multinomiale, la fonction softmax généralise la fonction logistique. Sans détailler la formule, quelle propriété fondamentale les sorties de la fonction softmax doivent-elles vérifier pour $K$ classes ?

Voir la correction

Les $K$ probabilités produites doivent être positives et sommer exactement à $1$ (cours §5) — exactement l'analogue multiclasse de la contrainte $p+(1-p)=1$ déjà présente implicitement dans le cas binaire.

Exercice 12 — Vrai ou faux

Facile

Vrai ou faux : « le seuil de décision de 0,5 est une règle mathématique obligatoire en classification binaire ».

Voir la correction

Faux (cours §4) : $0{,}5$ n'est qu'un choix par défaut raisonnable en l'absence d'information sur les coûts relatifs des erreurs — le seuil optimal dépend du contexte applicatif et peut légitimement s'écarter de $0{,}5$.

Exercice 13 — Cas limite au seuil exact

Facile

Si $\hat p=0{,}5$ exactement et $s=0{,}5$, quelle classe est prédite selon la convention $\hat p\ge s\Rightarrow\hat y=1$ ?

Voir la correction

$\hat y=1$ (cours §3, convention avec inégalité large) — un cas limite rare en pratique (probabilité continue), mais qui doit être défini sans ambiguïté dans l'implémentation.

Exercice 14 — Application : recommandation de contenu

Moyen

Une plateforme de streaming prédit la probabilité qu'un utilisateur aime un film, pour décider de le recommander ou non. Quel type d'erreur (faux positif ou faux négatif) est probablement le moins coûteux ici, par rapport à un contexte médical ?

Voir la correction

Un faux positif (recommander un film qui ne plaira pas) est ici relativement peu coûteux — l'utilisateur l'ignorera simplement — contrairement à un contexte médical où les erreurs peuvent avoir des conséquences graves. Cela justifie potentiellement un seuil de recommandation plus permissif (plus bas) que dans un contexte à enjeux élevés.

Exercice 15 — Comparer deux seuils sur un même jeu de probabilités

Moyen

Pour $\hat p=(0{,}35,\,0{,}55,\,0{,}65,\,0{,}85)$, comparer les classes prédites pour $s=0{,}5$ et $s=0{,}7$.

Voir la correction

$s=0{,}5$ : $\hat y=(0,\,1,\,1,\,1)$.

$s=0{,}7$ : $\hat y=(0,\,0,\,0,\,1)$ — un seuil plus strict réduit fortement le nombre d'observations classées en $1$, illustrant l'impact direct du choix du seuil sur le nombre de prédictions positives.

Exercice 16 — Identifier la nature du problème

Facile

Prédire le prix d'une maison est-il un problème de classification ou de régression ? Et prédire si une maison se vendra en moins de 30 jours ?

Voir la correction

Prix (valeur continue) : régression (chapitre 1). Vente en moins de 30 jours (oui/non) : classification (ce chapitre) — la nature de la variable à expliquer détermine directement le cadre méthodologique approprié.

Exercice 17 — Interpréter la proximité du seuil

Moyen

Pourquoi une observation avec $\hat p=0{,}51$ mérite-t-elle probablement plus de prudence dans l'interprétation qu'une observation avec $\hat p=0{,}98$, bien que les deux soient classées $1$ (seuil $0{,}5$) ?

Voir la correction

$\hat p=0{,}51$ est très proche de la frontière de décision : une légère variation des données ou du modèle pourrait facilement faire basculer la prédiction vers la classe $0$ — alors que $\hat p=0{,}98$ traduit une confiance nettement plus forte du modèle dans sa prédiction, plus robuste aux petites perturbations.

Exercice 18 — Application : maintenance prédictive

Moyen

Un modèle prédit la probabilité de panne d'une machine dans les 7 prochains jours. Un seuil bas de déclenchement d'une maintenance préventive serait-il justifié si le coût d'une panne imprévue est très élevé par rapport au coût d'une maintenance inutile ?

Voir la correction

Oui : un seuil bas favorise la détection de pannes potentielles (moins de faux négatifs, donc moins de pannes imprévues manquées), au prix de davantage de maintenances déclenchées inutilement (faux positifs) — un compromis justifié précisément lorsque le coût d'un faux négatif dépasse largement celui d'un faux positif (cours §4).

Exercice 19 — Régression logistique multinomiale vs un-contre-tous

Difficile

Quel est l'avantage conceptuel de la régression logistique multinomiale par rapport à la stratégie un-contre-tous pour un problème à $K$ classes ?

Voir la correction

La régression multinomiale estime simultanément tous les paramètres dans un cadre probabiliste cohérent, garantissant que les $K$ probabilités prédites somment exactement à $1$ (cours, exercice 11) — la stratégie un-contre-tous, elle, entraîne $K$ modèles indépendants dont les scores ne sont pas nécessairement calibrés de façon cohérente entre eux, pouvant produire des ambiguïtés en cas de scores proches entre plusieurs classes.

Exercice 20 — Synthèse

Difficile

Pour $\hat\beta=(-1{,}5,\,0{,}4,\,0{,}2)^T$ et une observation $x=(1,4,3)^T$ : (a) calculer $\hat p$. (b) donner la classe prédite avec $s=0{,}5$. (c) donner la classe prédite avec $s=0{,}7$. (d) commenter la différence entre (b) et (c).

Voir la correction

(a) $\eta=-1{,}5+0{,}4\times4+0{,}2\times3=-1{,}5+1{,}6+0{,}6=0{,}7$. $\hat p=\dfrac1{1+e^{-0{,}7}}\approx0{,}668$.

(b) $0{,}668\ge0{,}5\Rightarrow\hat y=1$.

(c) $0{,}668\lt0{,}7\Rightarrow\hat y=0$.

(d) La classe prédite change selon le seuil choisi ($1$ pour $s=0{,}5$, $0$ pour $s=0{,}7$) : cette observation se situe dans une zone d'incertitude relative, où la décision finale dépend sensiblement du compromis coûts/bénéfices retenu pour fixer le seuil (cours §4).

Progression Score : 0 / 10

Sujet 1 — Contrôle de connaissances

Méthodes linéaires multivariées · 3iL Ingénieurs · Durée indicative : 25 min

Exercice A (14 points) — Pour $\hat\beta=(-2{,}5,\,0{,}6)^T$, observations $x=3$ et $x=5$.

1. Calculer $\hat p$ pour chacune des deux observations. (6 pts)

2. Donner la classe prédite pour chacune (seuil $s=0{,}5$). (4 pts)

3. Le seuil est abaissé à $s=0{,}3$. Les classes prédites changent-elles ? (4 pts)

Exercice B — Question de cours (6 points)

Un directeur des risques d'une banque doit choisir le seuil de décision d'un modèle de détection de fraude. Expliquer la démarche à suivre pour ce choix, sans se contenter d'appliquer $s=0{,}5$ par défaut.

Voir le corrigé complet
  1. A.1. $x=3$ : $\eta=-0{,}7$, $\hat p\approx0{,}332$. $x=5$ : $\eta=0{,}5$, $\hat p\approx0{,}622$.
  2. A.2. $x=3$ : $\hat y=0$. $x=5$ : $\hat y=1$.
  3. A.3. Pour $x=3$ ($\hat p\approx0{,}332\ge0{,}3$) : la classe devient $\hat y=1$, un changement par rapport au seuil $0{,}5$. Pour $x=5$ (déjà classé $1$), aucun changement.
  4. B. Le directeur des risques devrait quantifier les coûts respectifs des deux types d'erreur : le coût d'un faux négatif (une fraude non détectée, potentiellement très élevé) contre le coût d'un faux positif (une transaction légitime bloquée à tort, générant de l'insatisfaction client et du travail de vérification). Un seuil optimal minimise le coût total attendu compte tenu de ces deux coûts et des taux d'erreur du modèle à différents seuils (chapitre « Évaluation des performances », qui formalisera ces compromis via des indicateurs comme la précision et le rappel).

Sujet 2 — Application ingénieur : tri automatique de pièces défectueuses

Méthodes linéaires multivariées · 3iL Ingénieurs · Durée indicative : 25 min

Une chaîne de production utilise un modèle de classification pour détecter des pièces défectueuses, avec $\hat\beta=(-1,\,0{,}3,\,0{,}5)^T$ (intercept, deux mesures de qualité $x_1,x_2$).

1. Pour une pièce avec $x_1=2,\,x_2=3$, calculer $\hat p$ (probabilité de défaut). (6 pts)

2. Donner la décision de classification pour $s=0{,}5$ puis $s=0{,}6$. (5 pts)

3. Écarter une pièce à tort (faux positif) coûte peu (un contrôle manuel supplémentaire), mais laisser passer une pièce réellement défectueuse (faux négatif) coûte très cher (rappel produit, image de marque). Quel type de seuil ce contexte suggère-t-il ? (5 pts)

4. Pourquoi ne peut-on pas simplement choisir un seuil de $0$ pour ne jamais manquer une pièce défectueuse ? (4 pts)

Voir le corrigé complet
  1. 1. $\eta=-1+0{,}3\times2+0{,}5\times3=-1+0{,}6+1{,}5=1{,}1$. $\hat p=\dfrac1{1+e^{-1{,}1}}\approx0{,}750$.
  2. 2. $s=0{,}5$ : $\hat y=1$ (défectueuse). $s=0{,}6$ : $\hat y=1$ également (car $0{,}750\ge0{,}6$).
  3. 3. Un seuil bas est suggéré (cours §4) : puisque le coût d'un faux négatif dépasse largement celui d'un faux positif, il est préférable d'accepter davantage de fausses alertes (pièces bonnes écartées à tort) pour minimiser le risque de laisser passer une pièce réellement défectueuse.
  4. 4. Un seuil de $0$ classerait toutes les pièces comme défectueuses (puisque $\hat p\ge0$ est toujours vrai), rendant la chaîne de production totalement inopérante — un seuil doit rester suffisamment élevé pour conserver un pouvoir discriminant utile, même s'il est abaissé par rapport à $0{,}5$ pour privilégier la détection.
← Retour aux enseignements Une question sur ce chapitre ? →