Le paradigme du ML supervisé
⏱ 50 minLe ML supervisé apprend une fonction f : X → y à partir d'exemples étiquetés.
Le pipeline universel :
1. Séparer les données : train / validation / test (ex. 70/15/15)
2. Entraîner sur train, régler les hyperparamètres sur validation, évaluer UNE FOIS sur test
3. Ne jamais laisser le test "fuiter" dans l'entraînement (data leakage)
Le compromis biais-variance — le concept le plus important du ML :
- Sous-apprentissage (biais élevé) : modèle trop simple, mauvais partout
- Surapprentissage (variance élevée) : modèle qui mémorise le train mais généralise mal
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
Remèdes au surapprentissage : plus de données, régularisation (L1/L2), modèles plus simples, validation croisée.
✍️ Exercices de la leçon
2 exercicesFais-les dans l'ordre, dans un vrai fichier .py — pas dans ta tête. Ne déplie la correction qu'après avoir écrit quelque chose, même faux.
Exercice A — Voir le surapprentissage de ses yeux
Application directe · Tu appliques ce que tu viens de lire.
Sur le dataset du cancer du sein (from sklearn.datasets import load_breast_cancer) :
- 1.découpe en train / test (80/20)
- 2.entraîne un arbre de décision pour chaque profondeur de 1 à 20
- 3.enregistre à chaque fois le score sur le train et le score sur le test
- 4.trace les deux courbes sur le même graphique
- 5.identifie la profondeur où les courbes se séparent
Écris ensuite en deux phrases ce que la zone de séparation signifie.
Exercice B — Quatre modèles, quatre diagnostics
Page blanche · Aucun squelette : à toi de choisir la méthode.
Page blanche. Diagnostic pur, aucun code imposé.
Quatre modèles ont été entraînés sur le même problème. Voici leurs scores :
| Modèle | Train | Validation | Test |
|---|---|---|---|
| A | 0.62 | 0.61 | 0.60 |
| B | 1.00 | 0.74 | 0.72 |
| C | 0.89 | 0.87 | 0.86 |
| D | 0.91 | 0.90 | 0.71 |
Pour chacun :
1. pose le diagnostic
2. explique ce qui le montre
3. propose deux remèdes concrets
Le modèle D est le plus intéressant des quatre. Prends le temps de comprendre ce qui a pu se passer avant de répondre.