Régressions linéaire et logistique
La régression linéaire : y = somme pondérée
y = w₁x₁ + w₂x₂ + … + b. Le modèle apprend les poids w (par descente de gradient ou formule fermée). Deux raisons de la maîtriser :
- c'est la baseline : tout modèle complexe doit la battre nettement pour justifier son coût ;
- elle est interprétable :
w_anciennete = -50se lit « chaque année d'ancienneté baisse la prédiction de 50 » — un luxe que XGBoost et les réseaux n'offrent pas gratuitement.
La régression logistique : la proba d'une classe
Pour classifier, on passe la somme pondérée dans une sigmoïde qui l'écrase entre 0 et 1 : P(churn) = σ(w·x + b). On tranche ensuite avec un seuil (0.5 par défaut — mais c'est un choix produit : détecter une fraude tolère plus de faux positifs que bloquer une carte).
Malgré son nom, c'est LE classifieur de référence : rapide, calibré, robuste — l'algorithme de prod le plus déployé au monde.
La régularisation : brider pour généraliser
Pour éviter l'overfit, on pénalise les poids trop grands en ajoutant à la loss un terme λ·Σw² (L2/ridge) ou λ·Σ|w| (L1/lasso — pousse des poids exactement à zéro : sélection de features gratuite). Le λ se règle par validation — premier hyperparamètre de ta carrière.
Pourquoi commencer tout projet par une régression (linéaire ou logistique) ?