Non-supervisé : clusters, dimensions, anomalies
Sans labels, on cherche des formes
Pas de y à prédire : on cherche des structures dans X. Les trois familles utiles en entreprise :
1. Clustering (k-means) : segmenter
k-means place k centres, affecte chaque point au centre le plus proche, recalcule les centres, répète. Usage roi : la segmentation client (« mes utilisateurs se répartissent en 4 profils d'usage »). Piège : il faut choisir k (méthode du coude, ou k dicté par le métier), et les résultats dépendent de l'échelle des features → normaliser d'abord.
2. Réduction de dimension (PCA) : compresser
La PCA projette tes 200 features sur les axes qui conservent le maximum de variance. Usages : visualiser en 2D des données haute dimension, compresser avant un autre modèle, dé-bruiter.
3. Détection d'anomalies : l'inattendu
Isolation Forest, One-Class SVM ou simple distance au centroïde : signaler ce qui s'écarte de la masse. Fraude, capteurs défaillants, comportements suspects — souvent le premier projet ML rentable d'une boîte, car il ne demande aucun label.
Pourquoi normaliser avant k-means ?