CNN, RNN → attention
Une architecture = une hypothèse sur la structure
Le MLP dense traite chaque entrée indépendamment. Les architectures spécialisées encodent une connaissance a priori de la donnée :
CNN : « les patterns locaux se répètent » (images)
La convolution fait glisser un petit filtre (3×3) sur l'image : le même détecteur de contour sert partout (partage de poids), et l'empilement agrandit le champ de vision (contours → textures → objets). C'est l'architecture reine de la vision — et de tout signal à structure locale (audio, séries).
RNN : « l'ordre compte » (séquences)
Le RNN lit la séquence pas à pas en maintenant un état caché — une mémoire. Problème fatal : séquentiel par construction (inparallélisable, donc lent à entraîner) et mémoire qui s'évapore sur les longues distances (gradients qui s'évanouissent, partiellement corrigé par LSTM/GRU).
Attention : « laissez chaque mot regarder tous les autres »
L'attention supprime la récurrence : chaque position calcule une moyenne pondérée de toutes les autres, avec des poids appris selon la pertinence (« dans “la clé qu'il a posée sur la table”, posée doit regarder clé »). Tout se calcule en parallèle — des produits matriciels, le régal des GPUs.
Le papier Attention Is All You Need (2017) a montré qu'on pouvait jeter la récurrence : le transformer (module 7) n'est que de l'attention empilée. Résultat : entraînement massivement parallèle → passage à l'échelle → LLMs.
Le tableau mental
| Architecture | Hypothèse | Force | Limite |
|---|---|---|---|
| CNN | localité + répétition | vision, efficace | contexte global limité |
| RNN/LSTM | séquence ordonnée | streaming léger | séquentiel, mémoire courte |
| Attention | tout dépend de tout | parallèle, longue portée | coût O(n²) en longueur |
Le O(n²) explique la course aux « contextes longs » des LLMs : doubler le contexte quadruple le calcul d'attention — d'où FlashAttention et autres optimisations dont tu entendras parler en MLOps.
Le partage de poids d'une CNN signifie…