learn.chetana.fr

CNN, RNN → attention

13 min de lectureEssentiel

Une architecture = une hypothèse sur la structure

Le MLP dense traite chaque entrée indépendamment. Les architectures spécialisées encodent une connaissance a priori de la donnée :

CNN : « les patterns locaux se répètent » (images)

La convolution fait glisser un petit filtre (3×3) sur l'image : le même détecteur de contour sert partout (partage de poids), et l'empilement agrandit le champ de vision (contours → textures → objets). C'est l'architecture reine de la vision — et de tout signal à structure locale (audio, séries).

RNN : « l'ordre compte » (séquences)

Le RNN lit la séquence pas à pas en maintenant un état caché — une mémoire. Problème fatal : séquentiel par construction (inparallélisable, donc lent à entraîner) et mémoire qui s'évapore sur les longues distances (gradients qui s'évanouissent, partiellement corrigé par LSTM/GRU).

Attention : « laissez chaque mot regarder tous les autres »

L'attention supprime la récurrence : chaque position calcule une moyenne pondérée de toutes les autres, avec des poids appris selon la pertinence (« dans “la clé qu'il a posée sur la table”, posée doit regarder clé »). Tout se calcule en parallèle — des produits matriciels, le régal des GPUs.

Le papier Attention Is All You Need (2017) a montré qu'on pouvait jeter la récurrence : le transformer (module 7) n'est que de l'attention empilée. Résultat : entraînement massivement parallèle → passage à l'échelle → LLMs.

Le tableau mental

ArchitectureHypothèseForceLimite
CNNlocalité + répétitionvision, efficacecontexte global limité
RNN/LSTMséquence ordonnéestreaming légerséquentiel, mémoire courte
Attentiontout dépend de toutparallèle, longue portéecoût O(n²) en longueur

Le O(n²) explique la course aux « contextes longs » des LLMs : doubler le contexte quadruple le calcul d'attention — d'où FlashAttention et autres optimisations dont tu entendras parler en MLOps.

🧩 Quiz1/3

Le partage de poids d'une CNN signifie…

🃏 Flashcards1/4