Description
Dans cette vidéo, on décortique :
— Pourquoi chaque mot doit "regarder" tous les autres (et pourquoi RNN et CNN ne suffisaient pas)
— Q, K, V comme trois projections du même vecteur (Query, Key, Value)
— Le produit Q × K transposé → softmax → scores de pertinence
— La somme pondérée des V → représentation contextuelle enrichie
— Pourquoi multi-head : 12 versions parallèles pour capturer différents aspects sémantiques
Q, K, V, c'est trois façons de regarder le même mot. Question, étiquette, contenu.
📚 Sources et ressources
— Vaswani et al. 2017 — *Attention Is All You Need* (arXiv:1706.03762)
— Jay Alammar — *The Illustrated Transformer* : jalammar.github.io/illustrated-transformer
— BertViz : visualiser les têtes d'attention : github.com/jessevig/bertviz
— Stanford CS224N — Lecture sur l'attention
👉 Projets IA — pour comprendre l'IA sans bullshit, un concept par vidéo.
🔔 Abonne-toi !
#IntelligenceArtificielle #MachineLearning #DeepLearning #Attention #Transformer #QKV #MultiHead #IAExpliquée #ProjetsIA
Hosted on Ausha. See ausha.co/privacy-policy for more information.





