Les transformeurs, technologie au cœur des LLM — apprentissage profond, chapitre 5
Une visite visuelle d’un transformeur de type GPT : les tokens deviennent des vecteurs, sont mis à jour par l’attention et des couches à propagation directe, puis produisent une distribution de probabilités pour le prochain token. La génération répète prédiction et échantillonnage ; ce n’est pas une simple recherche de texte stocké.
Plan pour cette page
Regarder activement avec une préparation, des repères et un contrôle de compréhension.
Vous repartirez avec
Le flux général de la génération : tokenisation, embeddings, traitement contextuel, logits, softmax, échantillonnage et répétition.
Temps
28 min
Avant de commencer
Personnes prêtes à suivre une explication longue mêlant vecteurs, matrices et probabilités.
Faites ceci maintenant
Lisez les termes et les points d’attention avant de charger la vidéo.
Les transformeurs, technologie au cœur des LLM — apprentissage profond, chapitre 5Le flux général de la génération : tokenisation, embeddings, traitement contextuel, logits, softmax, échantillonnage et répétition.
00:00 · Ce que le « transformeur » ajoute à GPT
01:45 · De la prédiction à la génération
03:03 · Flux de données d’un transformeur
07:12 · Fondations de l’apprentissage profond
12:27 · Tokens et embeddings
Ce que cela enseigne
Le flux général de la génération : tokenisation, embeddings, traitement contextuel, logits, softmax, échantillonnage et répétition.
Personnes prêtes à suivre une explication longue mêlant vecteurs, matrices et probabilités.
À observer
Séparez les poids appris des données d’entrée traitées pendant une exécution.
Observez comment un prédicteur du prochain token devient un générateur par échantillonnage, ajout et répétition.
Distinguez les chiffres de GPT-3 et la simplification en mots entiers de l’architecture générale.
Termes utiles
Avant de lancer la vidéo
tokenembeddingattentionlogitsoftmax
La vidéo externe est chargée uniquement à votre demande
Le lecteur utilise l’adresse officielle en mode de confidentialité renforcée. Les conditions du fournisseur s’appliquent.
Un générateur de texte prédit à répétition une distribution de prochains tokens possibles et en sélectionne un.
Les embeddings et les blocs de transformeur construisent des représentations numériques sensibles au contexte ; ils ne constituent pas un stock de phrases interrogeable.
La température modifie la distribution d’échantillonnage, non la véracité d’une réponse.
Contrôle actif
Comment le modèle produit-il un passage plus long ?
Réserves
La leçon porte sur un décodeur de type GPT et reporte le mécanisme détaillé de l’attention au chapitre suivant.
Elle parle parfois des tokens comme s’il s’agissait de mots complets et utilise les dimensions et le nombre de paramètres de GPT-3 à des fins de clarté ; les tokeniseurs et les architectures actuelles varient.
La « signification » des vecteurs est un raccourci pédagogique pour désigner une structure numérique apprise, non la preuve d’une compréhension sémantique humaine.
Accessibilité
Des pistes de sous-titres anglais et français fournies manuellement ainsi qu’une transcription anglaise étaient disponibles lors de la revue. La géométrie, les matrices, le flux des tokens et les animations de probabilités portent une part importante du sens ; la leçon officielle est le meilleur complément non vidéo.
Transformers, the tech behind LLMs | Deep Learning Chapter 53Blue1Brown
La vidéo exacte ayant fait l’objet de la revue : une introduction visuelle aux tokens, aux embeddings, aux blocs de transformeur, aux probabilités du prochain token et à l’échantillonnage.
Transformers, the tech behind LLMs | Deep Learning Chapter 53Blue1Brown
Le complément officiel, associant texte et animation. Les nombres de paramètres détaillés prennent GPT-3 comme exemple observable, sans décrire tous les modèles actuels.