Vermessenes RegalKI & maschinelles Lernen

Transformer explainers, ranked by where the analogy ends

Median Füllmaterial
36%
Nützlicher Teil beginnt
1:36
Typische Laufzeit
29 min

zuletzt neu berechnet 16. Sep. 2026

Every video on this shelf has to solve the same problem: attention is a mechanism made of matrix multiplication, and matrix multiplication is not something you can watch. So each of them picks a metaphor — a lookup table, a search engine, a room where words vote on each other — and the entire quality of the video is decided by what happens after the metaphor.

The ones that rank highly here spend the metaphor quickly and then show the actual operation: what the three projections are, what shape the things being multiplied have, why the scaling term is there, what the mask does. The ones lower down keep the metaphor going for forty minutes, restated in progressively more elaborate ways, and never show a number.

Both types are titled “transformers explained”. The density measurement is what separates them, because a metaphor restated is by definition not new information, and it is the single most common way this topic becomes an hour of video.

Entries carry a difficulty level, and on this topic it matters more than anywhere else on the site: a video that is perfect for someone who already knows what a dot product does is a wasted hour for someone who does not, and the reverse is worse.

  1. 01

    Let's reproduce GPT-2 (124M)

    Lohnt sich AndrejKarpathy 4:01:26 advanced

    Dichte
    84
    Füllmaterial
    27%
    Nützlich ab
    3:34

    A code-complete, first-principles GPT-2 reproduction — one of the most valuable hands-on deep learning tutorials available.

    Bei 3:34 starten →

  2. 02

    Attention in transformers, step-by-step | Deep Learning Chapter 6

    Lohnt sich 3Blue1Brown 26:10 intermediate

    Dichte
    83
    Füllmaterial
    21%
    Nützlich ab
    1:40

    Ein meisterhaft klarer, dichter Durchgang durch den Attention-Mechanismus, der bei aufmerksamem Zuschauen mit echtem technischem Verständnis belohnt.

    Bei 1:40 starten →

  3. 03

    Transformers, the tech behind LLMs | Deep Learning Chapter 5

    Lohnt sich 3Blue1Brown 27:14 intermediate

    Dichte
    80
    Füllmaterial
    26%
    Nützlich ab
    1:26

    Eine meisterhafte Einführung in die inneren Abläufe von Transformern – dicht, fundiert und genau das, was der Titel verspricht.

    Bei 1:26 starten →

  4. 04

    Let's build GPT: from scratch, in code, spelled out.

    Überfliegen AndrejKarpathy 1:56:20 advanced

    Dichte
    82
    Füllmaterial
    35%
    Nützlich ab
    14:11

    A masterclass build-along: real working GPT code, the actual mechanics behind ChatGPT, with almost no filler.

    Bei 14:11 starten →

  5. 05

    Transformer Neural Networks, ChatGPT's foundation, Clearly Explained!!!

    Lohnt sich StatQuest with Josh Starmer 36:15 intermediate

    Dichte
    79
    Füllmaterial
    23%
    Nützlich ab
    1:20

    Eine rigorose, mit durchgerechneten Zahlen versehene Erklärung der internen Abläufe von Transformern, die tatsächlich vermittelt, wie ChatGPT-artige Modelle funktionieren, nicht nur, was…

    Bei 1:20 starten →

  6. 06

    Large Language Models explained briefly

    Lohnt sich 3Blue1Brown 7:58 intermediate

    Dichte
    75
    Füllmaterial
    26%
    Nützlich ab
    0:33

    Eine meisterhaft komprimierte, präzise Einführung darin, wie LLMs wirklich funktionieren – dicht, ehrlich, ohne Verkaufsrhetorik.

    Bei 0:33 starten →

  7. 07

    Transformers Step-by-Step Explained (Attention Is All You Need)

    Überfliegen ByteByteGo 10:04 intermediate

    Dichte
    70
    Füllmaterial
    39%
    Nützlich ab
    2:40

    Eine knappe, wirklich lehrreiche Erklärung der Transformer-Attention mit einem echten durchgerechneten Beispiel, leicht unterbrochen von einer ausgewiesenen Sponsoren-Einblendung.

    Bei 2:40 starten →

  8. 08

    Transformer Neural Networks - EXPLAINED! (Attention is all you need)

    Lohnt sich CodeEmporium 13:05 intermediate

    Dichte
    68
    Füllmaterial
    31%
    Nützlich ab
    1:54

    Ein dichter, gut strukturierter konzeptioneller Durchgang durch die Transformer-Architektur, der seinem Titel 'EXPLAINED' ohne Füllmaterial gerecht wird.

    Bei 1:54 starten →

  9. 09

    Illustrated Guide to Transformers Neural Network: A step by step explanation

    Lohnt sich The AI Hacker 15:01 intermediate

    Dichte
    72
    Füllmaterial
    31%
    Nützlich ab
    1:03

    Eine knappe, präzise konzeptuelle Tour durch die inneren Abläufe des Transformers – solide Vermittlung, wenn auch eher vertrautes Terrain illustrierter Erklärvideos als echtes Neuland.

    Bei 1:03 starten →

  10. 10

    Transformers explained | The architecture behind LLMs

    Lohnt sich AI Coffee Break with Letitia 19:48 intermediate

    Dichte
    71
    Füllmaterial
    33%
    Nützlich ab
    0:38

    Ein wirklich dichter, präziser Transformer-Erklärer, der seinem Titel mit echter Mechanik statt Hype gerecht wird.

    Bei 0:38 starten →

  11. 11

    Transformers: The best idea in AI | Andrej Karpathy and Lex Fridman

    Überfliegen Lex Clips 8:38 intermediate

    Dichte
    69
    Füllmaterial
    34%
    Nützlich ab
    2:44

    Eine scharfsinnige, dichte Aufschlüsselung dessen, warum der Transformer funktioniert – eine der klareren allgemeinverständlichen Erklärungen seiner Designphilosophie, wenn auch kurz.

    Bei 2:44 starten →

  12. 12

    Transformers, explained: Understand the model behind GPT, BERT, and T5

    Lohnt sich Google Cloud Tech 9:11 intermediate

    Dichte
    67
    Füllmaterial
    34%
    Nützlich ab
    1:25

    Eine wirklich solide, jargonarme Erklärung der Transformer-Architektur, die ihrem Titel gerecht wird, ohne dabei etwas verkaufen zu wollen.

    Bei 1:25 starten →

  13. 13

    Transformers for beginners | What are they and how do they work

    Lohnt sich AssemblyAI 19:59 beginner

    Dichte
    68
    Füllmaterial
    29%
    Nützlich ab
    0:31

    Solider, mathematisch fundierter Einsteiger-Erklärer zu den internen Abläufen von Transformern, leicht umrahmt von der Eigenwerbung des Kanals für seine API.

    Bei 0:31 starten →

  14. 14

    Transformers Explained | Simple Explanation of Transformers

    Lohnt sich codebasics 57:31 intermediate

    Dichte
    67
    Füllmaterial
    27%
    Nützlich ab
    1:36

    Ein geduldiger, analogielastiger, aber wirklich gründlicher Rundgang durch die Interna von Transformern – die lange Laufzeit lohnt sich, wenn man die Grundlagen des Deep Learning bereits…

    Bei 1:36 starten →

  15. 15

    How does AI actually work? Transformers explained

    Lohnt sich AI Search 32:21 intermediate

    Dichte
    66
    Füllmaterial
    30%
    Nützlich ab
    0:31

    Eine solide, ehrlich betitelte konzeptionelle Erklärung der Transformer-Architektur, die nur durch redundante Zusammenfassungen und einen Sponsoren-Exkurs in der Mitte geschwächt wird.

    Bei 0:31 starten →

  16. 16

    Transformer Architecture Explained 'Attention Is All You Need'

    Lohnt sich ByteMonk 12:49 intermediate

    Dichte
    62
    Füllmaterial
    34%
    Nützlich ab
    0:47

    Eine klare, gut getaktete konzeptionelle Einführung in Transformer-Attention – nicht bahnbrechend, aber ein wirklich solider Erklärer, der die 13 Minuten für Einsteiger in die Architektur…

    Bei 0:47 starten →

  17. 17

    Transformers, explained: Understand the model behind ChatGPT

    Überfliegen Leon Petrou 24:07 beginner

    Dichte
    61
    Füllmaterial
    28%
    Nützlich ab
    3:29

    Ein klares, zugängliches mentales Modell dafür, wie Transformer end-to-end funktionieren – überspringt die eigentliche Attention-Mathematik (keine Q/K/V), ist aber als konzeptuelle…

    Bei 3:29 starten →

  18. 18

    What are Large Language Models (LLMs)?

    Überfliegen Google for Developers 5:30 beginner

    Dichte
    56
    Füllmaterial
    41%
    Nützlich ab
    0:32

    Eine knappe, ehrliche Einsteiger-Erklärung zu LLMs und Prompt-Design – wenig tiefgehend, aber dicht und präzise für ihre Länge.

    Bei 0:32 starten →

  19. 19

    Everything You Need To Know About Large Language Models (LLMs)

    Überfliegen Matthew Berman 25:20 beginner

    Dichte
    58
    Füllmaterial
    39%
    Nützlich ab
    0:32

    Ein solider, breiter Einsteigerüberblick über die Mechanik und Geschichte von LLMs, nur leicht verwässert durch einen Sponsorenabschnitt für AI Camp.

    Bei 0:32 starten →

  20. 20

    The Transformer architecture

    Überfliegen Hugging Face 2:45 beginner

    Dichte
    50
    Füllmaterial
    47%
    Nützlich ab
    0:59

    Ein klarer, ehrlicher Überblick auf hohem Niveau, der die Serie einleitet, ohne vorzugeben, bereits die tiefere Mechanik zu vermitteln.

    Bei 0:59 starten →

  21. 21

    What are Transformers (Machine Learning Model)?

    Überfliegen IBM Technology 5:51 beginner

    Dichte
    51
    Füllmaterial
    46%
    Nützlich ab
    1:17

    Eine klare, korrekte, aber recht standardmäßige konzeptionelle Einführung in Transformer – solide, aber wenig neu.

    Bei 1:17 starten →

  22. 22

    Transformer Explained

    Überfliegen Caleb Writes Code 6:55 intermediate

    Dichte
    55
    Füllmaterial
    40%
    Nützlich ab
    2:07

    Eine solide konzeptionelle Einführung in die Grenzen von Transformern und deren Lösungen, die aber offen zugibt, die vom Titel suggerierte eigentliche Mechanik auszulassen.

    Bei 2:07 starten →

  23. 23

    Large Language Models Explained Simply (In 13 Minutes)

    Überfliegen The Gradient Descent 12:57 beginner

    Dichte
    50
    Füllmaterial
    45%
    Nützlich ab
    3:21

    Ein klarer, wenn auch konzeptionell oberflächlicher LLM-101-Erklärfilm, aufgelockert mit leichten Witzen und abgerundet durch eine kurze Affiliate-Werbung.

    Bei 3:21 starten →

  24. 24

    Large Language Models | How Large Language Models Work? | Introduction to LLM | Simplilearn

    Überfliegen Simplilearn 15:47 beginner

    Dichte
    46
    Füllmaterial
    48%
    Nützlich ab
    2:46

    Ein solider, wenn auch generischer Einsteigerüberblick darüber, wie LLMs und Transformer funktionieren, aufgefüllt mit einer kurzen Werbung für einen hauseigenen Kurs.

    Bei 2:46 starten →

  25. 25

    How Large Language Models Work

    Überspringen IBM Technology 5:34 beginner

    Dichte
    48
    Füllmaterial
    51%
    Nützlich ab
    2:04

    Ein klarer, kompetenter Einsteigerüberblick über die Mechanik von LLMs von IBM, wenngleich recht generisch und wenig tiefgehend.

    Bei 2:04 starten →

Gistil's own measurement. Not a YouTube rating, and not the channel's position. Die Reihenfolge ist unsere; die Videos gehören ihren Kanälen.

Wie diese Reihenfolge zustande kommt

Jedes Video hier wurde an denselben Achsen gemessen — wie viel seiner Laufzeit Information trägt, wie viel Füllmaterial ist und in welcher Sekunde es sich zu lohnen beginnt. Geordnet wird nach Nutzdichte, nicht nach Aufrufen, Aktualität oder danach, wie gut uns der Kanal gefiel. Was die Zahlen bedeuten →

← Alle vermessenen Videos in ki & maschinelles lernen