Estante medidoIA y aprendizaje automático
Transformer explainers, ranked by where the analogy ends
- Relleno mediano
- 36%
- La parte útil empieza
- 1:36
- Duración típica
- 29 min
última recalculación 16 sep 2026
Every video on this shelf has to solve the same problem: attention is a mechanism made of matrix multiplication, and matrix multiplication is not something you can watch. So each of them picks a metaphor — a lookup table, a search engine, a room where words vote on each other — and the entire quality of the video is decided by what happens after the metaphor.
The ones that rank highly here spend the metaphor quickly and then show the actual operation: what the three projections are, what shape the things being multiplied have, why the scaling term is there, what the mask does. The ones lower down keep the metaphor going for forty minutes, restated in progressively more elaborate ways, and never show a number.
Both types are titled “transformers explained”. The density measurement is what separates them, because a metaphor restated is by definition not new information, and it is the single most common way this topic becomes an hour of video.
Entries carry a difficulty level, and on this topic it matters more than anywhere else on the site: a video that is perfect for someone who already knows what a dot product does is a wasted hour for someone who does not, and the reverse is worse.
-
01
Let's reproduce GPT-2 (124M)
0:004:01:26- Densidad
- 84
- Relleno
- 27%
- Útil desde
- 3:34
A code-complete, first-principles GPT-2 reproduction — one of the most valuable hands-on deep learning tutorials available.
-
02
Attention in transformers, step-by-step | Deep Learning Chapter 6
0:0026:10- Densidad
- 83
- Relleno
- 21%
- Útil desde
- 1:40
Un recorrido magistralmente claro y denso por el mecanismo de atención que recompensa una visualización atenta con una comprensión técnica real.
-
03
Transformers, the tech behind LLMs | Deep Learning Chapter 5
0:0027:14- Densidad
- 80
- Relleno
- 26%
- Útil desde
- 1:26
Una introducción magistral sobre el funcionamiento interno de los transformadores: densa, rigurosa y exactamente lo que promete su título.
-
04
Let's build GPT: from scratch, in code, spelled out.
0:001:56:20- Densidad
- 82
- Relleno
- 35%
- Útil desde
- 14:11
A masterclass build-along: real working GPT code, the actual mechanics behind ChatGPT, with almost no filler.
-
05
Transformer Neural Networks, ChatGPT's foundation, Clearly Explained!!!
0:0036:15- Densidad
- 79
- Relleno
- 23%
- Útil desde
- 1:20
Un recorrido riguroso con números reales por el funcionamiento interno de los transformers, que realmente enseña cómo funcionan los modelos tipo ChatGPT, y no solo qué hacen.
-
06
Large Language Models explained briefly
0:007:58- Densidad
- 75
- Relleno
- 26%
- Útil desde
- 0:33
Una introducción magistralmente condensada y precisa sobre cómo funcionan realmente los LLM: densa, honesta, sin discurso de venta.
-
07
Transformers Step-by-Step Explained (Attention Is All You Need)
0:0010:04- Densidad
- 70
- Relleno
- 39%
- Útil desde
- 2:40
Una explicación concisa y genuinamente educativa de la atención en los Transformers con un ejemplo práctico real, interrumpida ligeramente por una mención de patrocinador declarada.
-
08
Transformer Neural Networks - EXPLAINED! (Attention is all you need)
0:0013:05- Densidad
- 68
- Relleno
- 31%
- Útil desde
- 1:54
Un recorrido conceptual denso y bien estructurado por la arquitectura transformer que hace honor a su título de 'EXPLAINED' sin relleno alguno.
-
09
Illustrated Guide to Transformers Neural Network: A step by step explanation
0:0015:01- Densidad
- 72
- Relleno
- 31%
- Útil desde
- 1:03
Un recorrido conceptual conciso y preciso por el interior del Transformer: una enseñanza sólida, aunque repite el terreno ya conocido de las guías ilustradas en lugar de aportar algo nuevo.
-
10
Transformers explained | The architecture behind LLMs
0:0019:48- Densidad
- 71
- Relleno
- 33%
- Útil desde
- 0:38
Un explicador de transformers genuinamente denso y preciso que hace honor a su título con mecánica real, no con exageración.
-
11
Transformers: The best idea in AI | Andrej Karpathy and Lex Fridman
0:008:38- Densidad
- 69
- Relleno
- 34%
- Útil desde
- 2:44
Un desglose agudo y denso de por qué funciona el Transformer, una de las explicaciones más claras en lenguaje llano de su filosofía de diseño, aunque breve.
-
12
Transformers, explained: Understand the model behind GPT, BERT, and T5
0:009:11- Densidad
- 67
- Relleno
- 34%
- Útil desde
- 1:25
Un explicador genuinamente sólido y libre de jerga sobre la arquitectura de los transformers, que hace honor a su título sin llegar realmente a vender nada.
-
13
Transformers for beginners | What are they and how do they work
0:0019:59- Densidad
- 68
- Relleno
- 29%
- Útil desde
- 0:31
Un explicador sólido y fundamentado en matemáticas para principiantes sobre el funcionamiento interno de los transformers, ligeramente flanqueado por la promoción de la propia API del canal.
-
14
Transformers Explained | Simple Explanation of Transformers
0:0057:31- Densidad
- 67
- Relleno
- 27%
- Útil desde
- 1:36
Un recorrido paciente y cargado de analogías, pero genuinamente exhaustivo, por el funcionamiento interno del Transformer, que vale la pena por su larga duración si ya se dominan los…
-
15
How does AI actually work? Transformers explained
0:0032:21- Densidad
- 66
- Relleno
- 30%
- Útil desde
- 0:31
Una explicación conceptual sólida y honestamente titulada sobre la arquitectura Transformer, debilitada solo por resúmenes redundantes y un desvío publicitario a mitad del video.
-
16
Transformer Architecture Explained 'Attention Is All You Need'
0:0012:49- Densidad
- 62
- Relleno
- 34%
- Útil desde
- 0:47
Una introducción conceptual clara y bien ritmada a la atención en los Transformer —no es innovadora, pero es un explicador genuinamente sólido que merece los 13 minutos para quienes son…
-
17
Transformers, explained: Understand the model behind ChatGPT
0:0024:07- Densidad
- 61
- Relleno
- 28%
- Útil desde
- 3:29
Un modelo mental claro y accesible de cómo funcionan los Transformers de principio a fin: se salta las matemáticas reales de la atención (sin Q/K/V), pero resulta genuinamente útil como…
-
18
What are Large Language Models (LLMs)?
0:005:30- Densidad
- 56
- Relleno
- 41%
- Útil desde
- 0:32
Un explicativo honesto y ajustado para principiantes sobre LLM y diseño de prompts: poco profundo, pero denso y preciso para su duración.
-
19
Everything You Need To Know About Large Language Models (LLMs)
0:0025:20- Densidad
- 58
- Relleno
- 39%
- Útil desde
- 0:32
Una visión general sólida y amplia para principiantes sobre la mecánica y la historia de los LLM, solo ligeramente diluida por un segmento patrocinado de AI Camp.
-
20
The Transformer architecture
0:002:45- Densidad
- 50
- Relleno
- 47%
- Útil desde
- 0:59
Un primer acercamiento claro y honesto de alto nivel que prepara el terreno para la serie sin fingir enseñar todavía la mecánica profunda.
-
21
What are Transformers (Machine Learning Model)?
0:005:51- Densidad
- 51
- Relleno
- 46%
- Útil desde
- 1:17
Una introducción conceptual clara y precisa, aunque bastante estándar, sobre los transformers: sólida como introducción, pero de baja novedad.
-
22
Transformer Explained
0:006:55- Densidad
- 55
- Relleno
- 40%
- Útil desde
- 2:07
Una sólida introducción conceptual a las limitaciones de los transformers y sus soluciones, aunque admite abiertamente que omite la mecánica real que el título sugiere.
-
23
Large Language Models Explained Simply (In 13 Minutes)
0:0012:57- Densidad
- 50
- Relleno
- 45%
- Útil desde
- 3:21
Una explicación clara, aunque conceptualmente superficial, de LLM 101, rellena con chistes ligeros y rematada con una breve promoción de afiliado.
-
24
Large Language Models | How Large Language Models Work? | Introduction to LLM | Simplilearn
0:0015:47- Densidad
- 46
- Relleno
- 48%
- Útil desde
- 2:46
Una visión general sólida, aunque genérica, para principiantes sobre cómo funcionan los LLM y los transformers, rellenada con una promoción de curso propio.
-
25
How Large Language Models Work
0:005:34- Densidad
- 48
- Relleno
- 51%
- Útil desde
- 2:04
Una visión general clara y competente sobre la mecánica de los LLM para principiantes por parte de IBM, aunque bastante genérica y con poca profundidad real.
Gistil's own measurement. Not a YouTube rating, and not the channel's position. El orden es nuestro; los vídeos pertenecen a sus canales.
Cómo se decide este orden
Cada vídeo aquí se midió con los mismos criterios — cuánto de su duración aporta información, cuánto es relleno, y en qué segundo empieza a merecer la pena. El orden es por densidad de valor, no por visitas, actualidad ni cuánto nos gustara el canal. Qué significan los números →