Estante medidoIA y aprendizaje automático

Transformer explainers, ranked by where the analogy ends

Relleno mediano
36%
La parte útil empieza
1:36
Duración típica
29 min

última recalculación 16 sep 2026

Every video on this shelf has to solve the same problem: attention is a mechanism made of matrix multiplication, and matrix multiplication is not something you can watch. So each of them picks a metaphor — a lookup table, a search engine, a room where words vote on each other — and the entire quality of the video is decided by what happens after the metaphor.

The ones that rank highly here spend the metaphor quickly and then show the actual operation: what the three projections are, what shape the things being multiplied have, why the scaling term is there, what the mask does. The ones lower down keep the metaphor going for forty minutes, restated in progressively more elaborate ways, and never show a number.

Both types are titled “transformers explained”. The density measurement is what separates them, because a metaphor restated is by definition not new information, and it is the single most common way this topic becomes an hour of video.

Entries carry a difficulty level, and on this topic it matters more than anywhere else on the site: a video that is perfect for someone who already knows what a dot product does is a wasted hour for someone who does not, and the reverse is worse.

  1. 01

    Let's reproduce GPT-2 (124M)

    Vale la pena AndrejKarpathy 4:01:26 advanced

    Densidad
    84
    Relleno
    27%
    Útil desde
    3:34

    A code-complete, first-principles GPT-2 reproduction — one of the most valuable hands-on deep learning tutorials available.

    Empezar en 3:34 →

  2. 02

    Attention in transformers, step-by-step | Deep Learning Chapter 6

    Vale la pena 3Blue1Brown 26:10 intermediate

    Densidad
    83
    Relleno
    21%
    Útil desde
    1:40

    Un recorrido magistralmente claro y denso por el mecanismo de atención que recompensa una visualización atenta con una comprensión técnica real.

    Empezar en 1:40 →

  3. 03

    Transformers, the tech behind LLMs | Deep Learning Chapter 5

    Vale la pena 3Blue1Brown 27:14 intermediate

    Densidad
    80
    Relleno
    26%
    Útil desde
    1:26

    Una introducción magistral sobre el funcionamiento interno de los transformadores: densa, rigurosa y exactamente lo que promete su título.

    Empezar en 1:26 →

  4. 04

    Let's build GPT: from scratch, in code, spelled out.

    Para ojear AndrejKarpathy 1:56:20 advanced

    Densidad
    82
    Relleno
    35%
    Útil desde
    14:11

    A masterclass build-along: real working GPT code, the actual mechanics behind ChatGPT, with almost no filler.

    Empezar en 14:11 →

  5. 05

    Transformer Neural Networks, ChatGPT's foundation, Clearly Explained!!!

    Vale la pena StatQuest with Josh Starmer 36:15 intermediate

    Densidad
    79
    Relleno
    23%
    Útil desde
    1:20

    Un recorrido riguroso con números reales por el funcionamiento interno de los transformers, que realmente enseña cómo funcionan los modelos tipo ChatGPT, y no solo qué hacen.

    Empezar en 1:20 →

  6. 06

    Large Language Models explained briefly

    Vale la pena 3Blue1Brown 7:58 intermediate

    Densidad
    75
    Relleno
    26%
    Útil desde
    0:33

    Una introducción magistralmente condensada y precisa sobre cómo funcionan realmente los LLM: densa, honesta, sin discurso de venta.

    Empezar en 0:33 →

  7. 07

    Transformers Step-by-Step Explained (Attention Is All You Need)

    Para ojear ByteByteGo 10:04 intermediate

    Densidad
    70
    Relleno
    39%
    Útil desde
    2:40

    Una explicación concisa y genuinamente educativa de la atención en los Transformers con un ejemplo práctico real, interrumpida ligeramente por una mención de patrocinador declarada.

    Empezar en 2:40 →

  8. 08

    Transformer Neural Networks - EXPLAINED! (Attention is all you need)

    Vale la pena CodeEmporium 13:05 intermediate

    Densidad
    68
    Relleno
    31%
    Útil desde
    1:54

    Un recorrido conceptual denso y bien estructurado por la arquitectura transformer que hace honor a su título de 'EXPLAINED' sin relleno alguno.

    Empezar en 1:54 →

  9. 09

    Illustrated Guide to Transformers Neural Network: A step by step explanation

    Vale la pena The AI Hacker 15:01 intermediate

    Densidad
    72
    Relleno
    31%
    Útil desde
    1:03

    Un recorrido conceptual conciso y preciso por el interior del Transformer: una enseñanza sólida, aunque repite el terreno ya conocido de las guías ilustradas en lugar de aportar algo nuevo.

    Empezar en 1:03 →

  10. 10

    Transformers explained | The architecture behind LLMs

    Vale la pena AI Coffee Break with Letitia 19:48 intermediate

    Densidad
    71
    Relleno
    33%
    Útil desde
    0:38

    Un explicador de transformers genuinamente denso y preciso que hace honor a su título con mecánica real, no con exageración.

    Empezar en 0:38 →

  11. 11

    Transformers: The best idea in AI | Andrej Karpathy and Lex Fridman

    Para ojear Lex Clips 8:38 intermediate

    Densidad
    69
    Relleno
    34%
    Útil desde
    2:44

    Un desglose agudo y denso de por qué funciona el Transformer, una de las explicaciones más claras en lenguaje llano de su filosofía de diseño, aunque breve.

    Empezar en 2:44 →

  12. 12

    Transformers, explained: Understand the model behind GPT, BERT, and T5

    Vale la pena Google Cloud Tech 9:11 intermediate

    Densidad
    67
    Relleno
    34%
    Útil desde
    1:25

    Un explicador genuinamente sólido y libre de jerga sobre la arquitectura de los transformers, que hace honor a su título sin llegar realmente a vender nada.

    Empezar en 1:25 →

  13. 13

    Transformers for beginners | What are they and how do they work

    Vale la pena AssemblyAI 19:59 beginner

    Densidad
    68
    Relleno
    29%
    Útil desde
    0:31

    Un explicador sólido y fundamentado en matemáticas para principiantes sobre el funcionamiento interno de los transformers, ligeramente flanqueado por la promoción de la propia API del canal.

    Empezar en 0:31 →

  14. 14

    Transformers Explained | Simple Explanation of Transformers

    Vale la pena codebasics 57:31 intermediate

    Densidad
    67
    Relleno
    27%
    Útil desde
    1:36

    Un recorrido paciente y cargado de analogías, pero genuinamente exhaustivo, por el funcionamiento interno del Transformer, que vale la pena por su larga duración si ya se dominan los…

    Empezar en 1:36 →

  15. 15

    How does AI actually work? Transformers explained

    Vale la pena AI Search 32:21 intermediate

    Densidad
    66
    Relleno
    30%
    Útil desde
    0:31

    Una explicación conceptual sólida y honestamente titulada sobre la arquitectura Transformer, debilitada solo por resúmenes redundantes y un desvío publicitario a mitad del video.

    Empezar en 0:31 →

  16. 16

    Transformer Architecture Explained 'Attention Is All You Need'

    Vale la pena ByteMonk 12:49 intermediate

    Densidad
    62
    Relleno
    34%
    Útil desde
    0:47

    Una introducción conceptual clara y bien ritmada a la atención en los Transformer —no es innovadora, pero es un explicador genuinamente sólido que merece los 13 minutos para quienes son…

    Empezar en 0:47 →

  17. 17

    Transformers, explained: Understand the model behind ChatGPT

    Para ojear Leon Petrou 24:07 beginner

    Densidad
    61
    Relleno
    28%
    Útil desde
    3:29

    Un modelo mental claro y accesible de cómo funcionan los Transformers de principio a fin: se salta las matemáticas reales de la atención (sin Q/K/V), pero resulta genuinamente útil como…

    Empezar en 3:29 →

  18. 18

    What are Large Language Models (LLMs)?

    Para ojear Google for Developers 5:30 beginner

    Densidad
    56
    Relleno
    41%
    Útil desde
    0:32

    Un explicativo honesto y ajustado para principiantes sobre LLM y diseño de prompts: poco profundo, pero denso y preciso para su duración.

    Empezar en 0:32 →

  19. 19

    Everything You Need To Know About Large Language Models (LLMs)

    Para ojear Matthew Berman 25:20 beginner

    Densidad
    58
    Relleno
    39%
    Útil desde
    0:32

    Una visión general sólida y amplia para principiantes sobre la mecánica y la historia de los LLM, solo ligeramente diluida por un segmento patrocinado de AI Camp.

    Empezar en 0:32 →

  20. 20

    The Transformer architecture

    Para ojear Hugging Face 2:45 beginner

    Densidad
    50
    Relleno
    47%
    Útil desde
    0:59

    Un primer acercamiento claro y honesto de alto nivel que prepara el terreno para la serie sin fingir enseñar todavía la mecánica profunda.

    Empezar en 0:59 →

  21. 21

    What are Transformers (Machine Learning Model)?

    Para ojear IBM Technology 5:51 beginner

    Densidad
    51
    Relleno
    46%
    Útil desde
    1:17

    Una introducción conceptual clara y precisa, aunque bastante estándar, sobre los transformers: sólida como introducción, pero de baja novedad.

    Empezar en 1:17 →

  22. 22

    Transformer Explained

    Para ojear Caleb Writes Code 6:55 intermediate

    Densidad
    55
    Relleno
    40%
    Útil desde
    2:07

    Una sólida introducción conceptual a las limitaciones de los transformers y sus soluciones, aunque admite abiertamente que omite la mecánica real que el título sugiere.

    Empezar en 2:07 →

  23. 23

    Large Language Models Explained Simply (In 13 Minutes)

    Para ojear The Gradient Descent 12:57 beginner

    Densidad
    50
    Relleno
    45%
    Útil desde
    3:21

    Una explicación clara, aunque conceptualmente superficial, de LLM 101, rellena con chistes ligeros y rematada con una breve promoción de afiliado.

    Empezar en 3:21 →

  24. 24

    Large Language Models | How Large Language Models Work? | Introduction to LLM | Simplilearn

    Para ojear Simplilearn 15:47 beginner

    Densidad
    46
    Relleno
    48%
    Útil desde
    2:46

    Una visión general sólida, aunque genérica, para principiantes sobre cómo funcionan los LLM y los transformers, rellenada con una promoción de curso propio.

    Empezar en 2:46 →

  25. 25

    How Large Language Models Work

    Saltar IBM Technology 5:34 beginner

    Densidad
    48
    Relleno
    51%
    Útil desde
    2:04

    Una visión general clara y competente sobre la mecánica de los LLM para principiantes por parte de IBM, aunque bastante genérica y con poca profundidad real.

    Empezar en 2:04 →

Gistil's own measurement. Not a YouTube rating, and not the channel's position. El orden es nuestro; los vídeos pertenecen a sus canales.

Cómo se decide este orden

Cada vídeo aquí se midió con los mismos criterios — cuánto de su duración aporta información, cuánto es relleno, y en qué segundo empieza a merecer la pena. El orden es por densidad de valor, no por visitas, actualidad ni cuánto nos gustara el canal. Qué significan los números →

← Todos los vídeos medidos de ia y aprendizaje automático