Cómo funciona un LLM, desde cero
Estoy estudiando a fondo cómo funciona un LLM. Esta serie es lo que voy entendiendo, parte por parte, con el código que escribo para entenderlo: de los tokens a un GPT pequeño entrenado desde cero.
Requisitos
Saber Python y recordar algo de derivadas. Lo demás se explica en el camino.
Partes
- 0Por escribir
Una red neuronal con NumPy
Forward, backpropagation y descenso de gradiente a mano. La base para el resto.
- 1Por escribir
Tokens
Cómo un texto se vuelve números, y cómo funciona BPE.
- 2Por escribir
Embeddings
El significado como geometría: distancias y analogías.
- 3Por escribir
Atención, calculada a mano
Q, K, V y softmax en una cabeza de atención.
- 4Por escribir
El bloque transformer
Multi-head, conexiones residuales, normalización y MLP.
- 5Por escribir
Entrenar un GPT pequeño
Un modelo de caracteres entrenado desde cero.
- 6Por escribir
De modelo base a asistente
Fine-tuning de instrucciones y RLHF.
Cada parte se publica cuando la entendí y la escribí. El orden y los títulos pueden cambiar según lo que vaya aprendiendo, y cada una termina con las fuentes que usé.