Cómo funciona un LLM, desde cero

Estoy estudiando a fondo cómo funciona un LLM. Esta serie es lo que voy entendiendo, parte por parte, con el código que escribo para entenderlo: de los tokens a un GPT pequeño entrenado desde cero.

Requisitos

Saber Python y recordar algo de derivadas. Lo demás se explica en el camino.

Partes

  1. 0

    Una red neuronal con NumPy

    Forward, backpropagation y descenso de gradiente a mano. La base para el resto.

    Por escribir
  2. 1

    Tokens

    Cómo un texto se vuelve números, y cómo funciona BPE.

    Por escribir
  3. 2

    Embeddings

    El significado como geometría: distancias y analogías.

    Por escribir
  4. 3

    Atención, calculada a mano

    Q, K, V y softmax en una cabeza de atención.

    Por escribir
  5. 4

    El bloque transformer

    Multi-head, conexiones residuales, normalización y MLP.

    Por escribir
  6. 5

    Entrenar un GPT pequeño

    Un modelo de caracteres entrenado desde cero.

    Por escribir
  7. 6

    De modelo base a asistente

    Fine-tuning de instrucciones y RLHF.

    Por escribir

Cada parte se publica cuando la entendí y la escribí. El orden y los títulos pueden cambiar según lo que vaya aprendiendo, y cada una termina con las fuentes que usé.

Pronto