MÓDULO 1 · LECCIÓN 1 · PROFUNDIZACIÓN

Arquitectura Transformer

El mecanismo detrás de cada palabra que genera un LLM

En 2017 un paper titulado "Attention Is All You Need" reemplazó las redes secuenciales (RNN/LSTM) por un mecanismo que procesa todo el texto en paralelo y decide qué palabras importan entre sí: self-attention.

Un bloque Transformer, paso a paso
Embeddings + posición (RoPE)
Multi-Head Self-Attentionvarias "miradas" en paralelo
↳ conexión residual: la entrada se suma a la salida ↲
Add & Norm
Feed-Forward (MLP)por token, independiente · SwiGLU
↳ conexión residual ↲
Add & Norm
↓ repite ×32 (Llama 3.1 8B) ↓
Proyección lineal + softmax → distribución de probabilidad sobre el vocabulario

La conexión residual es lo que permite apilar 32 bloques sin que el entrenamiento se vuelva inestable — sin ella, la señal se degrada capa tras capa.

Self-attention con Query, Key, Value

Peso de atención al generar "hambre" en "El gato persiguió al ratón porque tenía hambre":

gato
60%
tenía
18%
porque
9%
ratón
6%

El Query de "hambre" hace match fuerte con el Key de "gato" → el Value de "gato" domina la representación final. causal: "hambre" solo puede mirar hacia atrás, nunca al futuro

Query = lo que busca Key = lo que cada palabra ofrece Value = contenido que aporta si gana
Multi-head: varias miradas a la vez
CabezaQué podría estar mirando
1Relación sujeto ↔ verbo
2Correferencia (quién es quién)
3Proximidad posicional
4Causa / negación
Auditoría Esta división "una cabeza, un rol" es una simplificación didáctica. En la práctica qué aprende cada cabeza es más difuso y se investiga con técnicas de interpretabilidad — no asumas que cada una tiene un trabajo tan limpio como el de esta tabla.
Encoder-decoder vs. decoder-only (lo que corres tú)

Encoder (bidireccional)

Ve todo el texto a la vez. Bueno para entender (BERT).

Decoder causal (GPT/Llama/Claude)

Cada token solo ve el pasado. Necesario para generar token a token.

Llama 3.1 8B, en concreto
RoPE

Codifica la posición rotando los vectores. Extrapola mejor a contextos largos que el encoding sinusoidal del paper original.

RMSNorm

Normalización más ligera que LayerNorm — menos cómputo, entrenamiento igual de estable.

SwiGLU

Función de activación del feed-forward, mejora empírica sobre el ReLU original de 2017.

GQA

Grouped-Query Attention: varias cabezas de Query comparten Key/Value → cachés más pequeñas, inferencia más rápida.

4-BIT

Tu elección en LM Studio: cada peso pasa de ~16-32 bits a 4 bits. ~4-8x menos memoria.

Como ingeniero de prompting, no de entrenamiento
COSTE

Atención = O(n²)

Duplicar el texto de entrada ≈ 4x más cómputo. Por eso la ventana de contexto (Lección 2) es cara.

CALIDAD

Generación probabilística

Cada token es un muestreo, no un lookup. De ahí las alucinaciones.

DEPLOY

Redundancia de pesos

Cuantizar a 4-bit pierde relativamente poca calidad — por eso funciona en tu LM Studio.