El mecanismo detrás de cada palabra que genera un LLM
En 2017 un paper titulado "Attention Is All You Need" reemplazó las redes secuenciales (RNN/LSTM) por un mecanismo que procesa todo el texto en paralelo y decide qué palabras importan entre sí: self-attention.
La conexión residual es lo que permite apilar 32 bloques sin que el entrenamiento se vuelva inestable — sin ella, la señal se degrada capa tras capa.
Peso de atención al generar "hambre" en "El gato persiguió al ratón porque tenía hambre":
El Query de "hambre" hace match fuerte con el Key de "gato" → el Value de "gato" domina la representación final. causal: "hambre" solo puede mirar hacia atrás, nunca al futuro
| Cabeza | Qué podría estar mirando |
|---|---|
| 1 | Relación sujeto ↔ verbo |
| 2 | Correferencia (quién es quién) |
| 3 | Proximidad posicional |
| 4 | Causa / negación |
Ve todo el texto a la vez. Bueno para entender (BERT).
Cada token solo ve el pasado. Necesario para generar token a token.
Codifica la posición rotando los vectores. Extrapola mejor a contextos largos que el encoding sinusoidal del paper original.
Normalización más ligera que LayerNorm — menos cómputo, entrenamiento igual de estable.
Función de activación del feed-forward, mejora empírica sobre el ReLU original de 2017.
Grouped-Query Attention: varias cabezas de Query comparten Key/Value → cachés más pequeñas, inferencia más rápida.
Tu elección en LM Studio: cada peso pasa de ~16-32 bits a 4 bits. ~4-8x menos memoria.
Duplicar el texto de entrada ≈ 4x más cómputo. Por eso la ventana de contexto (Lección 2) es cara.
Cada token es un muestreo, no un lookup. De ahí las alucinaciones.
Cuantizar a 4-bit pierde relativamente poca calidad — por eso funciona en tu LM Studio.