MÓDULO 1 · LECCIÓN 2 · 25 MIN · BÁSICO

Tokens, contexto y coste

Lo que de verdad limita — y factura — a un LLM

Un LLM no lee letras ni palabras: lee tokens — fragmentos que decide su propio tokenizador. Y cobra (y limita) por token, no por palabra ni por carácter.

La misma frase, partida distinto según el modelo
GPT-4 → La inteligencia artificial transformará los negocios = 8 tokens
Claude → La inteligencia artificial transformará los negocios = 6 tokens

Misma frase, mismo significado — 33% más tokens en GPT-4. Ningún tokenizador es "más correcto", solo distinto.

Regla de oro (español): 1 token ≈ 0.75 palabras ≈ 3.4 caracteres. El español gasta 25-35% más tokens que el inglés.
Todo cuenta: prompt + historial + respuesta
9.000 tokens usadosde 16.000 (límite corto)
El mismo usode 200.000 (Claude Opus 4.5)
prompt (500) historial (5.000) respuesta (2.000)

El límite se agota rapidísimo con historial de chat largo — no solo con documentos grandes.

Modelo (ene. 2026)Context window≈ páginas
GPT-5.2400.000 tokens~600
Claude Opus 4.5200.000 tokens~300
Claude Sonnet 4.5200K estándar / 1M beta~300 / ~1.500
Gemini 3 Pro / Flash1.000.000 tokens~1.500
Tu Llama 3.1 8B local vs. la nube

El contexto "de fábrica" no es el contexto que realmente tienes en LM Studio

128K
CONTEXTO OFICIAL DE LA ARQUITECTURA LLAMA 3.1
¿?
CONTEXT LENGTH REAL EN TU LM STUDIO

Revisa en LM Studio la configuración del modelo cargado y mira "Context Length" (n_ctx). Casi siempre está muy por debajo de 128K — subirlo consume mucha más RAM/VRAM. la caché KV crece con cada token extra: el mismo coste O(n²) de atención, ahora en memoria

3 estrategias de compresión
0%*

Chunking

Divide en fragmentos independientes. No pierde info, solo hace que quepa.

1.000 tickets → 1.000 llamadas independientes
80-95%

Resumen progresivo

Comprime en cascada. Pierde detalle a cambio de visión global.

Libro 300 pág. → resúmenes por capítulo
70-95%

Extracción selectiva

Solo envías la sección relevante. Sin pérdida si eliges bien.

Contrato 50 pág. → solo "Sección 7"

*Chunking reduce tokens por llamada, no el total — es lo que evita el error de límite.

Caso real: informe de 80 páginas (~120.000 tokens), analizar solo riesgos financieros.

$0,224
documento completo
$0,035
extracción selectiva

84% menos coste — misma información relevante, porque el documento tenía índice claro.

Ejercicio práctico

Medir tokens reales y ver los límites de tu setup local con tus propios ojos.

1

Pega un texto tuyo en platform.openai.com/tokenizer. Anota tokens, caracteres y el ratio. ¿Se acerca a 3,4?

2

En LM Studio revisa el "Context Length" de Llama 3.1 8B. Calcula a cuántas páginas equivale (1 token≈0,75 palabras, ~500 palabras/página).

3

Pega un documento largo hasta acercarte a ese límite. ¿Trunca, da error, o "olvida" la parte media? — "lost in the middle", relacionado con self-attention.

Checklist de retención