Que no te vendan un 0,4%
Interpretación crítica de las métricas que todos citan y casi nadie audita
Un proveedor anuncia "89,5% en MMLU, superando al competidor (88,2%)". El equipo migra toda la infraestructura. Dos meses después: esa diferencia era ruido estadístico.
01 — Los 5 benchmarks que vas a ver citados
Qué miden de verdad — datos de enero 2026
MMLU
57 materias, ~15.000 preguntas opción múltiple
Útil paraConocimiento general, baseline académico
No útil paraTareas específicas, conocimiento actualizado
Regla de oro: diferencia <2% = RUIDO, no mejora real.
SWE-bench Verified
500 bugs reales de GitHub
Útil paraCoding agentic, debugging
No útil paraNo-coding, fuera de Python
Aquí SÍ importa: 3-4% puede ser 15 bugs más detectados en 500 PRs.
GPQA Diamond
Preguntas PhD-level en ciencia
Gemini 3 Pro Deep Think93,8%
Solo importa si tu caso exige razonamiento científico extremo — casi nadie lo necesita.
HumanEval
164 funciones Python básicas/intermedias
Ya no discrimina: demasiado fácil para modelos 2026, todos >80%. Usa SWE-bench en su lugar.
ARC-AGI-2
Puzzles visuales de abstracción
Un score bajo NO significa modelo malo para trabajo real — mide distancia a la AGI, no utilidad práctica.
02 — El benchmark que sí importa para ti
Relevancia por caso de uso
| Tu caso | Benchmark relevante | Irrelevantes para ti |
| Code assistant | SWE-bench | MMLU, GPQA, ARC-AGI |
| Chatbot soporte | MMLU (subset servicio al cliente) | SWE-bench, GPQA, ARC-AGI |
| Research científico | GPQA | SWE-bench, HumanEval |
| Análisis legal | MMLU (subset derecho) | SWE-bench, HumanEval |
| Generación marketing | Ninguno mide creatividad | Todos son irrelevantes aquí |
| Traducción | Benchmarks WMT específicos | SWE-bench, GPQA |
No existe benchmark universal. Elegir por el ranking general en vez del benchmark relevante es el error más caro.
03 — Por qué no fiarse ciegamente
3 limitaciones que rara vez se mencionan
1. Contaminación del dataset de test
MMLU es público desde 2020 — sus respuestas están en miles de fuentes de entrenamiento. Es imposible saber si el modelo razona o memorizó. Solución real: benchmarks privados, o evaluar con tus propios datos.
2. Los proveedores entrenan para el examen
Cuando un benchmark se vuelve el número de marketing, hay incentivo a optimizar específicamente ese score. Es la misma dinámica que viste en la saturación de SWE-bench en la Lección 4.
3. Ningún benchmark mide creatividad ni tono
Un modelo con 92% en MMLU puede generar copy aburrido; uno con 88% puede ser mejor para marketing. Ningún ranking público te lo va a decir.
Módulo 1 completo — Estado del Arte en LLMs
Fundamentos LLMTokens y contextoParámetros de generación
Selección de modelos · TCOML en la prácticaRedes neuronales
ML vs DL vs IA GenBenchmarks críticos