MÓDULO 1 · LECCIÓN 6 · BENCHMARKS Y EVALUACIÓN

Que no te vendan un 0,4%

Interpretación crítica de las métricas que todos citan y casi nadie audita

Un proveedor anuncia "89,5% en MMLU, superando al competidor (88,2%)". El equipo migra toda la infraestructura. Dos meses después: esa diferencia era ruido estadístico.

Qué miden de verdad — datos de enero 2026

MMLU

57 materias, ~15.000 preguntas opción múltiple
Claude Opus 4.5
89,1%
GPT-5.2
88,7%
Gemini 3 Pro
~87%
Útil paraConocimiento general, baseline académico
No útil paraTareas específicas, conocimiento actualizado
Regla de oro: diferencia <2% = RUIDO, no mejora real.

SWE-bench Verified

500 bugs reales de GitHub
Claude Opus 4.5
80,9%
GPT-5.2
77,9%
Gemini 3 Pro
76,2%
Útil paraCoding agentic, debugging
No útil paraNo-coding, fuera de Python
Aquí SÍ importa: 3-4% puede ser 15 bugs más detectados en 500 PRs.

GPQA Diamond

Preguntas PhD-level en ciencia
Gemini 3 Pro Deep Think
93,8%
Claude Opus 4.5
83,4%
GPT-5.2
~82%
Solo importa si tu caso exige razonamiento científico extremo — casi nadie lo necesita.

HumanEval

164 funciones Python básicas/intermedias
GPT-5.2 Codex
~90%
Claude Opus 4.5
~85%
Ya no discrimina: demasiado fácil para modelos 2026, todos >80%. Usa SWE-bench en su lugar.

ARC-AGI-2

Puzzles visuales de abstracción
Gemini 3 Deep Think
45,1%
Claude Opus 4.5
37,6%
Humanos
~85%
Un score bajo NO significa modelo malo para trabajo real — mide distancia a la AGI, no utilidad práctica.
Relevancia por caso de uso
Tu casoBenchmark relevanteIrrelevantes para ti
Code assistantSWE-benchMMLU, GPQA, ARC-AGI
Chatbot soporteMMLU (subset servicio al cliente)SWE-bench, GPQA, ARC-AGI
Research científicoGPQASWE-bench, HumanEval
Análisis legalMMLU (subset derecho)SWE-bench, HumanEval
Generación marketingNinguno mide creatividadTodos son irrelevantes aquí
TraducciónBenchmarks WMT específicosSWE-bench, GPQA

No existe benchmark universal. Elegir por el ranking general en vez del benchmark relevante es el error más caro.

3 limitaciones que rara vez se mencionan

1. Contaminación del dataset de test

MMLU es público desde 2020 — sus respuestas están en miles de fuentes de entrenamiento. Es imposible saber si el modelo razona o memorizó. Solución real: benchmarks privados, o evaluar con tus propios datos.

2. Los proveedores entrenan para el examen

Cuando un benchmark se vuelve el número de marketing, hay incentivo a optimizar específicamente ese score. Es la misma dinámica que viste en la saturación de SWE-bench en la Lección 4.

3. Ningún benchmark mide creatividad ni tono

Un modelo con 92% en MMLU puede generar copy aburrido; uno con 88% puede ser mejor para marketing. Ningún ranking público te lo va a decir.

Módulo 1 completo — Estado del Arte en LLMs
Fundamentos LLMTokens y contextoParámetros de generación Selección de modelos · TCOML en la prácticaRedes neuronales ML vs DL vs IA GenBenchmarks críticos