State of the Art: AI Engineering en 2026
Benchmarks y Evaluación de Modelos
Interpretación crítica de MMLU, SWE-bench, GPQA, HumanEval y ARC-AGI-2: qué miden, cuándo importan, relevancia por caso de uso, y por qué no fiarse ciegamente (contaminación, gaming, puntos ciegos).
- benchmarks
- mmlu
- swe-bench
- gpqa
- evaluacion-critica