01-state-of-the-art

Benchmarks y Evaluación de Modelos

Interpretación crítica de MMLU, SWE-bench, GPQA, HumanEval y ARC-AGI-2: qué miden, cuándo importan, relevancia por caso de uso, y por qué no fiarse ciegamente (contaminación, gaming, puntos ciegos).

  • benchmarks
  • mmlu
  • swe-bench
  • gpqa
  • evaluacion-critica