Capítulo 16 · Evaluación · 8 min

¿Cómo sabemos que un modelo es mejor?

MMLU, HumanEval, LMArena. Por qué medir la inteligencia de un LLM es difícil — y por qué ningún benchmark es suficiente.

Medir un modelo es medir un comportamiento

No existe una única nota que diga si un LLM es "bueno". Un modelo puede ser excelente en código, mediano en matemáticas, rápido pero menos fiable, creativo pero impreciso.

Evaluar significa elegir qué comportamiento queremos medir.

Abajo tienes cinco modelos comparados en seis benchmarks — entre ellos BBH (Big-Bench Hard), una selección de las tareas de razonamiento en las que los modelos seguían fallando cuando se construyó el benchmark. Haz clic en un modelo para ver sus puntuaciones en detalle, o en un benchmark para entender qué evalúa.

Es una foto fija de 2024, no la clasificación de hoy. Los modelos han cambiado y varios de esos benchmarks están ya saturados. Se conserva tal cual porque lo que enseña — perfiles de fuerza distintos, ningún ganador en todas las líneas — sigue siendo cierto en cada generación.

Cada eje es un benchmark. Los modelos tienen perfiles diferentes — fuerte en código, débil en razonamiento largo, o al revés. Ningún radar da el veredicto final: hay que cruzar benchmarks objetivos y preferencias humanas para juzgar un LLM.

Mira los patrones con atención. Ningún modelo domina: en esta foto, Claude 3.5 Sonnet manda en HumanEval y BBH, GPT-4o domina Arena y MATH, y Llama 3.1 70B aguanta la comparación sin llegar a adelantar. Los nombres han cambiado desde entonces; la forma del gráfico se repite en cada generación. Fíjate también en que Arena y benchmarks académicos no correlacionan del todo: un modelo puede ser excelente en MMLU y mediocre en Arena, y al revés. Los humanos valoran otra cosa que la precisión académica.

Benchmarks

Un benchmark es un conjunto de tareas con una métrica. MMLU mide conocimiento académico, HumanEval mide código, GSM8K mide razonamiento aritmético, Arena mide preferencias humanas.

En HumanEval la métrica estándar es pass@k: se generan k propuestas por problema (a menudo k=1 o k=10) y se cuenta como éxito si al menos una pasa los tests. pass@1 mide fiabilidad, pass@10 capacidad bruta.

Cada benchmark ilumina una parte del modelo. Ninguno cubre todo.

Las referencias humanas suelen citarse mal. En MMLU — 57 disciplinas académicas en forma de test de cuatro opciones — los humanos no especialistas rondan el 35 %: nadie domina las 57 materias. El ~90 % que circula por todas partes es la estimación para expertos de cada dominio: un médico en las preguntas de medicina, un jurista en las de derecho. Los modelos punteros han superado esa barra, y ahí está justo el problema: MMLU está hoy saturado, ya no separa a los mejores modelos, y la comunidad ha pasado a pruebas más duras (MMLU-Pro, GPQA, Humanity's Last Exam).

En la Arena — hoy LMArena — humanos anónimos hacen cualquier pregunta a dos modelos mostrados sin nombre, leen las dos respuestas y eligen la que prefieren. La puntuación ELO sale de millones de esos duelos. Es el único benchmark que mide lo que los humanos prefieren de verdad, con toda su subjetividad; lo que se le escapa es la precisión factual, porque el votante no siempre sabe quién tiene razón.

Contaminación

Si un benchmark está en internet, puede aparecer en los datos de entrenamiento. Entonces el modelo puede haber visto las respuestas antes de la prueba.

Por eso las evaluaciones modernas intentan usar conjuntos privados, tareas nuevas o comparaciones humanas ciegas.

Evaluación por tareas reales

Los benchmarks académicos clásicos se saturan. MMLU era difícil en 2020 (GPT-3: 43 %). Cuatro años después todos los grandes modelos estaban entre 82 y 89 %, y hoy los mejores superan la barra de los expertos humanos. Lo mismo con HumanEval, donde la frontera está por encima del 95 %. Cuando casi todo el mundo acierta casi todo, el benchmark ya no clasifica nada. Por eso aparecen otros centrados en tareas reales:

  • SWE-Bench — bugs reales de GitHub a corregir en codebases existentes. El modelo recibe un repo, una descripción de bug, y debe producir un patch que pase los tests. Mucho más duro que HumanEval.
  • GAIA — preguntas multi-etapa que requieren razonamiento, búsqueda web, manipulación de archivos. Mide la capacidad agéntica.
  • GPQA (Graduate-Level Google-Proof QA) — preguntas de física, química, biología a nivel doctoral, diseñadas para que no se puedan responder con una búsqueda en Google. Distingue los modelos que razonan de los que recuperan.
  • ARC-AGI — puzzles visuales abstractos, diseñados para medir el razonamiento general sobre conceptos nuevos. Ningún modelo pasó un umbral humano antes de finales de 2024.
  • Humanity's Last Exam — preguntas a nivel del mejor investigador del mundo, en dominios donde los benchmarks clásicos están saturados.

Evaluar tu caso real

Para un producto, los benchmarks públicos no bastan. Hay que construir una evaluación propia:

  • prompts representativos
  • respuestas esperadas o criterios de calidad
  • casos límite
  • medición de latencia y coste
  • revisión humana de muestras

La pregunta importante no es "¿cuál modelo gana en general?", sino "¿cuál falla menos en mi uso concreto?".

Aun así, estas clasificaciones han sacado a la luz algo inesperado. En las pruebas más duras — GPQA, ARC-AGI, las matemáticas de olimpiada — un mismo modelo puede pasar de mediocre a excelente sin que se haya tocado ni uno solo de sus pesos. La única variable que cambia es el tiempo que se le deja pensar antes de responder. ¿Cómo se ganan puntos pensando más rato? Siguiente capítulo.

Lo que debes recordar

Un LLM no es magia. Es una máquina que:

  1. corta texto en tokens
  2. transforma tokens en vectores
  3. usa atención para mezclar contexto
  4. apila bloques Transformer
  5. aprende prediciendo el siguiente token
  6. genera muestreando una distribución
  7. se alinea, se equipa, se evalúa

Si entiendes ese ciclo, puedes razonar sobre sus capacidades y sus límites sin caer ni en el mito ni en el cinismo.

Actualizado el