CONCEPTO · PATTERNS
¿Qué son los benchmarks de IA?
Un benchmark es una prueba estandarizada que mide la capacidad de un modelo en una tarea concreta y permite comparar modelos entre sí.
3 min de lectura · actualizado 2026-08
ANTES DE LEER
¿Qué es?
Un benchmark es una prueba estandarizada que mide la capacidad de un modelo en una tarea concreta. Consiste en un conjunto fijo de preguntas o problemas con respuestas conocidas, una forma de puntuar y un número final que permite comparar modelos entre sí.
Los benchmarks responden preguntas puntuales: "¿qué tan bien razona sobre ciencia de nivel doctorado?" (GPQA), "¿resuelve issues reales de GitHub?" (SWE-bench), "¿qué respuesta prefieren las personas en conversación?" (LMArena). Cada uno cubre una porción angosta de lo que llamamos, en general, la capacidad de un modelo.
Un benchmark mide lo que mide, no "inteligencia" en general. Un número alto en un benchmark saturado dice poco.
Modelo mental
Un benchmark es como un examen estandarizado. Sirve para comparar a gran escala, pero arrastra los mismos problemas: se puede estudiar para el examen en vez de aprender la materia, y cuando todos sacan 95, el examen deja de discriminar.
Tres familias:
- De conocimiento: preguntas con respuesta única. MMLU-Pro, GPQA. Fáciles de puntuar, fáciles de contaminar.
- Agénticos / de tareas: el modelo tiene que lograr algo verificable en un entorno. SWE-bench, Terminal-Bench. Más caros de correr, más cerca del uso real.
- De preferencia humana: personas votan a ciegas entre respuestas de dos modelos. LMArena. Captura "se siente mejor", pero es subjetivo y manipulable.
Dos problemas que tienes que conocer:
- Contaminación: si las preguntas del benchmark, o texto derivado de ellas, entraron al corpus de entrenamiento, el modelo recuerda la respuesta en vez de razonarla. Las auditorías encuentran contaminación significativa en buena parte de los benchmarks populares.
- Saturación: cuando los modelos de frontera se agrupan en 90–94 %, la diferencia entra dentro del margen de ruido. El benchmark ya no separa a un modelo de otro.
¿Cómo se usa?
Para leer un leaderboard sin engañarte:
- Mira varios tipos a la vez: uno de conocimiento (MMLU-Pro, GPQA), una arena de preferencia (LMArena) y una suite agéntica (SWE-bench, Terminal-Bench). La señal es que coincidan; un solo número aislado no dice casi nada.
- Chequea la fecha del benchmark y si está saturado. Si los primeros puestos están todos por encima de 90, busca uno más difícil.
- Prefiere benchmarks con conjunto de test privado o rotativo: resisten mejor la contaminación.
- Desconfía de comparaciones donde cada modelo reporta su propia corrida con su propio prompting.
- Para tu caso concreto: arma tu propio conjunto de evaluación con datos tuyos. Ningún benchmark público predice el rendimiento en tu tarea específica.
¿Cuándo usarlo / cuándo no?
Los benchmarks públicos sirven para:
- Descartar rápido: un modelo que va mal en todo probablemente no te sirve.
- Ver hacia dónde va la investigación, mirando qué benchmarks suben rápido.
- Comparar familias de modelos a grandes rasgos antes de invertir en pruebas propias.
No sirven para:
- Decidir qué modelo poner en producción para tu tarea: eso lo decide tu evaluación con tus datos.
- Comparar modelos que están todos en zona de saturación.
- Sacar conclusiones de un único benchmark o de una diferencia de uno o dos puntos.
- Medir cosas que ningún benchmark cubre bien todavía: seguir instrucciones largas, mantener coherencia en tareas de horas, criterio sobre cuándo detenerse.