Un benchmark es un conjunto de pruebas estandarizadas que permite comparar objetivamente el rendimiento de diferentes sistemas bajo las mismas condiciones.
La rápida evolución de la inteligencia artificial ha impulsado el desarrollo de nuevas formas de medir el rendimiento de modelos y aceleradores especializados. Hoy ya no basta con conocer la potencia de un procesador; también es necesario evaluar la velocidad, la precisión y la eficiencia con la que ejecuta tareas de IA. En el ámbito de la inteligencia artificial, estos benchmarks ayudan a fabricantes, investigadores y empresas a conocer el desempeño de procesadores, aceleradores y modelos antes de implementarlos en aplicaciones reales.
MLPerf, desarrollado por la organización sin fines de lucro MLCommons, es actualmente el benchmark abierto más utilizado para evaluar sistemas de inteligencia artificial. Sus pruebas abarcan desde el entrenamiento de modelos hasta la inferencia, además de medir aspectos como la latencia, el consumo energético y el rendimiento por watt.
Además de MLPerf, diversas empresas han desarrollado plataformas y herramientas que incorporan pruebas de rendimiento (benchmarks) para evaluar cómo se comportan los modelos de inteligencia artificial en distintos tipos de hardware y entornos de ejecución. Entre las más utilizadas se encuentran:
- OpenVINO Benchmark, desarrollado por Intel, permite medir el rendimiento de modelos ejecutados mediante OpenVINO sobre CPU, GPU y NPU compatibles, ayudando a optimizar aplicaciones de inteligencia artificial.
- TensorRT Benchmarks, de NVIDIA, evalúan la velocidad y eficiencia de inferencia de modelos optimizados para GPU NVIDIA utilizando TensorRT.
- ONNX Runtime Benchmarks, impulsados por Microsoft, comparan el rendimiento de modelos ejecutados mediante ONNX Runtime sobre distintos tipos de hardware y sistemas operativos.
¿Qué benchmark utilizar según el objetivo?
Cada benchmark responde a una necesidad diferente. Mientras algunos están diseñados para medir el rendimiento del hardware, otros buscan evaluar la calidad de los modelos o el comportamiento de aplicaciones específicas.

La existencia de múltiples benchmarks refleja la diversidad de aplicaciones de la inteligencia artificial. No existe una única prueba capaz de medir todos los aspectos del rendimiento; por ello, fabricantes y centros de investigación suelen combinar varios benchmarks para obtener una evaluación más completa.
Glosario
- MLPerf
Familia de benchmarks desarrollada por MLCommons para evaluar sistemas de inteligencia artificial en tareas de entrenamiento e inferencia.
- Inferencia
Proceso mediante el cual un modelo de IA utiliza lo aprendido para generar una respuesta o realizar una predicción.
- Entrenamiento
Fase en la que un modelo aprende patrones a partir de grandes cantidades de datos.
- LLM (Large Language Model)
Modelo de lenguaje de gran tamaño entrenado para comprender y generar texto.
- Latencia
Tiempo que tarda un sistema en responder a una solicitud.
- Throughput
Cantidad de consultas o tareas que un sistema puede procesar en un determinado intervalo de tiempo.
- Rendimiento por watt
Relación entre la capacidad de procesamiento y la energía consumida por el sistema.
- ONNX Runtime
Motor de ejecución de modelos de IA compatible con múltiples plataformas y aceleradores.
- TensorRT
Plataforma de NVIDIA para optimizar y acelerar la inferencia de modelos de inteligencia artificial en GPU.
- CPU (Central Processing Unit):
Procesador principal que coordina el funcionamiento del computador.
- GPU (Graphics Processing Unit):
Procesador especializado en gráficos y cálculos paralelos.
- NPU (Neural Processing Unit):
Procesador diseñado específicamente para ejecutar modelos de inteligencia artificial.