Бенчмарк — это стандартизированный тест или набор задач для объективной оценки качества AI-моделей. Бенчмарки вроде MMLU, HumanEval, MATH, GSM8K часто проверяют навыки рассуждения, генерации или точности моделей на конкретных заданиях. Результаты на бенчмарках не всегда отражают реальную полезность модели в прикладных задачах.
Пример
Модель GPT-4 проверяют на бенчмарке MMLU, чтобы сравнить её навыки понимания текста с другими LLM. Высокий результат не гарантирует, что модель будет полезна в реальных диалогах.