HELMET предлагает новый подход к оценке языковых моделей, работающих с длинными контекстами, преодолевая ограничения существующих методик.
Кратко:
- ●HELMET оценивает модели с длинными контекстами до 128K токенов
- ●Новые метрики заменяют устаревшие n-gram
- ●Разработан для более точной оценки реальных задач
- ●Включает RAG, генерацию с цитатами и др.
Новый стандарт для LCLMs
HELMET (Holistically Evaluating Long-context Language Models) — комплексный набор для оценки моделей обработки длинного контекста, представленный на ICLR 2025. Разработанный командой исследователей, он предлагает управляемый и надёжный бенчмарк для языковых моделей, работающих с длинными контекстами.
Проблемы существующих бенчмарков
Современные бенчмарки часто сосредоточены на синтетических задачах, таких как needle-in-a-haystack (NIAH), и не охватывают реальные приложения. Кроме того, они ограничены короткими контекстами, что мешает адекватной оценке моделей. HELMET решает эти проблемы, предлагая более широкий спектр задач и возможность оценки базовых моделей через few-shot prompting.