●Введение новых метрик для оценки качества и производительности
●Проблемы с утечкой данных и несоответствием синтетической оценке
●Экономическая эффективность становится важным фактором
Оценка больших языковых моделей: проблемы и подходы
Исследования, посвящённые оценке больших языковых моделей (LLM), обученных на коде, выявляют множество проблем, связанных с существующими бенчмарками и методами оценки. В частности, анализ 142 научных работ показал, что текущие бенчмарки страдают от перекосов в данных и отсутствия стандартных протоколов, что усложняет объективную оценку моделей.
Проблемы существующих бенчмарков
По данным исследования, опубликованного в *ACM Transactions on Software Engineering and Methodology*, бенчмарки часто не отражают реальные задачи разработки программного обеспечения. Это связано с ограниченным набором задач и данными, которые не всегда соответствуют практическим условиям. Обзор, охвативший модели от 125 млн до сотен миллиардов параметров, таких как CodeBERT и Codex, также указывает на значительные различия в точности и проблемы с протоколами оценки.
Исследования продолжают искать новые метрики для оценки качества кода, генерируемого LLM. Например, в статье *Empirical Software Engineering* введён Static Repair Success Rate (SRSR), который измеряет успешность исправления ошибок, выявленных статическим анализатором SonarQube. Модель Grok 3 показала снижение числа ошибок на 71,54 %.
Однако модели также склонны к «переисправлению» кода, что выявлено в работе *Automated Software Engineering*. Это указывает на необходимость более точных и комплексных подходов к оценке.
Оценка производительности кода
Вопросы эффективности и производительности кода также находятся в центре внимания. В *Journal of Systems and Software* представлена методика оценки эффективности реализации без запуска кода. Использование подсказок «code+feature» и адаптации LoRA улучшает результаты, но эффективность зависит от языка программирования и аспекта задачи.
Современные исследования отходят от устаревших методов оценки, таких как pass@1, и переходят к многомерным протоколам. Например, метод “tree‑fold evaluation”, описанный на arXiv, объединяет традиционные тесты, проверку качества кода и мнения разработчиков.
Кроме того, экономическая эффективность становится важной метрикой, особенно в сравнении закрытых и открытых моделей. Исследование, проведённое на 814 задачах, показало, что экономичная модель Qwen3‑Coder может конкурировать с более дорогими.