SWE-bench Verified повышает точность оценки ИИ в решении реальных программных задач благодаря человеко-проверенному подходу.
Кратко:
- ●SWE-bench Verified включает 500 задач с улучшенной проверкой.
- ●93 разработчика оценили 1 699 примеров.
- ●GPT-4o показал рост успешных решений до 33.2%.
- ●OpenAI рекомендует использовать SWE-bench Pro для более точной оценки.
SWE-bench Verified: новая веха в оценке ИИ
SWE-bench Verified, разработанный совместно OpenAI и Принстонским университетом, включает 500 человеко-проверенных задач. Этот поднабор был создан для более надёжной оценки возможностей ИИ в решении реальных программных задач.
Зачем нужен SWE-bench Verified?
Оригинальный SWE-bench имел недостатки, такие как чрезмерно специфичные unit-тесты и нечёткие формулировки задач. Это приводило к несправедливой оценке моделей. SWE-bench Verified устраняет эти проблемы, повышая достоверность тестирования.