OpenAI представила новый benchmark SWE-Lancer для оценки способности ИИ зарабатывать на фриланс-разработке.
Кратко:
- ●SWE-Lancer включает 1488 фриланс-задач
- ●Оценка задач симулирует реальные условия
- ●Цель — связать производительность ИИ с денежной ценностью
- ●Современные модели далеки от полной автоматизации
Новый benchmark от OpenAI: SWE-Lancer
В феврале 2025 года OpenAI представила уникальный benchmark под названием SWE-Lancer. Его цель — выяснить, могут ли передовые языковые модели (LLM) заработать $1 миллион на реальных фриланс-задачах в области разработки программного обеспечения.
Этот benchmark включает 1 488 задач, взятых с платформы Upwork. Общая сумма выплат за эти задания составляет $1 000 000. Задачи делятся на два типа: