SWE-Lancer: могут ли ИИ заработать $1 млн на фрилансе?
Мария Соколова2 августа 2026 г.5 мин чтения
OpenAI представила новый benchmark SWE-Lancer для оценки способности ИИ зарабатывать на фриланс-разработке.
Кратко:
●SWE-Lancer включает 1488 фриланс-задач
●Оценка задач симулирует реальные условия
●Цель — связать производительность ИИ с денежной ценностью
●Современные модели далеки от полной автоматизации
Новый benchmark от OpenAI: SWE-Lancer
В феврале 2025 года OpenAI представила уникальный benchmark под названием SWE-Lancer. Его цель — выяснить, могут ли передовые языковые модели (LLM) заработать $1 миллион на реальных фриланс-задачах в области разработки программного обеспечения.
Этот benchmark включает 1 488 задач, взятых с платформы Upwork. Общая сумма выплат за эти задания составляет $1 000 000. Задачи делятся на два типа:
●IC SWE-задачи (Individual Contributor) — самостоятельные задачи, где модель должна предложить исправление или реализацию. Их объем составляет 764 задачи на сумму примерно $414 000.
●Manager-задачи (SWE Manager) — задачи технического менеджмента, где модель выбирает лучший из предложенных вариантов. Таких задач 724, общей ценностью около $585 000.
Как измеряется успех?
Для оценки IC-задач применяются end-to-end тесты, тщательно проверенные инженерами. Manager-задачи оцениваются на основе выбора, сделанного оригинальным нанявшим менеджером. Это позволяет симулировать реальные условия проверки качества работы.
Технически benchmark реализован через открытый Docker-образ и публичный evaluation-сплит под названием SWE-Lancer Diamond. Это позволяет воспроизводить результаты экспериментов офлайн, устраняя вариативность и делая оценки стабильными.
Экономическое влияние моделей
Цель SWE-Lancer — не просто узнать, сколько заработают модели, а напрямую связать их производительность с денежной ценностью задач. Это позволяет формализовать оценку экономического влияния развития ИИ.
Результаты показывают, что передовые модели пока не способны решить большинство задач. Например, лучшие модели в рамках публичного набора Diamond зарабатывают около $208 050 из $500 800 возможных, что составляет примерно 40 % от экономической ценности.
На лидерборде LLM-моделей, таких как Claude 3.5 Sonnet, отмечены следующие результаты: 26.2 % успеха в IC-задачах и 44.9 % в Manager-задачах.
Перспективы и вызовы
SWE-Lancer — это первый реалистично ориентированный benchmark, который переводит способности LLM в денежную метрику на основе реальных задач. Современные модели ещё далеки от автоматического выполнения большинства таких задач, однако предоставляют инструменты для дальнейших исследований.