OpenAI разработала нейронный теорем-прувер для Lean, решающий сложные задачи олимпиад AMC12 и AIME, а также адаптации задач IMO.
Кратко:
●OpenAI создала нейронный теорем-прувер для Lean.
●Система решает задачи олимпиад AMC12, AIME и IMO.
●Бенчмарк miniF2F показывает прогресс в формальной математике.
●Нейросети начинают уверенно решать олимпиадные задачи.
Нейронный теорем-прувер от OpenAI
В феврале 2022 года OpenAI представила нейронный теорем-прувер для Lean, который способен решать сложные задачи школьных олимпиад, такие как AMC12 и AIME, а также две задачи, адаптированные из Международной математической олимпиады (IMO). Этот инновационный подход основан на обучении через «statement curriculum learning», где модель постепенно обучается на более сложных задачах, начиная с простых.
Данный теорем-прувер показал новый рекорд на бенчмарке miniF2F, достигнув 41,2 % решённых задач, что значительно превышает предыдущий рекорд в 29,3 %. Подробнее о проекте OpenAI.
Значение бенчмарка miniF2F
Бенчмарк miniF2F представляет собой кросс-системный набор формализованных задач уровня олимпиад и школьных программ. Он включает 488 задач из AMC, AIME, IMO и других учебных материалов, и служит для стандартизованной оценки возможностей нейронных и автоматизированных доказателей.
В мае 2026 года была обновлена тестовая версия miniF2F, проверяющая весь процесс от неформулировки до автоформализации и доказательства.
Прорыв от DeepMind
В июле 2024 года DeepMind совершила прорыв с системой AlphaProof, которая достигла «серебряного медального» уровня на IMO, решив 4 из 6 задач и набрав 28 из 42 возможных очков. Этот результат был опубликован в журнале Nature в ноябре 2025 года.
Новые бенчмарки и модели
Весной 2025 года была представлена модель DeepSeek‑Prover‑V2‑671B, демонстрирующая впечатляющие результаты на задачах miniF2F‑test и других конкурсах. Она проходит 88,9 % задач и успешно справляется с задачами уровня AIME.
Кроме того, в 2026 году представлена модель OptProver, обученная на задачах оптимизации. Её высокие результаты на новом бенчмарке подтверждают эффективность использования трансферного обучения.
Перспективы и выводы
С момента разработки OpenAI нейрон-пруверы прошли долгий путь. От частичного решения школьных задач до почти полного соответствия уровню медалиста на IMO. Развитие бенчмарков как miniF2F и других способствует стандартизации и ускорению этого процесса.
Тренд на расширение диапазона задач, улучшение автоформализации и использование transfer learning между доменами открывает новые горизонты в формальной математике. Как это влияет на развитие ИИ.
Частые вопросы
Что такое нейронный теорем-прувер?
Это система на базе нейросети, способная автоматически доказывать математические теоремы.
Зачем нужны бенчмарки вроде miniF2F?
Они служат для стандартизованной оценки и сравнения возможностей различных систем доказательства.
Какие достижения у DeepMind в этой области?
Система AlphaProof достигла уровня медалиста на IMO, решив 4 из 6 задач.
Какие перспективы у нейросетей в олимпиадной математике?
Продолжается развитие в сторону расширения типов решаемых задач и улучшения методик обучения.