В 2017 году исследователи OpenAI представили алгоритмLOLA (Learning with Opponent-Learning Awareness), который изменил представление о том, как агенты ИИ могут обучаться в многоагентной среде. В отличие от традиционных методов, где каждое агентство действует независимо, LOLA учитывает обучение других агентов, что позволяет формировать кооперативные стратегии, такие как «око за око» в итерационной дилемме заключённого.
Разработка этого алгоритма стала возможной благодаря усилиям команды из шести учёных, включая Якоба Фёрстера и Питера Аббила. Они предложили метод, с помощью которого каждый агент обновляет свои параметры, принимая во внимание, как его обучение повлияет на будущее обучение оппонента.
Развитие и критика: COLA
В 2022 году появился новый алгоритм, COLA (Consistent Learning with Opponent-Learning Awareness), который стремился устранить некоторые недостатки LOLA. Исходный алгоритм предполагал, что другие агенты являются «наивными», что приводило к нестабильным точкам равновесия. COLA ввёл последовательные функции обновления, которые обеспечивают стабильность и корректность в ситуациях взаимного обучения.
COLA продемонстрировал более стабильные результаты в играх с общими интересами, таких как "Stag Hunt", благодаря своей способности находить просоциальные решения и сходиться при различных темпах обучения.
Проксимальные улучшения: POLA
Последний этап развития этой концепции — алгоритм POLA (Proximal Learning with Opponent-Learning Awareness), представленный в июне 2026 года. POLA предлагает критически важные улучшения, устраняя нестабильности, возникающие при использовании нейросетевых политик. Этот алгоритм вводит меры дивергенции, чтобы предотвратить несоответствия, и демонстрирует более надёжное кооперативное поведение в различных сценариях.
Масштабные эксперименты и новые вызовы
В феврале 2026 года были проведены масштабные эксперименты, включающие до 200 000 агентов в играх типа "Hawk-Dove" и "Rock-Paper-Scissors". Эти исследования выявили неожиданные результаты, такие как преобладание стратегии «Hawk» в 70% случаев. Такие находки подчёркивают необходимость дальнейших исследований, чтобы улучшить стабильность и эффективность многоагентного обучения.
Частые вопросы
Что такое LOLA?
LOLA — это алгоритм, который учитывает, что другие агенты тоже обучаются, и использует это для формирования кооперативных стратегий.
Как COLA улучшает LOLA?
COLA устраняет нестабильности в исходном алгоритме, обеспечивая более стабильное и корректное обучение агентов.
Что сделано в POLA?
POLA улучшает стабильность обучения при использовании нейросетевых политик, предлагая проксимальное приближение и меры дивергенции.
Какие проблемы выявлены в экспериментах?
Масштабные исследования показали неожиданные динамики, такие как неоптимальные стратегии в некоторых играх, что требует дальнейших исследований.