OpenAI представила метод Evolved Policy Gradients для ускоренного обучения агентов, эволюционируя функцию потерь. Это позволяет адаптироваться к новым задачам.
Кратко:
- ●EPG эволюционирует функцию потерь вместо политики.
- ●Внутренний и внешний циклы обучения.
- ●Улучшение обобщающих способностей агентов.
- ●Ограниченная применимость для других задач.
Что такое Evolved Policy Gradients (EPG)
OpenAI представила Evolved Policy Gradients (EPG) в апреле 2018 года как экспериментальный подход к метаобучению. Основная идея заключается в том, чтобы эволюционировать функцию потерь агента, а не непосредственно его политику, что позволяет быстрее обучаться на новых задачах. Это достигается с помощью временных сверточных сетей, которые учитывают историю опыта агента.
Двухуровневый алгоритм EPG
EPG использует двухуровневый (bi-level) алгоритм. Внутренний цикл обучения предполагает, что агент обучается с нуля, минимизируя функцию потерь с помощью стохастического градиентного спуска (SGD). Внешний цикл оценивает награды, полученные после внутреннего обучения, и обновляет параметры функции потерь с помощью стратегий эволюции (Evolution Strategies, ES) для улучшения результатов.