Агенты в игре прятки освоили использование инструментов, развивая сложные стратегии. Это демонстрирует потенциал мультиагентных систем и самообучения.
Кратко:
- ●Агенты в игре прятки развивают шесть стратегий
- ●Сложные стратегии появляются через автокуррикулум
- ●Обучение охватывает 500 млн игр
- ●Исследование показывает потенциал мультиагентных систем
Исследование OpenAI 2019 года показало, что в простой игре прятки агенты могут развивать сложные стратегии использования инструментов. Это открытие стало возможным благодаря мультиагентной конкуренции и скрытому обучению, которое позволило агентам пройти через шесть последовательных фаз эмергентных стратегий.
Шесть фаз стратегий
Агенты начинали с простого бега и преследования, но быстро освоили более сложные техники, такие как строительство убежищ и использование пандусов. В итоге, они развили способность к «сёрфингу по ящикам» и защите от подобных манёвров других агентов.