Методика Random Network Distillation (RND) впервые позволила агентам превзойти человеческие результаты в игре Montezuma’s Revenge благодаря внутренней мотивации.
Кратко:
- ●RND использует предсказательную ошибку для внутренней награды
- ●Агент превзошёл результаты человека в Montezuma’s Revenge
- ●Современные методы улучшают и адаптируют RND
- ●RND остаётся основой для новых алгоритмов
Исторический обзор и достижения RND
В 2018 году методика Random Network Distillation (RND) стала сенсацией в мире машинного обучения. Этот подход позволил агентам превзойти средние человеческие результаты в игре Montezuma’s Revenge. Агент, обученный с использованием RND, последовательно посещал до 22 комнат и даже завершил первый уровень с максимальным счётом 17,500 очков, в то время как средний человеческий результат составлял около 4,700 очков.
Принцип работы RND
Суть RND заключается в сравнении предсказаний между двумя нейросетями: фиксированной, случайно инициализированной сетью и обучаемой предсказательной сетью. Внутренняя награда формируется на основе ошибки предсказания выходов целевой сети. Чем меньше агенту знакомо состояние, тем выше ошибка и, соответственно, внутренняя награда. Важным преимуществом этого метода является устойчивость к проблеме "шумного ТВ", поскольку ошибка вызвана новизной, а не случайностью.