[DDQN] Глубокое обучение с подкреплением с использованием алгоритма Double Q-learning | Основы TDLS
Build w Agents - Aggregate Intellect - AI.SCIENCE
0:00 / 0:00
[DDQN] Глубокое обучение с подкреплением с использованием алгоритма Double Q-learning | Основы TDLS
7 878 просмотров · Трансляция закончилась 7 лет назад
Build w Agents - Aggregate Intellect - AI.SCIENCE
23 тыс. подписчиков
7 878 просмотров · Трансляция закончилась 7 лет назад
Серия конференций по глубокому обучению в Торонто — Базовый раздел
https://tdls.a-i.science/events/2019-...
Глубокое обучение с подкреплением с использованием алгоритма Double Q-learning
«Известно, что популярный алгоритм Q-learning переоценивает значения действий при определенных условиях. Ранее не было известно, являются ли такие переоценки распространенными на практике, вредят ли они производительности и можно ли их предотвратить. В этой статье мы отвечаем на все эти вопросы утвердительно. В частности, мы сначала показываем, что недавно разработанный алгоритм DQN, который сочетает Q-learning с глубокой нейронной сетью, страдает от существенных переоценок в некоторых играх в области Atari 2600. Затем мы показываем, что идея, лежащая в основе алгоритма Double Q-learning, который был представлен в табличной постановке, может быть обобщена для работы с крупномасштабной аппроксимацией функций. Мы предлагаем специфическую адаптацию алгоритма DQN и показываем, что полученный алгоритм не только уменьшает наблюдаемые переоценки, но и выдвинута гипотеза, но это также приводит к значительному улучшению результатов в ряде игр.