Перейти к содержимому

[DDQN] Глубокое обучение с подкреплением с использованием алгоритма Double Q-learning | Основы TDLS

Build w Agents - Aggregate Intellect - AI.SCIENCE

0:00 / 0:00

[DDQN] Глубокое обучение с подкреплением с использованием алгоритма Double Q-learning | Основы TDLS

7 878 просмотров · Трансляция закончилась 7 лет назад
Build w Agents - Aggregate Intellect - AI.SCIENCE
23 тыс. подписчиков
7 878 просмотров · Трансляция закончилась 7 лет назад
Серия конференций по глубокому обучению в Торонто — Базовый раздел https://tdls.a-i.science/events/2019-... Глубокое обучение с подкреплением с использованием алгоритма Double Q-learning «Известно, что популярный алгоритм Q-learning переоценивает значения действий при определенных условиях. Ранее не было известно, являются ли такие переоценки распространенными на практике, вредят ли они производительности и можно ли их предотвратить. В этой статье мы отвечаем на все эти вопросы утвердительно. В частности, мы сначала показываем, что недавно разработанный алгоритм DQN, который сочетает Q-learning с глубокой нейронной сетью, страдает от существенных переоценок в некоторых играх в области Atari 2600. Затем мы показываем, что идея, лежащая в основе алгоритма Double Q-learning, который был представлен в табличной постановке, может быть обобщена для работы с крупномасштабной аппроксимацией функций. Мы предлагаем специфическую адаптацию алгоритма DQN и показываем, что полученный алгоритм не только уменьшает наблюдаемые переоценки, но и выдвинута гипотеза, но это также приводит к значительному улучшению результатов в ряде игр.