Обучение длиною в жизнь: почему обратного распространения ошибки недостаточно
Edan Meyer
0:00 / 0:00
Обучение длиною в жизнь: почему обратного распространения ошибки недостаточно
20 137 просмотров · 4 года назад
Edan Meyer
80,3 тыс. подписчиков
20 137 просмотров · 4 года назад
#ai #ml
Непрерывное обучение, или обучение на протяжении всей жизни, становится все более популярным в машинном обучении (ML). В этой новой исследовательской работе рассматривается затухание пластичности и то, как обычное обратное распространение ошибки недостаточно для непрерывного обучения. Присущее многим задачам, особенно в обучении с подкреплением (RL), свойство нестационарности затрудняет обучение. В качестве решения этой проблемы предлагается непрерывное обратное распространение ошибки (CBP).
План:
0:00 - Обзор
2:00 - Введение в статью
2:53 - Проблемы и среды
8:11 - Эксперименты по затуханию пластичности
11:45 - Объяснение непрерывного обратного распространения ошибки
15:54 - Эксперименты с непрерывным обратным распространением ошибки
22:00 - Дополнительные интересные эксперименты
25:34 - Резюме
Источник статьи: https://arxiv.org/abs/2108.06325
Аннотация:
Алгоритм обратного распространения ошибки для обучения в нейронных сетях использует два механизма: во-первых, стохастический градиентный спуск, и во-вторых, инициализацию с помощью небольших случайных весов, причем последний необходим для эффективности первого. Мы показываем, что в условиях непрерывного обучения алгоритм обратного распространения ошибки показывает хорошие результаты на начальном этапе, но со временем его производительность снижается. Стохастического градиентного спуска недостаточно для непрерывного обучения; начальная случайность позволяет только начать обучение, но не обеспечивает непрерывное обучение. Насколько нам известно, наш результат является первым, демонстрирующим такое ухудшение способности алгоритма обратного распространения ошибки к обучению. Для решения этой проблемы мы предлагаем алгоритм, который непрерывно вводит случайные признаки наряду с градиентным спуском, используя новый процесс генерации и проверки. Мы называем его алгоритмом непрерывного обратного распространения ошибки. Мы показываем, что, в отличие от обычного обратного распространения ошибки, алгоритм непрерывного обратного распространения ошибки способен непрерывно адаптироваться как в задачах обучения с учителем, так и в задачах обучения с подкреплением. Мы ожидаем, что по мере того, как непрерывное обучение будет становиться все более распространенным в будущих приложениях, такой метод, как алгоритм непрерывного обратного распространения ошибки, станет необходимым там, где преимущества случайной инициализации сохраняются на протяжении всего обучения.