Перейти к содержимому

Обучение длиною в жизнь: почему обратного распространения ошибки недостаточно

Edan Meyer

0:00 / 0:00

Обучение длиною в жизнь: почему обратного распространения ошибки недостаточно

20 137 просмотров · 4 года назад
Edan Meyer
80,3 тыс. подписчиков
20 137 просмотров · 4 года назад
#ai #ml Непрерывное обучение, или обучение на протяжении всей жизни, становится все более популярным в машинном обучении (ML). В этой новой исследовательской работе рассматривается затухание пластичности и то, как обычное обратное распространение ошибки недостаточно для непрерывного обучения. Присущее многим задачам, особенно в обучении с подкреплением (RL), свойство нестационарности затрудняет обучение. В качестве решения этой проблемы предлагается непрерывное обратное распространение ошибки (CBP). План: 0:00 - Обзор 2:00 - Введение в статью 2:53 - Проблемы и среды 8:11 - Эксперименты по затуханию пластичности 11:45 - Объяснение непрерывного обратного распространения ошибки 15:54 - Эксперименты с непрерывным обратным распространением ошибки 22:00 - Дополнительные интересные эксперименты 25:34 - Резюме Источник статьи: https://arxiv.org/abs/2108.06325 Аннотация: Алгоритм обратного распространения ошибки для обучения в нейронных сетях использует два механизма: во-первых, стохастический градиентный спуск, и во-вторых, инициализацию с помощью небольших случайных весов, причем последний необходим для эффективности первого. Мы показываем, что в условиях непрерывного обучения алгоритм обратного распространения ошибки показывает хорошие результаты на начальном этапе, но со временем его производительность снижается. Стохастического градиентного спуска недостаточно для непрерывного обучения; начальная случайность позволяет только начать обучение, но не обеспечивает непрерывное обучение. Насколько нам известно, наш результат является первым, демонстрирующим такое ухудшение способности алгоритма обратного распространения ошибки к обучению. Для решения этой проблемы мы предлагаем алгоритм, который непрерывно вводит случайные признаки наряду с градиентным спуском, используя новый процесс генерации и проверки. Мы называем его алгоритмом непрерывного обратного распространения ошибки. Мы показываем, что, в отличие от обычного обратного распространения ошибки, алгоритм непрерывного обратного распространения ошибки способен непрерывно адаптироваться как в задачах обучения с учителем, так и в задачах обучения с подкреплением. Мы ожидаем, что по мере того, как непрерывное обучение будет становиться все более распространенным в будущих приложениях, такой метод, как алгоритм непрерывного обратного распространения ошибки, станет необходимым там, где преимущества случайной инициализации сохраняются на протяжении всего обучения.