Обучение с подкреплением, модель прогнозирующего управления и шаг Ньютона для решения уравнения Б...
Dimitri Bertsekas
0:00 / 0:00
Обучение с подкреплением, модель прогнозирующего управления и шаг Ньютона для решения уравнения Б...
9 591 просмотр · 1 год назад
Dimitri Bertsekas
7,91 тыс. подписчиков
9 591 просмотр · 1 год назад
Слайды доступны по ссылке: https://web.mit.edu/dimitrib/www/MPC....
Мы сосредоточимся на концептуальной основе, которая связывает приближенное динамическое программирование (ДП), модель прогнозирующего управления (МПУ) и обучение с подкреплением (ОБ). Эта основа базируется на двух алгоритмах, которые разработаны в значительной степени независимо друг от друга и работают в синергии благодаря мощному механизму метода Ньютона. Мы называем их алгоритмами офлайн-обучения и онлайн-игры. Названия заимствованы из некоторых крупных успехов ОБ в играх; основными примерами являются недавняя (2017 г.) программа AlphaZero (играющая в шахматы) и аналогично структурированная более ранняя (1990-е гг.) программа TD-Gammon (играющая в нарды). В контексте этих игр алгоритм офлайн-обучения используется для обучения программы оценке позиций и генерации удачных ходов в любой заданной позиции, в то время как алгоритм онлайн-игры используется для игры в реальном времени против людей или компьютеров.
Важно отметить, что синергия между офлайн-обучением и онлайн-игрой также лежит в основе MPC (а также других основных классов задач последовательного принятия решений), и действительно, архитектура проектирования MPC очень похожа на архитектуру AlphaZero и TD-Gammon. Это концептуальное понимание обеспечивает средство для преодоления культурного разрыва между RL и MPC и проливает новый свет на некоторые фундаментальные вопросы в MPC. К ним относятся улучшение свойств стабильности за счет развертывания, обработка неопределенности с помощью эквивалентности определенности, устойчивость MPC в адаптивных системах управления, включающих изменение параметров системы, и понимание, предоставляемое сверхлинейными границами производительности, подразумеваемыми методом Ньютона.
Мы обсуждаем контексты применения нашей структуры, включая архитектуру компьютерных шахмат на основе MPC.