Обратное обучение с подкреплением: простыми словами
Edan Meyer
0:00 / 0:00
Обратное обучение с подкреплением: простыми словами
14 459 просмотров · 5 лет назад
Edan Meyer
80,3 тыс. подписчиков
14 459 просмотров · 5 лет назад
Обратное обучение с подкреплением (Inverse Reinforcement Learning / IRL) — это тип обучения с подкреплением, в котором цель противоположна цели прямого обучения с подкреплением. Вместо обучения стратегии на основе функции вознаграждения, мы пытаемся изучить функцию вознаграждения на основе стратегии или демонстрации задачи. В этом видео я расскажу, почему следует использовать обратное обучение с подкреплением, почему следует использовать обратное обучение с подкреплением, приведу примеры IRL, немного теории и некоторые существующие методы IRL. Я рассмотрю одну из оригинальных статей Эндрю Нга, а также некоторые более новые работы по IRL с максимальной энтропией (MaxEnt IRL) и состязательному IRL.
Плейлист по теории обучения с подкреплением: • Intro to Reinforcement Learning Made Simple
Статья об алгоритмах обучения с подкреплением: https://ai.stanford.edu/~ang/papers/i...
Статья о методе максимального интеллекта в обучении с подкреплением: https://www.aaai.org/Papers/AAAI/2008...
Статья об обучении с подкреплением в условиях противостояния: https://arxiv.org/abs/1710.11248