RL 5: Марковский процесс принятия решений — MDP | Обучение с подкреплением
AI Insights - Rituraj Kaushik
0:00 / 0:00
RL 5: Марковский процесс принятия решений — MDP | Обучение с подкреплением
91 925 просмотров · 7 лет назад
AI Insights - Rituraj Kaushik
3,36 тыс. подписчиков
91 925 просмотров · 7 лет назад
Марковский процесс принятия решений (MDP) — это способ формализации процесса принятия последовательных решений. Таким образом, мы можем формализовать задачу обучения с подкреплением с помощью конечного марковского процесса принятия решений. Марковский процесс принятия решений состоит из 5 компонентов: агент, окружающая среда, состояния, действия и вознаграждения. Агент совершает действие в окружающей среде на основе текущего состояния окружающей среды. После каждого действия окружающая среда переходит в другое состояние. Агент получает вознаграждение за свое действие в предыдущем состоянии. Цель агента — максимизировать общее вознаграждение, полученное им за эпизод или определенное количество шагов.
Серия обучающих материалов по обучению с подкреплением:
1. Многорукие бандиты: • RL 1: Multi-armed Bandits 1
2. Многорукие бандиты — оценка ценности действий: • RL 2: Multi-Armed Bandits 2 - Action value...
3. Верхняя граница доверия: • RL 3: Upper confidence bound (UCB) to solv...
4. Выборка Томпсона: • RL 4: Thompson Sampling - Multi-armed bandits
5. Марковский процесс принятия решений — MDP: • RL 5: Markov Decision Process - MDP | Rein...
6. Итерация политики и итерация ценности: • RL 6: Policy iteration and value iteration...