Перейти к содержимому

RL 5: Марковский процесс принятия решений — MDP | Обучение с подкреплением

AI Insights - Rituraj Kaushik

0:00 / 0:00

RL 5: Марковский процесс принятия решений — MDP | Обучение с подкреплением

91 925 просмотров · 7 лет назад
AI Insights - Rituraj Kaushik
3,36 тыс. подписчиков
91 925 просмотров · 7 лет назад
Марковский процесс принятия решений (MDP) — это способ формализации процесса принятия последовательных решений. Таким образом, мы можем формализовать задачу обучения с подкреплением с помощью конечного марковского процесса принятия решений. Марковский процесс принятия решений состоит из 5 компонентов: агент, окружающая среда, состояния, действия и вознаграждения. Агент совершает действие в окружающей среде на основе текущего состояния окружающей среды. После каждого действия окружающая среда переходит в другое состояние. Агент получает вознаграждение за свое действие в предыдущем состоянии. Цель агента — максимизировать общее вознаграждение, полученное им за эпизод или определенное количество шагов. Серия обучающих материалов по обучению с подкреплением: 1. Многорукие бандиты:    • RL 1: Multi-armed Bandits 1   2. Многорукие бандиты — оценка ценности действий:    • RL 2: Multi-Armed Bandits 2 - Action value...   3. Верхняя граница доверия:    • RL 3: Upper confidence bound (UCB) to solv...   4. Выборка Томпсона:    • RL 4: Thompson Sampling - Multi-armed bandits   5. Марковский процесс принятия решений — MDP:    • RL 5: Markov Decision Process - MDP | Rein...   6. Итерация политики и итерация ценности:    • RL 6: Policy iteration and value iteration...