RL 6: Итерация стратегии и итерация ценности — Обучение с подкреплением
AI Insights - Rituraj Kaushik
0:00 / 0:00
RL 6: Итерация стратегии и итерация ценности — Обучение с подкреплением
61 629 просмотров · 7 лет назад
AI Insights - Rituraj Kaushik
3,35 тыс. подписчиков
61 629 просмотров · 7 лет назад
Итерация политики и итерация значений — это два очень интересных и важных алгоритма в обучении с подкреплением. Эти два алгоритма основаны на динамическом программировании и уравнении Беллмана. Алгоритмы итерации значений и итерации политики очень полезны для поиска оптимальной политики, когда агент обладает достаточной информацией о модели окружающей среды. В этом видео мы также поговорим об уравнении оптимальности Беллмана и оптимальной функции ценности в обучении с подкреплением.
Серия обучающих материалов по обучению с подкреплением:
1. Многорукие бандиты: • RL 1: Multi-armed Bandits 1
2. Многорукие бандиты — оценка ценности действий: • RL 2: Multi-Armed Bandits 2 - Action value...
3. Верхняя граница доверия: • RL 3: Upper confidence bound (UCB) to solv...
4. Выборка Томпсона: • RL 4: Thompson Sampling - Multi-armed bandits
5. Марковский процесс принятия решений — MDP: • RL 5: Markov Decision Process - MDP | Rein...
6. Итерация политики и итерация ценности: • RL 6: Policy iteration and value iteration...