Перейти к содержимому

RL 6: Итерация стратегии и итерация ценности — Обучение с подкреплением

AI Insights - Rituraj Kaushik

0:00 / 0:00

RL 6: Итерация стратегии и итерация ценности — Обучение с подкреплением

61 629 просмотров · 7 лет назад
AI Insights - Rituraj Kaushik
3,35 тыс. подписчиков
61 629 просмотров · 7 лет назад
Итерация политики и итерация значений — это два очень интересных и важных алгоритма в обучении с подкреплением. Эти два алгоритма основаны на динамическом программировании и уравнении Беллмана. Алгоритмы итерации значений и итерации политики очень полезны для поиска оптимальной политики, когда агент обладает достаточной информацией о модели окружающей среды. В этом видео мы также поговорим об уравнении оптимальности Беллмана и оптимальной функции ценности в обучении с подкреплением. Серия обучающих материалов по обучению с подкреплением: 1. Многорукие бандиты:    • RL 1: Multi-armed Bandits 1   2. Многорукие бандиты — оценка ценности действий:    • RL 2: Multi-Armed Bandits 2 - Action value...   3. Верхняя граница доверия:    • RL 3: Upper confidence bound (UCB) to solv...   4. Выборка Томпсона:    • RL 4: Thompson Sampling - Multi-armed bandits   5. Марковский процесс принятия решений — MDP:    • RL 5: Markov Decision Process - MDP | Rein...   6. Итерация политики и итерация ценности:    • RL 6: Policy iteration and value iteration...