Обучение с подкреплением №4: Обучение на основе временных различий (TD), Q-обучение, SARSA
Zachary Huang
0:00 / 0:00
Обучение с подкреплением №4: Обучение на основе временных различий (TD), Q-обучение, SARSA
5 901 просмотр · 1 год назад
Zachary Huang
50 тыс. подписчиков
5 901 просмотр · 1 год назад
*Не нравится звуковой эффект?*: • Reinforcement Learning #4: Temporal-Differ...
Полный плейлист по обучению с подкреплением: • Reinforcement Learning by Zach
Слайды: https://the-pocket.github.io/PocketFl...
Текст: https://github.com/The-Pocket/PocketF...
Содержание основано на книге: «Обучение с подкреплением: введение» Саттона и Барто
0:00:00 - Введение в Q-обучение и обучение с временной разностью
0:01:43 - Недостаток метода Монте-Карло
0:02:47 - Объяснение обучения с временной разностью (TD)
0:04:46 - Правило нулевого обновления TD и бутстраппинг
0:08:33 - Пошаговый пример обучения TD
0:13:37 - Введение в SARSA (обучение по политике)
0:17:36 - Q-обучение (обучение вне политики) против SARSA
0:19:51 - Проблема «прогулки по обрыву»: SARSA против Q-обучения
0:22:35 - Краткий обзор и взгляд в будущее N-шагового обучения
Социальные сети:
X: https://x.com/ZacharyHuang12
LinkedIn: / zachary-h-23aa37172
Github: https://github.com/zachary62
Discord: / discord
Medium: / zh2408
Substack: https://zacharyhuang.substack.com/
Обо мне:
👋 Я Зак, исследователь в области ИИ в Microsoft Research AI Frontiers. В настоящее время я работаю над агентами и системами LLM. Это мой личный канал, где я делюсь обучающими материалами по созданию систем LLM. Я надеюсь, что эти обучающие материалы станут обучающими данными для будущих агентов LLM, чтобы они могли создавать лучшие системы для человечества еще долго после моей смерти. Предыдущие места работы: PhD в Колумбийском университете, лаборатория систем Грея в Microsoft, Databricks, стипендия Google PhD.