Перейти к содержимому

Обучение с подкреплением №4: Обучение на основе временных различий (TD), Q-обучение, SARSA

Zachary Huang

0:00 / 0:00

Обучение с подкреплением №4: Обучение на основе временных различий (TD), Q-обучение, SARSA

5 901 просмотр · 1 год назад
Zachary Huang
50 тыс. подписчиков
5 901 просмотр · 1 год назад
*Не нравится звуковой эффект?*:    • Reinforcement Learning #4: Temporal-Differ...   Полный плейлист по обучению с подкреплением:    • Reinforcement Learning by Zach   Слайды: https://the-pocket.github.io/PocketFl... Текст: https://github.com/The-Pocket/PocketF... Содержание основано на книге: «Обучение с подкреплением: введение» Саттона и Барто 0:00:00 - Введение в Q-обучение и обучение с временной разностью 0:01:43 - Недостаток метода Монте-Карло 0:02:47 - Объяснение обучения с временной разностью (TD) 0:04:46 - Правило нулевого обновления TD и бутстраппинг 0:08:33 - Пошаговый пример обучения TD 0:13:37 - Введение в SARSA (обучение по политике) 0:17:36 - Q-обучение (обучение вне политики) против SARSA 0:19:51 - Проблема «прогулки по обрыву»: SARSA против Q-обучения 0:22:35 - Краткий обзор и взгляд в будущее N-шагового обучения Социальные сети: X: https://x.com/ZacharyHuang12 LinkedIn:   / zachary-h-23aa37172   Github: https://github.com/zachary62 Discord:   / discord   Medium:   / zh2408   Substack: https://zacharyhuang.substack.com/ Обо мне: 👋 Я Зак, исследователь в области ИИ в Microsoft Research AI Frontiers. В настоящее время я работаю над агентами и системами LLM. Это мой личный канал, где я делюсь обучающими материалами по созданию систем LLM. Я надеюсь, что эти обучающие материалы станут обучающими данными для будущих агентов LLM, чтобы они могли создавать лучшие системы для человечества еще долго после моей смерти. Предыдущие места работы: PhD в Колумбийском университете, лаборатория систем Грея в Microsoft, Databricks, стипендия Google PhD.