Перейти к содержимому

ИТМО — 2026.09.21 — Основы нейронных сетей, backprop, стохастический градиентный спуск

Sergey Nikolenko

0:00 / 0:00

ИТМО — 2026.09.21 — Основы нейронных сетей, backprop, стохастический градиентный спуск

817 просмотров · 7 дней назад
Sergey Nikolenko
5,77 тыс. подписчиков
817 просмотров · 7 дней назад
Это лекция из курса "Глубокое обучение", который читается в Университете ИТМО осенью 2026 года. Все материалы этой и других лекций курса (слайды, доска, ноутбуки с кодом) размещены по адресу: https://www.sergeynikolenko.ru/course... Подписывайтесь на мой телеграм-канал "Sineкура": https://t.me/sinecor Разделы: 0:00 Нейронные сети как графы вычислений 10:52 Перцептрон и функции активации 18:49 Сигмоида, tanh и насыщение 23:27 ReLU, Leaky ReLU и связь с биологией 32:03 Поиск активаций: Swish, Mish, GELU и SwiGLU 42:30 Зачем нужен backpropagation 48:32 Прямой проход и производные на примере 57:36 Обратное распространение ошибки на доске 1:07:42 Автоматическое дифференцирование и PyTorch 1:11:40 Почему градиентный спуск, а не метод Ньютона 1:17:32 Мини-батчи и стохастическая оптимизация 1:25:50 Короткая история backpropagation 1:27:50 Перерыв 1:28:17 Скорость обучения и поиск шага 1:35:53 Сходимость SGD и уменьшение шага 1:44:06 Разный масштаб координат: пример в notebook 1:54:48 Momentum и экспоненциальное скользящее среднее 2:05:40 Момент Нестерова и адаптивные методы 2:08:24 AdaGrad, RMSProp и Adadelta 2:15:25 Adam: сглаживание градиентов 2:17:30 Weight decay, L2-регуляризация и AdamW 2:24:11 Super-Convergence и AMSGrad: теория и практика 2:29:29 Вопросы: память оптимизатора и локальные минимумы 2:39:33 Регуляризация и dropout 2:46:54 Почему dropout помогает: признаки и ансамбли 2:53:43 Dropout, эволюция и стохастические нейроны 2:58:55 Байесовский взгляд и связь с нормализацией 3:01:39 Вопросы: доля dropout и grokking