ИТМО — 2026.09.21 — Основы нейронных сетей, backprop, стохастический градиентный спуск
Sergey Nikolenko
0:00 / 0:00
ИТМО — 2026.09.21 — Основы нейронных сетей, backprop, стохастический градиентный спуск
817 просмотров · 7 дней назад
Sergey Nikolenko
5,77 тыс. подписчиков
817 просмотров · 7 дней назад
Это лекция из курса "Глубокое обучение", который читается в Университете ИТМО осенью 2026 года. Все материалы этой и других лекций курса (слайды, доска, ноутбуки с кодом) размещены по адресу:
https://www.sergeynikolenko.ru/course...
Подписывайтесь на мой телеграм-канал "Sineкура":
https://t.me/sinecor
Разделы:
0:00 Нейронные сети как графы вычислений
10:52 Перцептрон и функции активации
18:49 Сигмоида, tanh и насыщение
23:27 ReLU, Leaky ReLU и связь с биологией
32:03 Поиск активаций: Swish, Mish, GELU и SwiGLU
42:30 Зачем нужен backpropagation
48:32 Прямой проход и производные на примере
57:36 Обратное распространение ошибки на доске
1:07:42 Автоматическое дифференцирование и PyTorch
1:11:40 Почему градиентный спуск, а не метод Ньютона
1:17:32 Мини-батчи и стохастическая оптимизация
1:25:50 Короткая история backpropagation
1:27:50 Перерыв
1:28:17 Скорость обучения и поиск шага
1:35:53 Сходимость SGD и уменьшение шага
1:44:06 Разный масштаб координат: пример в notebook
1:54:48 Momentum и экспоненциальное скользящее среднее
2:05:40 Момент Нестерова и адаптивные методы
2:08:24 AdaGrad, RMSProp и Adadelta
2:15:25 Adam: сглаживание градиентов
2:17:30 Weight decay, L2-регуляризация и AdamW
2:24:11 Super-Convergence и AMSGrad: теория и практика
2:29:29 Вопросы: память оптимизатора и локальные минимумы
2:39:33 Регуляризация и dropout
2:46:54 Почему dropout помогает: признаки и ансамбли
2:53:43 Dropout, эволюция и стохастические нейроны
2:58:55 Байесовский взгляд и связь с нормализацией
3:01:39 Вопросы: доля dropout и grokking