Перейти к содержимому

Двойной спуск, широкие минимумы и стохастический градиентный спуск

Межкампусные семинары по компьютерным наукам

0:00 / 0:00

Двойной спуск, широкие минимумы и стохастический градиентный спуск

537 просмотров · 5 лет назад
Межкампусные семинары по компьютерным наукам
54 подписчика
537 просмотров · 5 лет назад
Феномен двойного спуска (Double Descent, DD) недавно стал особенно интригующим открытием в сообществе Deep Learning. В то время как в большинстве работ рассматривается более известный DD по размеру модели (тестовый риск против размера модели) как с эмпирической, так и с теоретической точек зрения, гораздо меньше внимания уделяется не менее загадочному эффекту DD по итерациям обучения (тестовый риск против количества эпох обучения). Еще одно интересное наблюдение, набирающее обороты в самых последних исследованиях, — это классический аргумент о «широких минимумах»: чем шире минимум, тем лучшую обобщающую способность он обеспечивает. В этом докладе мы попытаемся связать двойной спуск по эпохам с динамикой модели на поверхности функции потерь: модель претерпевает второй спуск тестового риска именно тогда, когда она движется из изначально обнаруженных узких нестабильных областей к широким хорошо обобщающим минимумам. Мы также рассмотрим неявную регуляризацию стохастического градиентного спуска (Stochastic Gradient Descent, SGD), помогающую нейронным сетям сходиться к подобным широким «однородным» оптимумам. Докладчик: Максим Кодрян (НИУ ВШЭ Москва).