Перейти к содержимому

Обратному распространению ошибки не нужно хранить всё

DataMListic

0:00 / 0:00

Обратному распространению ошибки не нужно хранить всё

183 просмотра · 3 часа назад
DataMListic
74,1 тыс. подписчиков
183 просмотра · 3 часа назад
Обратное распространение ошибки выглядит так, будто для его выполнения необходимо одновременно хранить в памяти все активации слоев, и для глубокой нейронной сети этот объем памяти может затмить сами веса. Но это не обязательно. Мы выясним, почему обратному проходу действительно необходимы эти числа, почему их наивный пересчет на самом деле хуже, и как создание контрольных точек только для нескольких слоев, расположенных через каждый квадратный корень из глубины, сокращает пиковые затраты памяти до доли от наивных затрат, при этом создавая точно такой же градиент — трюк, на котором основан цикл обучения каждой большой модели. Похожие видео ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ Обратное распространение ошибки — это просто правило цепочки:    • Backpropagation is Just the Chain Rule   Кэш ключ-значение — это просто мемоизация:    • The KV Cache Is Just Memoization   Flash Attention запускает Softmax по одному тайлу за раз:    • Flash Attention Runs Softmax One Tile at a...   Седловые точки — почему градиентный спуск не зависает:    • Saddle Points - Why Gradient Descent Doesn...   Многоголовочный механизм скрытого внимания (MLA) — объяснение:    • Multi-Head Latent Attention (MLA) - Explained   Стохастический градиентный спуск — объяснение:    • Stochastic Gradient Descent - Explained   Mamba против Transformers — модель селективного пространства состояний:    • Mamba vs Transformers - The Selective Stat...   Содержание ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ 00:00 — Стена памяти 00:55 — Что на самом деле читает обратное распространение ошибки 01:52 — Каждому градиенту нужно число для прямого распространения 03:03 — Наивная стоимость 03:51 — Две крайности, одна ужасная 04:53 — Пересчет по сегментам 05:57 - Нахождение оптимального решения 07:22 - Сто слоев, двадцать чисел 08:21 - Встроено в каждый фреймворк Подписывайтесь на меня ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ 🐦 X: @datamlistic https://x.com/datamlistic 📸 Instagram: @datamlistic   / datamlistic   📱 TikTok: @datamlistic   / datamlistic   👔 Linkedin:   / datamlistic   Канал Поддержка ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ Лучший способ поддержать канал — поделиться контентом. ;) Если вы также хотите поддержать канал финансово, пожертвование в размере стоимости чашки кофе всегда приветствуется! (полностью необязательно и добровольно) ► Patreon:   / datamlistic   ► Bitcoin (BTC): 3C6Pkzyb5CjAUYrJxmpCaaNPVRgRVxxyTq ► Ethereum (ETH): 0x9Ac4eB94386C3e02b96599C05B7a8C71773c9281 ► Cardano (ADA): addr1v95rfxlslfzkvd8sr3exkh7st4qmgj4ywf5zcaxgqgdyunsj5juw5 ► Tether (USDT): 0xeC261d9b2EE4B6997a6a424067af165BAA4afE1a #машинноеобучение #глубокоеобучение #обратное распространение #нейронные сети