Обучение со смешанной точностью — объясняем
DataMListic
0:00 / 0:00
Обучение со смешанной точностью — объясняем
972 просмотра · 7 часов назад
DataMListic
74,3 тыс. подписчиков
972 просмотра · 7 часов назад
Современные графические процессоры умножают шестнадцатибитные числа в несколько раз быстрее, чем
тридцатидвухбитные числа, с которыми сеть обучается по умолчанию, но переключение
всех данных на шестнадцатибитные приводит к сбоям в обучении двумя отдельными, специфическими способами.
Мы показываем, почему именно: градиенты, достаточно малые, чтобы доходить до нуля,
и обновления, слишком мелкозернистые, чтобы совпадать с гораздо большим весом.
Обучение со смешанной точностью исправляет обе проблемы без потери скорости, используя
тридцатидвухбитную эталонную копию каждого веса и масштабирование функции потерь, которое сдвигает
крошечные градиенты в допустимый диапазон до того, как они округятся — восстанавливая
точность обучения с полной точностью за гораздо меньшую стоимость.
Похожие видео
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
Flash Attention запускает Softmax по одному тайлу за раз: • Flash Attention Runs Softmax One Tile at a...
Непрерывная пакетная обработка — как серверы LLM поддерживают загрузку GPU: • Continuous Batching - How LLM Servers Keep...
Дистилляция знаний — объяснение: • Knowledge Distillation - Explained
Что на самом деле измеряет перплексия: • What Perplexity Actually Measures
Пакетная нормализация против нормализации слоев — объяснение: • Batch Norm vs Layer Norm - Explained
Оптимизатор Adam — это просто Momentum + RMSProp: • The Adam Optimizer is Just Momentum + RMSProp
Формы тензоров с многоголовочным вниманием: • Multi-Head Attention Tensor Shapes
Обратное распространение ошибки — это просто правило цепочки: • Backpropagation is Just the Chain Rule
Содержание
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
00:00 — Скорость, которую вы теряете
00:54 — Что на самом деле дает вам один бит
02:15 — Когда градиент просто исчезает
03:28 — Когда обновление просто пропадает
04:29 — Вторая копия, которая никогда не Сжатие
05:35 - Перемещение числа перед округлением
07:08 - Выбор правильного множителя
08:14 - Та же проблема, еще одно место
09:16 - Точность как ресурс, а не как регулятор
Подписывайтесь на меня
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
🐦 X: @datamlistic https://x.com/datamlistic
📸 Instagram: @datamlistic / datamlistic
📱 TikTok: @datamlistic / datamlistic
👔 Linkedin: / datamlistic
Поддержка канала
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
Лучший способ поддержать канал — поделиться контентом. ;)
Если вы также хотите поддержать канал финансово, пожертвование в размере стоимости чашки кофе всегда приветствуется! (полностью необязательно и добровольно)
► Patreon: / datamlistic
► Bitcoin (BTC): 3C6Pkzyb5CjAUYrJxmpCaaNPVRgRVxxyTq
► Ethereum (ETH): 0x9Ac4eB94386C3e02b96599C05B7a8C71773c9281
► Cardano (ADA): addr1v95rfxlslfzkvd8sr3exkh7st4qmgj4ywf5zcaxgqgdyunsj5juw5
► Tether (USDT): 0xeC261d9b2EE4B6997a6a424067af165BAA4afE1a
#machinelearning #deeplearning #gpu