Перейти к содержимому

Обучение со смешанной точностью — объясняем

DataMListic

0:00 / 0:00

Обучение со смешанной точностью — объясняем

972 просмотра · 7 часов назад
DataMListic
74,3 тыс. подписчиков
972 просмотра · 7 часов назад
Современные графические процессоры умножают шестнадцатибитные числа в несколько раз быстрее, чем тридцатидвухбитные числа, с которыми сеть обучается по умолчанию, но переключение всех данных на шестнадцатибитные приводит к сбоям в обучении двумя отдельными, специфическими способами. Мы показываем, почему именно: градиенты, достаточно малые, чтобы доходить до нуля, и обновления, слишком мелкозернистые, чтобы совпадать с гораздо большим весом. Обучение со смешанной точностью исправляет обе проблемы без потери скорости, используя тридцатидвухбитную эталонную копию каждого веса и масштабирование функции потерь, которое сдвигает крошечные градиенты в допустимый диапазон до того, как они округятся — восстанавливая точность обучения с полной точностью за гораздо меньшую стоимость. Похожие видео ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ Flash Attention запускает Softmax по одному тайлу за раз:    • Flash Attention Runs Softmax One Tile at a...   Непрерывная пакетная обработка — как серверы LLM поддерживают загрузку GPU:    • Continuous Batching - How LLM Servers Keep...   Дистилляция знаний — объяснение:    • Knowledge Distillation - Explained   Что на самом деле измеряет перплексия:    • What Perplexity Actually Measures   Пакетная нормализация против нормализации слоев — объяснение:    • Batch Norm vs Layer Norm - Explained   Оптимизатор Adam — это просто Momentum + RMSProp:    • The Adam Optimizer is Just Momentum + RMSProp   Формы тензоров с многоголовочным вниманием:    • Multi-Head Attention Tensor Shapes   Обратное распространение ошибки — это просто правило цепочки:    • Backpropagation is Just the Chain Rule   Содержание ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ 00:00 — Скорость, которую вы теряете 00:54 — Что на самом деле дает вам один бит 02:15 — Когда градиент просто исчезает 03:28 — Когда обновление просто пропадает 04:29 — Вторая копия, которая никогда не Сжатие 05:35 - Перемещение числа перед округлением 07:08 - Выбор правильного множителя 08:14 - Та же проблема, еще одно место 09:16 - Точность как ресурс, а не как регулятор Подписывайтесь на меня ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ 🐦 X: @datamlistic https://x.com/datamlistic 📸 Instagram: @datamlistic   / datamlistic   📱 TikTok: @datamlistic   / datamlistic   👔 Linkedin:   / datamlistic   Поддержка канала ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ Лучший способ поддержать канал — поделиться контентом. ;) Если вы также хотите поддержать канал финансово, пожертвование в размере стоимости чашки кофе всегда приветствуется! (полностью необязательно и добровольно) ► Patreon:   / datamlistic   ► Bitcoin (BTC): 3C6Pkzyb5CjAUYrJxmpCaaNPVRgRVxxyTq ► Ethereum (ETH): 0x9Ac4eB94386C3e02b96599C05B7a8C71773c9281 ► Cardano (ADA): addr1v95rfxlslfzkvd8sr3exkh7st4qmgj4ywf5zcaxgqgdyunsj5juw5 ► Tether (USDT): 0xeC261d9b2EE4B6997a6a424067af165BAA4afE1a #machinelearning #deeplearning #gpu