Почему LLM не хватает памяти GPU | Разбор ошибки CUDA OOM
Ankit Wahane
0:00 / 0:00
Почему LLM не хватает памяти GPU | Разбор ошибки CUDA OOM
124 просмотра · 1 мес. назад
Ankit Wahane
49 подписчиков
124 просмотра · 1 мес. назад
Ошибка "CUDA out of memory" сообщает о том, что ваша видеокарта заполнена. Она не объясняет причину.
В этом видео мы диагностируем четыре различные причины ошибки "CUDA GPU OOM" в LLM: веса модели, кэш ключ-значение, активации и полное состояние обучения.
Разделы:
00:00 Ошибка CUDA OOM — это не диагноз
00:35 4 подозреваемых в проблемах с памятью GPU
02:09 Случай 1: Ошибка OOM весов модели
03:22 Решение: Квантование
04:35 Случай 2: Ошибка OOM кэша ключ-значение
07:02 От вывода к обучению
07:19 Случай 3: Ошибка OOM памяти активации
09:33 Случай 4: Ошибка OOM при обучении с полным набором параметров
11:03 PEFT, QLoRA, FSDP и ZeRO
11:47 4 причины ошибки OOM, 4 разных способа её исправления
12:13 Как диагностировать ошибку CUDA OOM
12:34 Что дальше
Используя Qwen2.5-7B на GPU T4 и A100, мы увидим, почему одна и та же ошибка CUDA OOM может потребовать совершенно разных решений, включая квантование, управление контекстом/параллелизмом, градиент Контрольные точки, PEFT/LoRA/QLoRA и шардинг.
В конце у вас появится простой вопрос для отладки сбоев памяти GPU:
Что изменилось непосредственно перед ошибкой нехватки памяти (OOM)?
Подписывайтесь, чтобы получать больше наглядных объяснений по инференции LLM, обучению, памяти GPU, тонкой настройке и производственным системам ИИ.
#LLM #CUDA #GPUMemory