Перейти к содержимому

Почему LLM не хватает памяти GPU | Разбор ошибки CUDA OOM

Ankit Wahane

0:00 / 0:00

Почему LLM не хватает памяти GPU | Разбор ошибки CUDA OOM

124 просмотра · 1 мес. назад
Ankit Wahane
49 подписчиков
124 просмотра · 1 мес. назад
Ошибка "CUDA out of memory" сообщает о том, что ваша видеокарта заполнена. Она не объясняет причину. В этом видео мы диагностируем четыре различные причины ошибки "CUDA GPU OOM" в LLM: веса модели, кэш ключ-значение, активации и полное состояние обучения. Разделы: 00:00 Ошибка CUDA OOM — это не диагноз 00:35 4 подозреваемых в проблемах с памятью GPU 02:09 Случай 1: Ошибка OOM весов модели 03:22 Решение: Квантование 04:35 Случай 2: Ошибка OOM кэша ключ-значение 07:02 От вывода к обучению 07:19 Случай 3: Ошибка OOM памяти активации 09:33 Случай 4: Ошибка OOM при обучении с полным набором параметров 11:03 PEFT, QLoRA, FSDP и ZeRO 11:47 4 причины ошибки OOM, 4 разных способа её исправления 12:13 Как диагностировать ошибку CUDA OOM 12:34 Что дальше Используя Qwen2.5-7B на GPU T4 и A100, мы увидим, почему одна и та же ошибка CUDA OOM может потребовать совершенно разных решений, включая квантование, управление контекстом/параллелизмом, градиент Контрольные точки, PEFT/LoRA/QLoRA и шардинг. В конце у вас появится простой вопрос для отладки сбоев памяти GPU: Что изменилось непосредственно перед ошибкой нехватки памяти (OOM)? Подписывайтесь, чтобы получать больше наглядных объяснений по инференции LLM, обучению, памяти GPU, тонкой настройке и производственным системам ИИ. #LLM #CUDA #GPUMemory