Запустить LLM на DGX Spark «из коробки» просто! Ну, почти.
RulesOfAI
0:00 / 0:00
Запустить LLM на DGX Spark «из коробки» просто! Ну, почти.
387 просмотров · 1 месяц назад
RulesOfAI
29 подписчиков
387 просмотров · 1 месяц назад
Настройка NVIDIA DGX Spark может вызвать ошибку сокета Docker из-за некорректной базы данных buildkit. Для решения этой проблемы требуется обходной путь из пяти команд для восстановления служб контейнера.
После настройки запуск модели Qwen 3.8 27B в нативном режиме BF16 изначально обеспечивает около 5 токенов в секунду из-за ограничений пропускной способности аппаратной памяти. Включение спекулятивного декодирования MTP увеличивает пропускную способность примерно до 10 токенов в секунду непосредственно в модели, повышая скорость вывода без необходимости использования отдельной модели-кандидата.
00:00 Вступление
00:45 Первый взгляд на DGX Spark
02:35 Настройка vLLM
05:00 Docker не запускается
07:10 Исправление BuildKit
09:00 Запуск Qwen 3.8-27B
12:05 Загрузка модели
15:40 Первый тест вывода
17:10 Включение MTP
19:20 Производительность MTP
20:25 Итоговые результаты
Полезные URL-адреса:
Официальные инструкции по запуску LLM: https://build.nvidia.com/spark/vllm/i...
Предложенное на форуме решение проблемы с BuildKit:
https://forums.developer.nvidia.com/t...
Рецепт vLLM для Qwen 3.8 27B BF16: https://recipes.vllm.ai/Qwen/Qwen3.8-27B
Карточка модели Huggingface для Qwen 3.8 27B: https://huggingface.co/Qwen/Qwen3.8-27B