Перейти к содержимому

Запустить LLM на DGX Spark «из коробки» просто! Ну, почти.

RulesOfAI

0:00 / 0:00

Запустить LLM на DGX Spark «из коробки» просто! Ну, почти.

387 просмотров · 1 месяц назад
RulesOfAI
29 подписчиков
387 просмотров · 1 месяц назад
Настройка NVIDIA DGX Spark может вызвать ошибку сокета Docker из-за некорректной базы данных buildkit. Для решения этой проблемы требуется обходной путь из пяти команд для восстановления служб контейнера. После настройки запуск модели Qwen 3.8 27B в нативном режиме BF16 изначально обеспечивает около 5 токенов в секунду из-за ограничений пропускной способности аппаратной памяти. Включение спекулятивного декодирования MTP увеличивает пропускную способность примерно до 10 токенов в секунду непосредственно в модели, повышая скорость вывода без необходимости использования отдельной модели-кандидата. 00:00 Вступление 00:45 Первый взгляд на DGX Spark 02:35 Настройка vLLM 05:00 Docker не запускается 07:10 Исправление BuildKit 09:00 Запуск Qwen 3.8-27B 12:05 Загрузка модели 15:40 Первый тест вывода 17:10 Включение MTP 19:20 Производительность MTP 20:25 Итоговые результаты Полезные URL-адреса: Официальные инструкции по запуску LLM: https://build.nvidia.com/spark/vllm/i... Предложенное на форуме решение проблемы с BuildKit: https://forums.developer.nvidia.com/t... Рецепт vLLM для Qwen 3.8 27B BF16: https://recipes.vllm.ai/Qwen/Qwen3.8-27B Карточка модели Huggingface для Qwen 3.8 27B: https://huggingface.co/Qwen/Qwen3.8-27B