Оптимизация GPT-OSS на NVIDIA DGX Spark: выжимаем максимум из вашей системы
LMSYS Org Official
0:00 / 0:00
Оптимизация GPT-OSS на NVIDIA DGX Spark: выжимаем максимум из вашей системы
11 240 просмотров · 10 месяцев назад
LMSYS Org Official
1,48 тыс. подписчиков
11 240 просмотров · 10 месяцев назад
Ознакомьтесь с соответствующей записью в блоге по адресу: https://lmsys.org/blog/2025-11-03-gpt...
LMRouter: https://github.com/LMRouter/lmrouter
В этом видео мы покажем вам, как запустить GPT-OSS 20B и 120B локально на NVIDIA DGX Spark с использованием SGLang, достигнув самой высокой производительности — до 70 токенов/с на 20B и 50 токенов/с на 120B. 🚀
Вы узнаете, как именно:
Настроить среду Spark и необходимые кодировки tiktoken
Запустить контейнеры Docker SGLang, оптимизированные для DGX Spark
Оценить скорость генерации токенов и загрузку графического процессора
Подключить Open WebUI для интерактивного чат-бота
Использовать LMRouter для объединения API в стиле OpenAI и Anthropic
Запустить код Claude полностью локально через SGLang + LMRouter
Это полное пошаговое руководство, от настройки до демонстрации, показывающее, как превратить ваш DGX Spark в мощную систему LLM с самостоятельным размещением, способную обслуживать модели с миллиардами параметров в режиме реального времени.
РАЗДЕЛЫ
0:00 - Введение
0:56 - Запуск SGLang с GPT-OSS
2:46 - Отправка запроса и тестирование производительности SGLang
3:37 - Использование Open WebUI с SGLang
5:33 - Использование кода Клода с LMRouter и SGLang
Авторы:
Сценарий, режиссура, озвучка и монтаж: Джерри Чжоу (@yvbbrjdr, https://x.com/yvbbrjdr)
#NVIDIA #DGXSpark #Blackwell #SGLang #AIInference #LocalAI #LLMServing #SparkSomethingBig