Перейти к содержимому

Оптимизация GPT-OSS на NVIDIA DGX Spark: выжимаем максимум из вашей системы

LMSYS Org Official

0:00 / 0:00

Оптимизация GPT-OSS на NVIDIA DGX Spark: выжимаем максимум из вашей системы

11 240 просмотров · 10 месяцев назад
LMSYS Org Official
1,48 тыс. подписчиков
11 240 просмотров · 10 месяцев назад
Ознакомьтесь с соответствующей записью в блоге по адресу: https://lmsys.org/blog/2025-11-03-gpt... LMRouter: https://github.com/LMRouter/lmrouter В этом видео мы покажем вам, как запустить GPT-OSS 20B и 120B локально на NVIDIA DGX Spark с использованием SGLang, достигнув самой высокой производительности — до 70 токенов/с на 20B и 50 токенов/с на 120B. 🚀 Вы узнаете, как именно: Настроить среду Spark и необходимые кодировки tiktoken Запустить контейнеры Docker SGLang, оптимизированные для DGX Spark Оценить скорость генерации токенов и загрузку графического процессора Подключить Open WebUI для интерактивного чат-бота Использовать LMRouter для объединения API в стиле OpenAI и Anthropic Запустить код Claude полностью локально через SGLang + LMRouter Это полное пошаговое руководство, от настройки до демонстрации, показывающее, как превратить ваш DGX Spark в мощную систему LLM с самостоятельным размещением, способную обслуживать модели с миллиардами параметров в режиме реального времени. РАЗДЕЛЫ 0:00 - Введение 0:56 - Запуск SGLang с GPT-OSS 2:46 - Отправка запроса и тестирование производительности SGLang 3:37 - Использование Open WebUI с SGLang 5:33 - Использование кода Клода с LMRouter и SGLang Авторы: Сценарий, режиссура, озвучка и монтаж: Джерри Чжоу (@yvbbrjdr, https://x.com/yvbbrjdr) #NVIDIA #DGXSpark #Blackwell #SGLang #AIInference #LocalAI #LLMServing #SparkSomethingBig