TensorRT против vLLM на DGX Spark: почему одних только бенчмарков недостаточно.
Gepetto | Local AI Engineering
0:00 / 0:00
TensorRT против vLLM на DGX Spark: почему одних только бенчмарков недостаточно.
2 758 просмотров · 8 месяцев назад
Gepetto | Local AI Engineering
199 подписчиков
2 758 просмотров · 8 месяцев назад
40 токенов в секунду бесполезны, если вы теряете нить рассуждений, ожидая 4 минуты загрузки модели.**
Проект Gepetto: Запись блокировки 02: Мы испытываем NVIDIA DGX Spark на пределе его возможностей. С новым обновлением программного обеспечения к Рождеству 2025 года NVIDIA DGX Spark наконец-то получила нативную поддержку **квантования NVFP4**. Обещание? Огромная скорость и снижение потребления памяти.
Я хотел выжать из него все соки. Я хотел заменить свою надежную систему Ollama на высокопроизводительный стек TensorRT-LLM.
Результаты тестов выглядели невероятно: 39,5 токенов/с на 30-битной модели.
Но затем реальность взяла свое.
Мы обнаружили, что высокая скорость сопряжена с огромным «налогом на обязательства». Мы столкнулись с «стеной конфигурации», боролись с открытым стандартом *MXFP4* на массивном *GPT-OSS-120B* и усвоили горький урок о зрелости программного обеспечения по сравнению с возможностями оборудования.
*В этом видео мы отлаживаем предположения локального ИИ:*
*Производительный стек:* Почему мы используем Qwen3, Phi-4 и Llama-3.3 для разных когнитивных задач.
*Крах:* Как запуск 3 контейнеров TensorRT параллельно привел к падению производительности на 300%.
*Сюрприз vLLM:* Почему «любимец индустрии» сначала потерпел неудачу (утечка 110 ГБ видеопамяти), но реабилитировался с моделью Architect на 120 ГБ.
Это не обзор бенчмарков. Это полевой отчет о разработке среды мышления, которая действительно работает для меня.
--
*⏱️ Временные метки*
0:00 - Вступление: Исследователь против Хранителя
0:19 - Акт I. - Зуд
0:55 - ИНТЕРМЕЦЦО - Новый ландшафт
1:35 - Акт II. - Один человек, много шестеренок
4:21 - Акт IIа. - Эйфорическая часть
7:10 - Акт 2б. - Столкновение архитекторов
9:10 - Акт 3. - Стена конфигурации
10:57 - Финальный занавес
---
*🛠️ Стек и оборудование*
*Система:* NVIDIA DGX Spark (архитектура Blackwell, 128 ГБ унифицированной памяти)
*Быстрый рабочий процесс:* Qwen3-30B-A3B (NVFP4) - Король пропускной способности MoE
*Тяжелый рабочий процесс:* Qwen3-32B (NVFP4) - Плотный якорь
*Мыслитель:* Phi-4-Reasoning-Plus (NVFP4) - Специалист по логике
*Архитектор:* GPT-OSS-120B (MXFP4) и Llama-3.3-70B (NVFP4)
*Протестированные среды выполнения:* TensorRT-LLM (v0.12.0rc6), vLLM (v25.12.post1-py3)
---
*🔗 Ссылки и ресурсы*
NVIDIA Spark Playbook vLLM: https://build.nvidia.com/spark/vllm
NVIDIA Spark Playbook Tensor RT: https://build.nvidia.com/spark/trt-llm
Предыдущий эпизод (Стабильность сборки): • Running Local LLMs on NVIDIA DGX Spark – A...
#LocalLLM #AI #NVIDIA #MachineLearning #Engineering #DevLog
#TensorRT #vLLM #DGXSpark #Blackwell #NVFP4 #MXFP4 #Qwen #Llama3 #Phi4 #GPTOSS #Ollama
#ProjectGepetto #SystemArchitecture #Benchmark #MadScientist