Перейти к содержимому

TensorRT против vLLM на DGX Spark: почему одних только бенчмарков недостаточно.

Gepetto | Local AI Engineering

0:00 / 0:00

TensorRT против vLLM на DGX Spark: почему одних только бенчмарков недостаточно.

2 758 просмотров · 8 месяцев назад
Gepetto | Local AI Engineering
199 подписчиков
2 758 просмотров · 8 месяцев назад
40 токенов в секунду бесполезны, если вы теряете нить рассуждений, ожидая 4 минуты загрузки модели.** Проект Gepetto: Запись блокировки 02: Мы испытываем NVIDIA DGX Spark на пределе его возможностей. С новым обновлением программного обеспечения к Рождеству 2025 года NVIDIA DGX Spark наконец-то получила нативную поддержку **квантования NVFP4**. Обещание? Огромная скорость и снижение потребления памяти. Я хотел выжать из него все соки. Я хотел заменить свою надежную систему Ollama на высокопроизводительный стек TensorRT-LLM. Результаты тестов выглядели невероятно: 39,5 токенов/с на 30-битной модели. Но затем реальность взяла свое. Мы обнаружили, что высокая скорость сопряжена с огромным «налогом на обязательства». Мы столкнулись с «стеной конфигурации», боролись с открытым стандартом *MXFP4* на массивном *GPT-OSS-120B* и усвоили горький урок о зрелости программного обеспечения по сравнению с возможностями оборудования. *В этом видео мы отлаживаем предположения локального ИИ:* *Производительный стек:* Почему мы используем Qwen3, Phi-4 и Llama-3.3 для разных когнитивных задач. *Крах:* Как запуск 3 контейнеров TensorRT параллельно привел к падению производительности на 300%. *Сюрприз vLLM:* Почему «любимец индустрии» сначала потерпел неудачу (утечка 110 ГБ видеопамяти), но реабилитировался с моделью Architect на 120 ГБ. Это не обзор бенчмарков. Это полевой отчет о разработке среды мышления, которая действительно работает для меня. -- *⏱️ Временные метки* 0:00 - Вступление: Исследователь против Хранителя 0:19 - Акт I. - Зуд 0:55 - ИНТЕРМЕЦЦО - Новый ландшафт 1:35 - Акт II. - Один человек, много шестеренок 4:21 - Акт IIа. - Эйфорическая часть 7:10 - Акт 2б. - Столкновение архитекторов 9:10 - Акт 3. - Стена конфигурации 10:57 - Финальный занавес --- *🛠️ Стек и оборудование* *Система:* NVIDIA DGX Spark (архитектура Blackwell, 128 ГБ унифицированной памяти) *Быстрый рабочий процесс:* Qwen3-30B-A3B (NVFP4) - Король пропускной способности MoE *Тяжелый рабочий процесс:* Qwen3-32B (NVFP4) - Плотный якорь *Мыслитель:* Phi-4-Reasoning-Plus (NVFP4) - Специалист по логике *Архитектор:* GPT-OSS-120B (MXFP4) и Llama-3.3-70B (NVFP4) *Протестированные среды выполнения:* TensorRT-LLM (v0.12.0rc6), vLLM (v25.12.post1-py3) --- *🔗 Ссылки и ресурсы* NVIDIA Spark Playbook vLLM: https://build.nvidia.com/spark/vllm NVIDIA Spark Playbook Tensor RT: https://build.nvidia.com/spark/trt-llm Предыдущий эпизод (Стабильность сборки):    • Running Local LLMs on NVIDIA DGX Spark – A...   #LocalLLM #AI #NVIDIA #MachineLearning #Engineering #DevLog #TensorRT #vLLM #DGXSpark #Blackwell #NVFP4 #MXFP4 #Qwen #Llama3 #Phi4 #GPTOSS #Ollama #ProjectGepetto #SystemArchitecture #Benchmark #MadScientist