Вторая видеокарта не ускорит ваш локальный ИИ
Devsplainers
0:00 / 0:00
Вторая видеокарта не ускорит ваш локальный ИИ
3 619 просмотров · 23 ч назад
Devsplainers
20,2 тыс. подписчиков
3 619 просмотров · 23 ч назад
Четыре компьютера Mac Studio в одном кластере обрабатывают 70-байтовую модель со скоростью 5 токенов в секунду, что соответствует скорости одного Mac. Вот почему вторая видеокарта или вторая машина не ускоряют вашу локальную модель LLM, и три условия, при которых это происходит.
Двухпроцессорная конфигурация или кластер Mac Studio позволяют увеличить объем памяти. Увеличение скорости зависит от того, как разделена модель и от связи между устройствами. В этом видео рассматриваются конвейерный и тензорный параллелизм, почему задержка важнее пропускной способности, что исправляют RDMA через Thunderbolt 5 и NVLink, и как Meta, ByteDance и DeepSeek сталкиваются с одинаковой задержкой при работе с тысячами видеокарт. В конце предлагается правило покупки для вашего следующего локального обновления ИИ.
Разделы
00:00 4 Mac Studios, скорость 1
00:42 Параллелизм конвейера против параллелизма тензоров
01:46 Почему задержка важнее пропускной способности
02:48 RDMA через Thunderbolt 5
03:19 Два графических процессора в одном ПК: PCIe против NVLink
04:08 Одинаковое время ожидания в центрах обработки данных для ИИ (Meta, ByteDance, DeepSeek)
05:44 Действительно ли графические процессоры ждут в сети в три раза меньше времени?
06:58 Второй графический процессор или более мощный?
07:50 Вердикт
Получайте самые свежие мнения на свою почту каждый вторник: https://devsplainers.com/takeouts/
Смотрите далее
Не покупайте Mac Studio M5 Ultra для локального ИИ (сделайте это): • Don't Buy a Mac Studio M5 Ultra For Local ...
Не покупайте RTX 5090. Разработчики собирают ИИ-системы из мусора: • Don't Buy an RTX 5090. Devs Are Building A...
Что такое vLLM? Объяснение в 16-битном формате: • What Is vLLM? Explained in 16-Bit
MoE: Трюк маршрутизации, лежащий в основе каждой модели, которую вы запускаете: • MoE: The Routing Trick Behind Every Model ...
Ускоряет ли вторая видеокарта локальный LLM?
Обычно нет. В большинстве локальных конфигураций модель разделяется по слоям, что называется конвейерным параллелизмом. Одно устройство работает, пока другие ждут, поэтому вы получаете память всех устройств и скорость одного. Тензорный параллелизм заставляет каждое устройство работать с одним и тем же токеном, но устройства должны обмениваться результатами на каждом уровне. NetworkChuck подсчитал 160 обменов на токен для 70-байтовой модели Llama и оценил каждую из них примерно в 300 микросекунд при обычной сетевой обработке. Эта фиксированная задержка может стоить дороже, чем дополнительные графические процессоры. RDMA (удаленный прямой доступ к памяти) и NVLink сокращают задержку, и с RDMA те же четыре Mac обрабатывают от 5 до 15,5 токенов в секунду.
В этом видео:
Почему четыре Mac Studios с 10-гигабитным Ethernet работали с Llama 3.3 70B не быстрее, чем одна
Параллелизм конвейера против параллелизма тензоров простыми словами
Задержка против пропускной способности: кластер Strix Halo, где 50-гигабитная карта покупала 5 токенов в секунду
Что такое RDMA и что изменил RDMA через Thunderbolt 5 в macOS 26.2 для Exo и MLX
Бенчмарк двух RTX 3090 на vLLM: 715 токенов в секунду с NVLink, 483 без него
NVLink на потребительских картах: исчез после серии RTX 40
Сетевые решения для центров обработки данных с использованием ИИ в Meta, ByteDance и DeepSeek, с данными InfiniBand и NVLink
Почему NVIDIA заплатила 7 миллиардов долларов за Mellanox и создала стойку NVL72
Откуда берется цифра "GPU ждут 33% времени в сети"
Что Остановили запуск обучения Llama 3 на Meta 419 раз за 54 дня
Плотные модели против моделей смешанного экспертного обучения на кластере (Llama против Kimi K2)
Какое локальное программное обеспечение LLM поддерживает параллельную обработку тензоров: vLLM и MLX, llama.cpp — нет
Источники
(15 ссылок, см. файл)
#localai #localllm #gpu