Перейти к содержимому

Вторая видеокарта не ускорит ваш локальный ИИ

Devsplainers

0:00 / 0:00

Вторая видеокарта не ускорит ваш локальный ИИ

3 619 просмотров · 23 ч назад
Devsplainers
20,2 тыс. подписчиков
3 619 просмотров · 23 ч назад
Четыре компьютера Mac Studio в одном кластере обрабатывают 70-байтовую модель со скоростью 5 токенов в секунду, что соответствует скорости одного Mac. Вот почему вторая видеокарта или вторая машина не ускоряют вашу локальную модель LLM, и три условия, при которых это происходит. Двухпроцессорная конфигурация или кластер Mac Studio позволяют увеличить объем памяти. Увеличение скорости зависит от того, как разделена модель и от связи между устройствами. В этом видео рассматриваются конвейерный и тензорный параллелизм, почему задержка важнее пропускной способности, что исправляют RDMA через Thunderbolt 5 и NVLink, и как Meta, ByteDance и DeepSeek сталкиваются с одинаковой задержкой при работе с тысячами видеокарт. В конце предлагается правило покупки для вашего следующего локального обновления ИИ. Разделы 00:00 4 Mac Studios, скорость 1 00:42 Параллелизм конвейера против параллелизма тензоров 01:46 Почему задержка важнее пропускной способности 02:48 RDMA через Thunderbolt 5 03:19 Два графических процессора в одном ПК: PCIe против NVLink 04:08 Одинаковое время ожидания в центрах обработки данных для ИИ (Meta, ByteDance, DeepSeek) 05:44 Действительно ли графические процессоры ждут в сети в три раза меньше времени? 06:58 Второй графический процессор или более мощный? 07:50 Вердикт Получайте самые свежие мнения на свою почту каждый вторник: https://devsplainers.com/takeouts/ Смотрите далее Не покупайте Mac Studio M5 Ultra для локального ИИ (сделайте это):    • Don't Buy a Mac Studio M5 Ultra For Local ...   Не покупайте RTX 5090. Разработчики собирают ИИ-системы из мусора:    • Don't Buy an RTX 5090. Devs Are Building A...   Что такое vLLM? Объяснение в 16-битном формате:    • What Is vLLM? Explained in 16-Bit   MoE: Трюк маршрутизации, лежащий в основе каждой модели, которую вы запускаете:    • MoE: The Routing Trick Behind Every Model ...   Ускоряет ли вторая видеокарта локальный LLM? Обычно нет. В большинстве локальных конфигураций модель разделяется по слоям, что называется конвейерным параллелизмом. Одно устройство работает, пока другие ждут, поэтому вы получаете память всех устройств и скорость одного. Тензорный параллелизм заставляет каждое устройство работать с одним и тем же токеном, но устройства должны обмениваться результатами на каждом уровне. NetworkChuck подсчитал 160 обменов на токен для 70-байтовой модели Llama и оценил каждую из них примерно в 300 микросекунд при обычной сетевой обработке. Эта фиксированная задержка может стоить дороже, чем дополнительные графические процессоры. RDMA (удаленный прямой доступ к памяти) и NVLink сокращают задержку, и с RDMA те же четыре Mac обрабатывают от 5 до 15,5 токенов в секунду. В этом видео: Почему четыре Mac Studios с 10-гигабитным Ethernet работали с Llama 3.3 70B не быстрее, чем одна Параллелизм конвейера против параллелизма тензоров простыми словами Задержка против пропускной способности: кластер Strix Halo, где 50-гигабитная карта покупала 5 токенов в секунду Что такое RDMA и что изменил RDMA через Thunderbolt 5 в macOS 26.2 для Exo и MLX Бенчмарк двух RTX 3090 на vLLM: 715 токенов в секунду с NVLink, 483 без него NVLink на потребительских картах: исчез после серии RTX 40 Сетевые решения для центров обработки данных с использованием ИИ в Meta, ByteDance и DeepSeek, с данными InfiniBand и NVLink Почему NVIDIA заплатила 7 миллиардов долларов за Mellanox и создала стойку NVL72 Откуда берется цифра "GPU ждут 33% времени в сети" Что Остановили запуск обучения Llama 3 на Meta 419 раз за 54 дня Плотные модели против моделей смешанного экспертного обучения на кластере (Llama против Kimi K2) Какое локальное программное обеспечение LLM поддерживает параллельную обработку тензоров: vLLM и MLX, llama.cpp — нет Источники (15 ссылок, см. файл) #localai #localllm #gpu