Добавляю вторую видеокарту в мой ИИ-компьютер: увеличится ли скорость вдвое?
Codacus
0:00 / 0:00
Добавляю вторую видеокарту в мой ИИ-компьютер: увеличится ли скорость вдвое?
34 920 просмотров · 1 день назад
Codacus
42,9 тыс. подписчиков
34 920 просмотров · 1 день назад
Я добавил вторую RTX 3060 к своему локальному серверу ИИ. Удвоила ли это скорость? Ответ не сводится к одному числу: скорость обработки некоторых моделей увеличилась более чем вдвое, а видео ИИ вообще отказывался использовать вторую карту, пока я не изменил алгоритм её работы.
Это полная сборка и настройка AI Rig, моего сервера ИИ с двумя RTX 3060: комплектующие, ошибка с материнской платой, Proxmox на ZFS, обе видеокарты в одном контейнере, разделение слоев и разделение тензоров в llama.cpp, MTP, что разблокируют 24 ГБ видеопамяти (и где заканчивается её объём), генерация изображений и видео на обеих картах с помощью Raylight и как получить к ней доступ из любой точки мира.
РАЗДЕЛЫ
0:00 Может ли вторая видеокарта удвоить скорость?
0:52 Сборка (и ошибка с материнской платой)
2:51 Настройка: Proxmox, ZFS, обе видеокарты в одном контейнере
6:22 Разделение слоев против разделения тензоров
10:31 Что дают 24 ГБ оперативной памяти
12:32 Изображения и видео: ComfyUI, затем Raylight
14:42 Превратим это в сервер
16:25 Стоило ли оно того?
РЕЗУЛЬТАТЫ (повседневное использование, одна карта против двух)
Qwen 3.6 35B MoE: ~70 → ~130 ток/с (154 при вводе кода)
Qwen 3.8 27B: ~14 → ~45 ток/с (55 при вводе кода), более чем в 3 раза, потому что одной карте приходилось передавать треть модели на ЦП
Полный контекст 262k на 35B, а обработка изображений на GPU
Qwen 3.8 Flash (125B + 50B Engram): больше, чем обе карты вместе взятые, поэтому здесь улучшение заключается в оперативной памяти, а не во второй видеокарте
Видео MiniMax H3: ComfyUI использует одну карту; При использовании Raylight обе карты работают, ~1:30 → 82 с на клип, ОЗУ 52 ГБ → менее 10 ГБ
АППАРАТНОЕ ОБЕСПЕЧЕНИЕ
AMD Ryzen 9 7900X (12 ядер)
64 ГБ DDR5
MSI MPG X870E Carbon WiFi (версия без MAX: второй слот работает в режиме x4)
2x RTX 3060 12 ГБ
1 ТБ NVMe
Если вы покупаете материнскую плату для двух видеокарт, проверьте распределение линий в сносках к руководству и ориентируйтесь на x8 / x8. Проверьте, что именно получают ваши видеокарты, с помощью команды:
nvidia-smi --query-gpu=index,name,pcie.link.gen.max,pcie.link.width.current --format=csv
НАСТРОЙКА LLAMA.CPP
Разделение тензоров (обе карты работают на всех слоях):
llama-server -m Qwen3.8-27B-Q4_K_M.gguf -ngl 99 -fa on -c 122880 -sm tensor
Разделение тензоров + MTP (быстрая настройка):
llama-server -m Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf -ngl 99 -fa on -c 163840 -sm tensor -ctk q8_0 -ctv q8_0 --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-type-k q8_0 --spec-draft-type-v q8_0
Соотношения разделения (сначала GPU0): -ts 1,1 (четное) · -ts 60,40 · -ts 35,65
ССЫЛКИ
Запрос на слияние для параллельной обработки тензоров в llama.cpp: https://github.com/ggml-org/llama.cpp...
Документация по многопроцессорной обработке в llama.cpp: https://github.com/ggml-org/llama.cpp...
Qwen 3.8 27B GSQ GGUF: https://huggingface.co/ISTA-DASLab/Qw...
Raylight (многопроцессорная версия ComfyUI): https://github.com/komikndr/raylight
Arcane (панель Docker): https://github.com/getarcaneapp/arcane
Nginx Proxy Manager: https://github.com/NginxProxyManager/...
Proxmox VE: https://www.proxmox.com/en/proxmox-vi...
Tailscale: https://tailscale.com
АВТОРЫ
Видеоклипы: MiniMax H3 (лицензия MiniMax H3 Community)
Изображения: Qwen-Image 2.1 (лицензия Qwen Research)
Фото Ryzen 9 7900X: CristoCalis, CC BY-SA 4.0 (Wikimedia Commons)
Таблицы линий материнской платы: руководства MSI X870E Carbon WiFi / Carbon MAX WiFi
Что бы вы запустили на двух 3060? Напишите мне в комментариях.
#localai #llamacpp #rtx3060 #homelab #aiserver