Перейти к содержимому

Добавляю вторую видеокарту в мой ИИ-компьютер: увеличится ли скорость вдвое?

Codacus

0:00 / 0:00

Добавляю вторую видеокарту в мой ИИ-компьютер: увеличится ли скорость вдвое?

34 920 просмотров · 1 день назад
Codacus
42,9 тыс. подписчиков
34 920 просмотров · 1 день назад
Я добавил вторую RTX 3060 к своему локальному серверу ИИ. Удвоила ли это скорость? Ответ не сводится к одному числу: скорость обработки некоторых моделей увеличилась более чем вдвое, а видео ИИ вообще отказывался использовать вторую карту, пока я не изменил алгоритм её работы. Это полная сборка и настройка AI Rig, моего сервера ИИ с двумя RTX 3060: комплектующие, ошибка с материнской платой, Proxmox на ZFS, обе видеокарты в одном контейнере, разделение слоев и разделение тензоров в llama.cpp, MTP, что разблокируют 24 ГБ видеопамяти (и где заканчивается её объём), генерация изображений и видео на обеих картах с помощью Raylight и как получить к ней доступ из любой точки мира. РАЗДЕЛЫ 0:00 Может ли вторая видеокарта удвоить скорость? 0:52 Сборка (и ошибка с материнской платой) 2:51 Настройка: Proxmox, ZFS, обе видеокарты в одном контейнере 6:22 Разделение слоев против разделения тензоров 10:31 Что дают 24 ГБ оперативной памяти 12:32 Изображения и видео: ComfyUI, затем Raylight 14:42 Превратим это в сервер 16:25 Стоило ли оно того? РЕЗУЛЬТАТЫ (повседневное использование, одна карта против двух) Qwen 3.6 35B MoE: ~70 → ~130 ток/с (154 при вводе кода) Qwen 3.8 27B: ~14 → ~45 ток/с (55 при вводе кода), более чем в 3 раза, потому что одной карте приходилось передавать треть модели на ЦП Полный контекст 262k на 35B, а обработка изображений на GPU Qwen 3.8 Flash (125B + 50B Engram): больше, чем обе карты вместе взятые, поэтому здесь улучшение заключается в оперативной памяти, а не во второй видеокарте Видео MiniMax H3: ComfyUI использует одну карту; При использовании Raylight обе карты работают, ~1:30 → 82 с на клип, ОЗУ 52 ГБ → менее 10 ГБ АППАРАТНОЕ ОБЕСПЕЧЕНИЕ AMD Ryzen 9 7900X (12 ядер) 64 ГБ DDR5 MSI MPG X870E Carbon WiFi (версия без MAX: второй слот работает в режиме x4) 2x RTX 3060 12 ГБ 1 ТБ NVMe Если вы покупаете материнскую плату для двух видеокарт, проверьте распределение линий в сносках к руководству и ориентируйтесь на x8 / x8. Проверьте, что именно получают ваши видеокарты, с помощью команды: nvidia-smi --query-gpu=index,name,pcie.link.gen.max,pcie.link.width.current --format=csv НАСТРОЙКА LLAMA.CPP Разделение тензоров (обе карты работают на всех слоях): llama-server -m Qwen3.8-27B-Q4_K_M.gguf -ngl 99 -fa on -c 122880 -sm tensor Разделение тензоров + MTP (быстрая настройка): llama-server -m Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf -ngl 99 -fa on -c 163840 -sm tensor -ctk q8_0 -ctv q8_0 --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-type-k q8_0 --spec-draft-type-v q8_0 Соотношения разделения (сначала GPU0): -ts 1,1 (четное) · -ts 60,40 · -ts 35,65 ССЫЛКИ Запрос на слияние для параллельной обработки тензоров в llama.cpp: https://github.com/ggml-org/llama.cpp... Документация по многопроцессорной обработке в llama.cpp: https://github.com/ggml-org/llama.cpp... Qwen 3.8 27B GSQ GGUF: https://huggingface.co/ISTA-DASLab/Qw... Raylight (многопроцессорная версия ComfyUI): https://github.com/komikndr/raylight Arcane (панель Docker): https://github.com/getarcaneapp/arcane Nginx Proxy Manager: https://github.com/NginxProxyManager/... Proxmox VE: https://www.proxmox.com/en/proxmox-vi... Tailscale: https://tailscale.com АВТОРЫ Видеоклипы: MiniMax H3 (лицензия MiniMax H3 Community) Изображения: Qwen-Image 2.1 (лицензия Qwen Research) Фото Ryzen 9 7900X: CristoCalis, CC BY-SA 4.0 (Wikimedia Commons) Таблицы линий материнской платы: руководства MSI X870E Carbon WiFi / Carbon MAX WiFi Что бы вы запустили на двух 3060? Напишите мне в комментариях. #localai #llamacpp #rtx3060 #homelab #aiserver