Неправильная сеть погубила мой GPU-кластер — InfiniBand против RoCE: объяснение
SysTelligence
0:00 / 0:00
Неправильная сеть погубила мой GPU-кластер — InfiniBand против RoCE: объяснение
27 просмотров · 9 дней назад
SysTelligence
32 подписчика
27 просмотров · 9 дней назад
Видеокарты на сумму 250 000 долларов загружены всего на 20%.
Не потому, что видеокарты плохие.
Потому что сеть работает неправильно.
Вот всё, что вам нужно знать о сетевых технологиях кластеров ИИ.
✅ Что вы узнаете:
Почему стандартный Ethernet снижает производительность кластера GPU
Три сетевых уровня в серверах ИИ: GPU, управление, хранилище
Архитектура InfiniBand: HCA, менеджер подсети, работа RDMA
Поколения InfiniBand: EDR против HDR против NDR против XDR
RoCE: RDMA по Ethernet и почему необходима сеть без потерь
PFC и ECN: обеспечение работы Ethernet без потерь для RoCE
InfiniBand против RoCE: полное сравнение для вашего варианта использования
GPUDirect RDMA: связь между GPU без вмешательства в CPU
Топология «жирного дерева»: почему кластерам ИИ необходимы неблокирующие сети
Квантовые коммутаторы NVIDIA и внутрисетевые вычисления SHARP
Настройка InfiniBand на серверах SMC ИИ
Устранение неполадок, связанных с производительностью сети ИИ
Сравнение стоимости: InfiniBand против RoCE в масштабе 32 серверов
💡 Более 20 лет опыта работы с инфраструктурой bare metal опыт.
Реальные сетевые возможности кластеров ИИ, а не теория.
🔧 Часть серии «Мастерство работы с Bare Metal»
▶ Часть 7: Серверы SMC AI Bare Metal с GPU
▶ Часть 11: Подробный анализ памяти серверов ИИ
▶ Часть 12: Сетевые возможности ИИ: InfiniBand против RoCE (это видео)
▶ Часть 13: Хранилище ИИ для Bare Metal (скоро будет доступно)
Практика в прямом эфире БЕСПЛАТНО 👉 https://deepshell.cloud
#InfiniBand #RoCE #GPUDirect #AIInfrastructure #BareMetalMastery #SysTelligence #NVIDIANetworking #AINetworking