Перейти к содержимому

Неправильная сеть погубила мой GPU-кластер — InfiniBand против RoCE: объяснение

SysTelligence

0:00 / 0:00

Неправильная сеть погубила мой GPU-кластер — InfiniBand против RoCE: объяснение

27 просмотров · 9 дней назад
SysTelligence
32 подписчика
27 просмотров · 9 дней назад
Видеокарты на сумму 250 000 долларов загружены всего на 20%. Не потому, что видеокарты плохие. Потому что сеть работает неправильно. Вот всё, что вам нужно знать о сетевых технологиях кластеров ИИ. ✅ Что вы узнаете: Почему стандартный Ethernet снижает производительность кластера GPU Три сетевых уровня в серверах ИИ: GPU, управление, хранилище Архитектура InfiniBand: HCA, менеджер подсети, работа RDMA Поколения InfiniBand: EDR против HDR против NDR против XDR RoCE: RDMA по Ethernet и почему необходима сеть без потерь PFC и ECN: обеспечение работы Ethernet без потерь для RoCE InfiniBand против RoCE: полное сравнение для вашего варианта использования GPUDirect RDMA: связь между GPU без вмешательства в CPU Топология «жирного дерева»: почему кластерам ИИ необходимы неблокирующие сети Квантовые коммутаторы NVIDIA и внутрисетевые вычисления SHARP Настройка InfiniBand на серверах SMC ИИ Устранение неполадок, связанных с производительностью сети ИИ Сравнение стоимости: InfiniBand против RoCE в масштабе 32 серверов 💡 Более 20 лет опыта работы с инфраструктурой bare metal опыт. Реальные сетевые возможности кластеров ИИ, а не теория. 🔧 Часть серии «Мастерство работы с Bare Metal» ▶ Часть 7: Серверы SMC AI Bare Metal с GPU ▶ Часть 11: Подробный анализ памяти серверов ИИ ▶ Часть 12: Сетевые возможности ИИ: InfiniBand против RoCE (это видео) ▶ Часть 13: Хранилище ИИ для Bare Metal (скоро будет доступно) Практика в прямом эфире БЕСПЛАТНО 👉 https://deepshell.cloud #InfiniBand #RoCE #GPUDirect #AIInfrastructure #BareMetalMastery #SysTelligence #NVIDIANetworking #AINetworking