Глубокое погружение в хранилища для ИИ: почему медленные накопители губят ваш GPU-кластер
SysTelligence
0:00 / 0:00
Глубокое погружение в хранилища для ИИ: почему медленные накопители губят ваш GPU-кластер
23 просмотра · 6 дней назад
SysTelligence
32 подписчика
23 просмотра · 6 дней назад
Восемь видеокарт H100 загружены на 5%.
Видеокарты работают нормально. Сеть работает нормально.
Накопитель не справляется с их подачей данных с достаточной скоростью.
Вот всё, что вам нужно, чтобы это исправить.
✅ Что вы узнаете:
Почему для рабочих нагрузок ИИ необходима постоянная пропускная способность хранилища 50 ГБ/с
Локальное хранилище NVMe: 7 ГБ/с на диск, 56 ГБ/с с 8 дисками
NVMe поверх Fabrics: расширение производительности NVMe по сети
Распределенное хранилище Ceph: архитектура, RADOS, OSD, CephFS
Реальный опыт работы с Ceph на кластерах SMC стартапа из района залива Сан-Франциско
Параллельная файловая система Lustre: как она обеспечивает работу крупнейших в мире кластеров ИИ
IBM Spectrum Scale для корпоративного ИИ с автоматическим многоуровневым хранением данных
Объектное хранилище, совместимое с MinIO S3, для наборов данных ИИ на физическом оборудовании
Стратегия многоуровневого хранения данных: снижение затрат на 60-70% по сравнению с полностью NVMe-хранилищем
Конфигурация хранилища серверов ИИ SMC через IPMI и nvme-cli
Диагностика узких мест хранилища во время обучения с помощью fio и iostat
💡 Реальный опыт работы с Ceph на кластерах SMC на физическом оборудовании
в стартапе в районе залива Сан-Франциско. Не теория — а производственные знания.
🔧 Часть серии «Мастерство работы с Bare Metal»
▶ Часть 7: Серверы SMC AI Bare Metal с GPU
▶ Часть 11: Подробный анализ памяти серверов AI
▶ Часть 12: Сетевые возможности AI: InfiniBand против RoCE
▶ Часть 13: Подробный анализ хранилища AI (это видео)
▶ Часть 14: Стоимость GPU на Bare Metal против Cloud (скоро будет доступно)
Практикуйтесь бесплатно в прямом эфире 👉 https://deepshell.cloud
#AIStorage #Ceph #NVMe #Lustre #MinIO #BareMetalMastery #SysTelligence #AIInfrastructure