Перейти к содержимому

Глубокое погружение в хранилища для ИИ: почему медленные накопители губят ваш GPU-кластер

SysTelligence

0:00 / 0:00

Глубокое погружение в хранилища для ИИ: почему медленные накопители губят ваш GPU-кластер

23 просмотра · 6 дней назад
SysTelligence
32 подписчика
23 просмотра · 6 дней назад
Восемь видеокарт H100 загружены на 5%. Видеокарты работают нормально. Сеть работает нормально. Накопитель не справляется с их подачей данных с достаточной скоростью. Вот всё, что вам нужно, чтобы это исправить. ✅ Что вы узнаете: Почему для рабочих нагрузок ИИ необходима постоянная пропускная способность хранилища 50 ГБ/с Локальное хранилище NVMe: 7 ГБ/с на диск, 56 ГБ/с с 8 дисками NVMe поверх Fabrics: расширение производительности NVMe по сети Распределенное хранилище Ceph: архитектура, RADOS, OSD, CephFS Реальный опыт работы с Ceph на кластерах SMC стартапа из района залива Сан-Франциско Параллельная файловая система Lustre: как она обеспечивает работу крупнейших в мире кластеров ИИ IBM Spectrum Scale для корпоративного ИИ с автоматическим многоуровневым хранением данных Объектное хранилище, совместимое с MinIO S3, для наборов данных ИИ на физическом оборудовании Стратегия многоуровневого хранения данных: снижение затрат на 60-70% по сравнению с полностью NVMe-хранилищем Конфигурация хранилища серверов ИИ SMC через IPMI и nvme-cli Диагностика узких мест хранилища во время обучения с помощью fio и iostat 💡 Реальный опыт работы с Ceph на кластерах SMC на физическом оборудовании в стартапе в районе залива Сан-Франциско. Не теория — а производственные знания. 🔧 Часть серии «Мастерство работы с Bare Metal» ▶ Часть 7: Серверы SMC AI Bare Metal с GPU ▶ Часть 11: Подробный анализ памяти серверов AI ▶ Часть 12: Сетевые возможности AI: InfiniBand против RoCE ▶ Часть 13: Подробный анализ хранилища AI (это видео) ▶ Часть 14: Стоимость GPU на Bare Metal против Cloud (скоро будет доступно) Практикуйтесь бесплатно в прямом эфире 👉 https://deepshell.cloud #AIStorage #Ceph #NVMe #Lustre #MinIO #BareMetalMastery #SysTelligence #AIInfrastructure