Перейти к содержимому

Уроки масштабирования BPF для обнаружения ошибок в драйверах RDMA-устройств в реальном времени

NANOG

0:00 / 0:00

Уроки масштабирования BPF для обнаружения ошибок в драйверах RDMA-устройств в реальном времени

157 просмотров · 2 месяца назад
NANOG
27,4 тыс. подписчиков
157 просмотров · 2 месяца назад
Аннотация Обучение больших моделей требует значительных ресурсов, а отказ любого графического процессора или хоста может существенно увеличить время обучения. В Meta мы обнаружили, что 17% наших заданий завершаются с ошибкой системных вызовов, связанных с RDMA, которые возникают из-за ошибок в коде драйвера RDMA. В отличие от других частей ядра, системные вызовы, связанные с RDMA, непрозрачны, и ошибки создают несоответствие между представлением аппаратных ресурсов приложения и ядра. В результате этой непрозрачности и несоответствия существующие инструменты мониторинга обеспечивали ограниченную видимость, и DevOps столкнулся с трудностями в сортировке — нам потребовалась новая масштабируемая структура для анализа состояния ядра и выявления причины этого несоответствия. Прямые подходы, такие как трассировка вызовов ядра и сбор метаданных, задействованных в системах, оказались непомерно дорогими. В этом докладе мы опишем набор оптимизаций, используемых для масштабирования отслеживания состояния ядра, и системы на основе карт, разработанные для эффективного экспорта соответствующего состояния без влияния на рабочие нагрузки в производственной среде. Пранкур Гупта: Пранкур Гупта — ведущий инженер-программист в компании Meta с более чем 12-летним опытом работы в области обеспечения надежности и наблюдаемости в масштабе предприятия. Его экспертиза охватывает весь технологический стек, от разработки транспортных протоколов ИИ в микропрограммах сетевых карт и драйверах ядра до новаторской оптимизации сети в пользовательском пространстве с использованием eBPF. В Meta Пранкур сыграл ключевую роль в создании передовых экосистем для настройки транспортных протоколов и управления перегрузками, обеспечив значительное повышение производительности. В настоящее время он руководит внедрением в производство собственных аппаратных инициатив Meta, включая сетевые карты и MTIA, а также разработкой следующего поколения транспортных протоколов ИИ для инфраструктуры Meta. https://nanog.org/events/nanog-97/con...