09.09.2026 CERIAS — Рассуждения о вмешательствах в данные и системы машинного обучения
Purdue CERIAS
0:00 / 0:00
09.09.2026 CERIAS — Рассуждения о вмешательствах в данные и системы машинного обучения
61 просмотр · 2 недели назад
Purdue CERIAS
2,06 тыс. подписчиков
61 просмотр · 2 недели назад
Запись: 09.09.2026
Семинар CERIAS по безопасности в Университете Пердью
Рассуждения о вмешательствах в системы обработки данных и машинного обучения
Ромила Прадхан, Университет Пердью
Надежность современных систем машинного обучения зависит от качества данных и конвейеров обработки, которые их поддерживают. Однако улучшение их поведения часто требует анализа огромного пространства возможных конфигураций данных и системы. Эти системы достаточно сложны, поэтому их улучшение путем одновременного изменения всего является неэффективным и ненадежным. В этом докладе рассматривается простой принцип построения более интеллектуальных систем обработки данных и машинного обучения: определить, какое вмешательство с наибольшей вероятностью изменит результат, и действовать в этом направлении.
Сначала я представлю DataSift, которая применяет этот принцип к моделированию поведения, определяя наиболее влиятельные данные для расширения обучающего набора данных, когда цель состоит в повышении справедливости без ущерба для точности прогнозирования. Объединяя оценку данных, функции влияния и алгоритмы многоруких бандитов, DataSift выявляет небольшие, но эффективные подмножества данных-кандидатов, вместо того чтобы без разбора добавлять данные в обучающий набор.
Далее я представлю PipeLens, который применяет тот же принцип к конвейерам обработки данных, определяя компоненты и параметры, вмешательство в которые с наибольшей вероятностью восстановит работоспособность неисправного конвейера. Обучаясь на успешных и неудачных выполнениях конвейера, PipeLens выявляет причинно-следственные первопричины и эффективно ищет способы восстановления работоспособности конвейера.
Несмотря на решение разных задач, обе системы заменяют поиск методом перебора целенаправленным вмешательством, используя принципиальные рассуждения о влиянии и причинно-следственных связях для определения того, что нужно изменить, почему это важно и как это сделать эффективно.
Биография докладчика
Ромила Прадхан — доцент Школы прикладных и креативных вычислений в Университете Пердью и руководитель Лаборатории ответственной науки о данных, где она и ее студенты создают надежные и ответственные системы принятия решений на основе данных.
Ее исследования охватывают более широкую область баз данных и управления данными и обусловлены необходимостью разработки алгоритмов и решений, обеспечивающих объяснимость, справедливость и надежность системы. Ее исследования поддерживаются NSF, Google и Underwriters Laboratories. Она является лауреатом премии Google Research Scholar Award и премии NSF CAREER Award.
Ромила получила степень доктора философии в области компьютерных наук в Университете Пердью, а также степени магистра и бакалавра в области математики и вычислительной техники в Индийском технологическом институте (IIT) Харагпур, Индия.
Сайт: www.cerias.purdue.edu