Перейти к содержимому

09.09.2026 CERIAS — Рассуждения о вмешательствах в данные и системы машинного обучения

Purdue CERIAS

0:00 / 0:00

09.09.2026 CERIAS — Рассуждения о вмешательствах в данные и системы машинного обучения

61 просмотр · 2 недели назад
Purdue CERIAS
2,06 тыс. подписчиков
61 просмотр · 2 недели назад
Запись: 09.09.2026 Семинар CERIAS по безопасности в Университете Пердью Рассуждения о вмешательствах в системы обработки данных и машинного обучения Ромила Прадхан, Университет Пердью Надежность современных систем машинного обучения зависит от качества данных и конвейеров обработки, которые их поддерживают. Однако улучшение их поведения часто требует анализа огромного пространства возможных конфигураций данных и системы. Эти системы достаточно сложны, поэтому их улучшение путем одновременного изменения всего является неэффективным и ненадежным. В этом докладе рассматривается простой принцип построения более интеллектуальных систем обработки данных и машинного обучения: определить, какое вмешательство с наибольшей вероятностью изменит результат, и действовать в этом направлении. Сначала я представлю DataSift, которая применяет этот принцип к моделированию поведения, определяя наиболее влиятельные данные для расширения обучающего набора данных, когда цель состоит в повышении справедливости без ущерба для точности прогнозирования. Объединяя оценку данных, функции влияния и алгоритмы многоруких бандитов, DataSift выявляет небольшие, но эффективные подмножества данных-кандидатов, вместо того чтобы без разбора добавлять данные в обучающий набор. Далее я представлю PipeLens, который применяет тот же принцип к конвейерам обработки данных, определяя компоненты и параметры, вмешательство в которые с наибольшей вероятностью восстановит работоспособность неисправного конвейера. Обучаясь на успешных и неудачных выполнениях конвейера, PipeLens выявляет причинно-следственные первопричины и эффективно ищет способы восстановления работоспособности конвейера. Несмотря на решение разных задач, обе системы заменяют поиск методом перебора целенаправленным вмешательством, используя принципиальные рассуждения о влиянии и причинно-следственных связях для определения того, что нужно изменить, почему это важно и как это сделать эффективно. Биография докладчика Ромила Прадхан — доцент Школы прикладных и креативных вычислений в Университете Пердью и руководитель Лаборатории ответственной науки о данных, где она и ее студенты создают надежные и ответственные системы принятия решений на основе данных. Ее исследования охватывают более широкую область баз данных и управления данными и обусловлены необходимостью разработки алгоритмов и решений, обеспечивающих объяснимость, справедливость и надежность системы. Ее исследования поддерживаются NSF, Google и Underwriters Laboratories. Она является лауреатом премии Google Research Scholar Award и премии NSF CAREER Award. Ромила получила степень доктора философии в области компьютерных наук в Университете Пердью, а также степени магистра и бакалавра в области математики и вычислительной техники в Индийском технологическом институте (IIT) Харагпур, Индия. Сайт: www.cerias.purdue.edu