Что такое инверсия ИИ-моделей? Как злоумышленники восстанавливают обучающие данные по ответам модели
Kandi Brian
0:00 / 0:00
Что такое инверсия ИИ-моделей? Как злоумышленники восстанавливают обучающие данные по ответам модели
64 просмотра · 4 дня назад
Kandi Brian
560 подписчиков
64 просмотра · 4 дня назад
Инверсия модели — это атака на конфиденциальность, использующая данные, предоставляемые обученной моделью машинного обучения (метки, оценки достоверности, логиты, эмбеддинги или сгенерированный текст), для восстановления обучающих данных или конфиденциальных атрибутов людей, стоящих за ней. При этом весовые коэффициенты не нужно красть. Атака осуществляется через собственный интерфейс модели.
В этом видео рассматривается вся картина. Начинается оно с модели дозирования варфарина 2014 года, которая выявила генетические маркеры пациентов, и атак 2015 года, которые восстановили ответы на опросы и узнаваемые лица по оценкам достоверности. Далее рассматриваются генеративные априорные знания, которые сделали глубокие нейронные сети инвертируемыми в 2020 году, и переход к эмбеддингам текста, скрытым подсказкам, раздельному выводу и моделям визуально-языкового анализа до 2026 года.
В нем объясняется атака как задача оптимизации, почему поиск по пикселям возвращает шум и как генеративные априорные знания это исправляют. В нем также показано, как работают атаки типа «черный ящик» и атаки только на основе меток без градиентов, и как оцениваются реконструкции, включая недавние данные о том, что стандартная метрика может завышать утечку.
Раздел, посвященный защите, охватывает усиление защиты выходных данных, бюджеты запросов и телеметрию, дифференциальную конфиденциальность (что она ограничивает и где есть пробелы), защиту во время обучения, разработанную для инверсии, а также защиту хранилищ эмбеддингов и разделенных конвейеров. Четыре фрагмента кода демонстрируют тест инверсии «белый ящик» для принадлежащих вам моделей, усиленный ответ прогноза, монитор потока запросов и обучение DP-SGD с помощью Opacus.
В заключение приводятся вопросы о моделях угроз, повторяемый процесс «красной команды» и тест на анонимность обученных моделей в соответствии с заключением EDPB 28/2024 и проектом руководящих принципов анонимизации от июля 2026 года. В качестве справочных материалов использованы NIST AI 100-2e2025 (NISTAML.032), MITRE ATLAS (AML.T0024.001) и OWASP ML03:2023.
#ИнверсияМоделирования #БезопасностьИИ #БезопасностьМашинногоОбучения #КонфиденциальностьДанные #ПротиводействиеML
Это обучающее видео по кибербезопасности — одно из тысяч обучающих видео по кибербезопасности и подготовке к экзамену CompTIA на YouTube-канале @kandi-brian. Здесь вы найдете самый полный набор обучающих видеороликов для подготовки к экзамену CompTIA от Канди Брайан — сертифицированного инструктора по кибербезопасности, имеющего степень магистра наук в области кибербезопасности и более 20 лет опыта работы в технологической индустрии.