Автоматические гардрейлы | Владимир Солодкин, МФТИ
WB Tech
0:00 / 0:00
Автоматические гардрейлы | Владимир Солодкин, МФТИ
133 просмотра · 3 месяца назад
WB Tech
2,27 тыс. подписчиков
133 просмотра · 3 месяца назад
Модели защиты (guardrails) являются важным дополнением к основной большой языковой модели (LLM), решающей бизнес задачи. Guardrails защищают от попыток вытащить из LLM запрещенную, конфеденциальная, некорреткную, компрометирующая информацию. Спектр угроз и их изощренность растет с каждым днем.
В докладе рассмотрим мультиагентное решение, которое в режиме реального времени анализирует текущие способы атак, например, возникающие в Интернете (в научной литературе, блогпостах и тд), и автоматически дообучает модели защиты. Обсудим и возможность эволюционной модификации не только модели защиты, но и создание новых концепций атак также в автоматическом режиме с помощью мультиагентной системы.
Спикер: Владимир Солодкин, ведущий исследователь Института ИИ МФТИ
Telegram WB делает ML: clck.ru/3TrDaD
Telegram WB Тех: clck.ru/3TrDYv
Блог на Habr: clck.ru/3TrDMr