Перейти к содержимому

Автоматические гардрейлы | Владимир Солодкин, МФТИ

WB Tech

0:00 / 0:00

Автоматические гардрейлы | Владимир Солодкин, МФТИ

133 просмотра · 3 месяца назад
WB Tech
2,27 тыс. подписчиков
133 просмотра · 3 месяца назад
Модели защиты (guardrails) являются важным дополнением к основной большой языковой модели (LLM), решающей бизнес задачи. Guardrails защищают от попыток вытащить из LLM запрещенную, конфеденциальная, некорреткную, компрометирующая информацию. Спектр угроз и их изощренность растет с каждым днем. В докладе рассмотрим мультиагентное решение, которое в режиме реального времени анализирует текущие способы атак, например, возникающие в Интернете (в научной литературе, блогпостах и тд), и автоматически дообучает модели защиты. Обсудим и возможность эволюционной модификации не только модели защиты, но и создание новых концепций атак также в автоматическом режиме с помощью мультиагентной системы. Спикер: Владимир Солодкин, ведущий исследователь Института ИИ МФТИ Telegram WB делает ML: clck.ru/3TrDaD Telegram WB Тех: clck.ru/3TrDYv Блог на Habr: clck.ru/3TrDMr