Перейти к содержимому

Big Data 2026 Адит Радхакришнан

Harvard CMSA

0:00 / 0:00

Big Data 2026 Адит Радхакришнан

502 просмотра · 2 дня назад
Harvard CMSA
27,2 тыс. подписчиков
502 просмотра · 2 дня назад
Конференция по большим данным 2026 03.09.2026 Докладчик: Адит Радхакришнан, MIT Название: К универсальному управлению и мониторингу моделей ИИ Аннотация: Модели искусственного интеллекта (ИИ) содержат большую часть человеческих знаний. Понимание представления этих знаний приведет к улучшению возможностей моделей и повышению уровня защиты. Основываясь на достижениях в области обучения признакам, мы разработали подход к извлечению линейных представлений семантических понятий или концепций в моделях ИИ. Мы показали, как эти представления позволяют управлять моделью, выявляя уязвимости и улучшая ее возможности. Мы продемонстрировали, что представления концепций переносимы между языками и позволяют управлять несколькими концепциями. На примере сотен концепций мы обнаружили, что более крупные модели лучше управляются, а управление улучшает возможности модели по сравнению с подсказками. Мы показали, что представления концепций более эффективны для мониторинга несоответствующего контента, чем для использования моделей-судей. Наши результаты иллюстрируют возможности внутренних представлений для повышения безопасности ИИ и улучшения возможностей моделей.