Перейти к содержимому

Введение в механистическую интерпретируемость – Нил Нанда | IASEAI 2025

International Association for Safe & Ethical AI

0:00 / 0:00

Введение в механистическую интерпретируемость – Нил Нанда | IASEAI 2025

12 669 просмотров · 1 год назад
International Association for Safe & Ethical AI
2,98 тыс. подписчиков
12 669 просмотров · 1 год назад
Как можно провести обратную разработку нейронной сети? В рамках конференции IASEAI ’25, посвященной теме «Введение в механистическую интерпретируемость», Нил Нанда (старший научный сотрудник Google DeepMind, ранее работавший в Anthropic), представляет доступный обзор механистической интерпретируемости — науки о том, как понять внутреннюю работу нейронных сетей. Нанда рассматривает достигнутый прогресс, ограничения существующих подходов и потенциал этой области для повышения безопасности искусственного интеллекта (ИИ). Он также рассматривает, как более совершенные инструменты интерпретируемости могут помочь оценить безопасность современных передовых систем и обеспечить прозрачность будущих разработок ИИ. О IASEAI: https://www.iaseai.org Нил Нанда: https://www.neelnanda.io/ #NeelNanda #AISafety #Interpretability #MechanisticInterpretability #IASEAI