Введение в механистическую интерпретируемость – Нил Нанда | IASEAI 2025
International Association for Safe & Ethical AI
0:00 / 0:00
Введение в механистическую интерпретируемость – Нил Нанда | IASEAI 2025
12 669 просмотров · 1 год назад
International Association for Safe & Ethical AI
2,98 тыс. подписчиков
12 669 просмотров · 1 год назад
Как можно провести обратную разработку нейронной сети?
В рамках конференции IASEAI ’25, посвященной теме «Введение в механистическую интерпретируемость», Нил Нанда (старший научный сотрудник Google DeepMind, ранее работавший в Anthropic), представляет доступный обзор механистической интерпретируемости — науки о том, как понять внутреннюю работу нейронных сетей. Нанда рассматривает достигнутый прогресс, ограничения существующих подходов и потенциал этой области для повышения безопасности искусственного интеллекта (ИИ). Он также рассматривает, как более совершенные инструменты интерпретируемости могут помочь оценить безопасность современных передовых систем и обеспечить прозрачность будущих разработок ИИ.
О IASEAI: https://www.iaseai.org
Нил Нанда: https://www.neelnanda.io/
#NeelNanda #AISafety #Interpretability #MechanisticInterpretability #IASEAI