Механистическая интерпретируемость: разреженные автокодировщики, управление признаками и нейронны...
MartinHanderPhD
0:00 / 0:00
Механистическая интерпретируемость: разреженные автокодировщики, управление признаками и нейронны...
180 просмотров · 8 дней назад
MartinHanderPhD
214 подписчиков
180 просмотров · 8 дней назад
Никто — даже те, кто их создает — не может полностью объяснить, как работают современные большие языковые модели. Механистическая интерпретируемость — это область исследований, которая пытается это изменить: обратное проектирование нейронных сетей в удобочитаемые для человека признаки и схемы. По мере роста возможностей моделей это понимание становится критически важным для безопасности и управления ИИ.
В этом подробном обзоре мы начнем с базовой идеи признаков как направлений в пространстве активации, через суперпозицию и разреженные автокодировщики (SAE), вплоть до управления активацией, алгоритма Клода «Золотые ворота», направления отказа, индукционных головок, патчинга активации и графов атрибуции Anthropic — и что все это значит для выравнивания ИИ.
⏱️ Разделы
00:00 Открытие «черного ящика»
01:34 Почему возможности опережают понимание
02:21 Почему поведенческого тестирования недостаточно
03:12 Что означает механистическая интерпретируемость
03:57 Трансформатор и остаточный поток
04:45 Признаки как направления (гипотеза линейного представления)
05:33 Полисемантические нейроны и суперпозиция
07:58 Обучение словарям и разреженные автокодировщики
09:36 Обучение SAE: функция потерь, мертвые латенты, TopK и JumpReLU
12:00 Чтение признаков и что обнаружили SAE
13:37 Разделение признаков
14:27 Управление активацией и алгоритм Клода «Золотые ворота»
16:05 Векторы управления и направление отказа
17:45 Пределы управления
18:33 Схемы: QK/OV, индукционные головки и IOI
20:57 Исправление активаций
21:47 Графы атрибуции и модели замены
22:36 Примеры из практики: многошаговое рассуждение и планирование
23:24 Интерпретируемость для выравнивания
24:13 Открытые проблемы
25:00 Путь вперед
📚 Что вы узнаете
• Почему нейроны полисемантичны и как суперпозиция вмещает больше концепций, чем измерений
• Как разреженные автокодировщики извлекают миллионы интерпретируемых признаков из активаций LLM
• Функция потерь SAE и современные варианты (TopK, JumpReLU)
• Как управление активацией изменяет поведение модели во время вывода
• Как обнаруживаются схемы, такие как индукционные головки и схема IOI
• Как интерпретируемость может помочь обнаружить обман и скрытые цели
🔬 Ключевые исследования, на которые ссылаются
• Игрушечные модели суперпозиции (Anthropic, 2022)
• На пути к моносемантичности (Anthropic, 2023)
• Масштабирование моносемантичности (Anthropic, 2024)
• Масштабирование и оценка разреженных автокодировщиков (OpenAI, 2024)
• Область действия Gemma (Google DeepMind, 2024)
• Отказ в языковых моделях опосредуется одним направлением (2024)
• Обучение в контексте и индукционные головки (Anthropic, 2022)
• Интерпретируемость в естественных условиях — схема IOI в GPT-2 small (2022)
• Трассировка цепей / О биологии большой языковой модели (Anthropic, 2025)
👍 Если это помогло, поставьте лайк и подпишитесь, чтобы получать больше подробных обзоров по ИИ и машинному обучению.
💬 Комментарии: Что должно быть дальше — практическое руководство по SAE на Python, подробный обзор графов атрибуции или управление для выравнивания?
#МеханистическаяИнтерпретируемость #БезопасностьИИ #РазреженныеАвтокодировщики #ВыравниваниеИИ #LLM #МашинноеОбучение #ГлубокоеОбучение #ОбъясняемыйИИ