Перейти к содержимому

Механистическая интерпретируемость: разреженные автокодировщики, управление признаками и нейронны...

MartinHanderPhD

0:00 / 0:00

Механистическая интерпретируемость: разреженные автокодировщики, управление признаками и нейронны...

180 просмотров · 8 дней назад
MartinHanderPhD
214 подписчиков
180 просмотров · 8 дней назад
Никто — даже те, кто их создает — не может полностью объяснить, как работают современные большие языковые модели. Механистическая интерпретируемость — это область исследований, которая пытается это изменить: обратное проектирование нейронных сетей в удобочитаемые для человека признаки и схемы. По мере роста возможностей моделей это понимание становится критически важным для безопасности и управления ИИ. В этом подробном обзоре мы начнем с базовой идеи признаков как направлений в пространстве активации, через суперпозицию и разреженные автокодировщики (SAE), вплоть до управления активацией, алгоритма Клода «Золотые ворота», направления отказа, индукционных головок, патчинга активации и графов атрибуции Anthropic — и что все это значит для выравнивания ИИ. ⏱️ Разделы 00:00 Открытие «черного ящика» 01:34 Почему возможности опережают понимание 02:21 Почему поведенческого тестирования недостаточно 03:12 Что означает механистическая интерпретируемость 03:57 Трансформатор и остаточный поток 04:45 Признаки как направления (гипотеза линейного представления) 05:33 Полисемантические нейроны и суперпозиция 07:58 Обучение словарям и разреженные автокодировщики 09:36 Обучение SAE: функция потерь, мертвые латенты, TopK и JumpReLU 12:00 Чтение признаков и что обнаружили SAE 13:37 Разделение признаков 14:27 Управление активацией и алгоритм Клода «Золотые ворота» 16:05 Векторы управления и направление отказа 17:45 Пределы управления 18:33 Схемы: QK/OV, индукционные головки и IOI 20:57 Исправление активаций 21:47 Графы атрибуции и модели замены 22:36 Примеры из практики: многошаговое рассуждение и планирование 23:24 Интерпретируемость для выравнивания 24:13 Открытые проблемы 25:00 Путь вперед 📚 Что вы узнаете • Почему нейроны полисемантичны и как суперпозиция вмещает больше концепций, чем измерений • Как разреженные автокодировщики извлекают миллионы интерпретируемых признаков из активаций LLM • Функция потерь SAE и современные варианты (TopK, JumpReLU) • Как управление активацией изменяет поведение модели во время вывода • Как обнаруживаются схемы, такие как индукционные головки и схема IOI • Как интерпретируемость может помочь обнаружить обман и скрытые цели 🔬 Ключевые исследования, на которые ссылаются • Игрушечные модели суперпозиции (Anthropic, 2022) • На пути к моносемантичности (Anthropic, 2023) • Масштабирование моносемантичности (Anthropic, 2024) • Масштабирование и оценка разреженных автокодировщиков (OpenAI, 2024) • Область действия Gemma (Google DeepMind, 2024) • Отказ в языковых моделях опосредуется одним направлением (2024) • Обучение в контексте и индукционные головки (Anthropic, 2022) • Интерпретируемость в естественных условиях — схема IOI в GPT-2 small (2022) • Трассировка цепей / О биологии большой языковой модели (Anthropic, 2025) 👍 Если это помогло, поставьте лайк и подпишитесь, чтобы получать больше подробных обзоров по ИИ и машинному обучению. 💬 Комментарии: Что должно быть дальше — практическое руководство по SAE на Python, подробный обзор графов атрибуции или управление для выравнивания? #МеханистическаяИнтерпретируемость #БезопасностьИИ #РазреженныеАвтокодировщики #ВыравниваниеИИ #LLM #МашинноеОбучение #ГлубокоеОбучение #ОбъясняемыйИИ