Перейти к содержимому

Странные геометрические фигуры, найденные внутри ИИ — Том МакГрат

Machine Learning Street Talk

0:00 / 0:00

Странные геометрические фигуры, найденные внутри ИИ — Том МакГрат

11 932 просмотра · 14 часов назад
Machine Learning Street Talk
219 тыс. подписчиков
11 932 просмотра · 14 часов назад
Том МакГрат — соучредитель и главный научный сотрудник Goodfire, а также бывший исследователь Google DeepMind. Он присоединяется к Тиму Скарфу, чтобы обсудить, чему на самом деле учатся нейронные сети, сходятся ли их внутренние представления со структурами окружающего мира и может ли интерпретируемость извлекать новые научные знания, а не просто объяснять результаты работы модели. Начиная с AlphaZero и изученной модульности, разговор переходит к нейронной геометрии: концептуальным многообразиям, многократно используемым вычислениям внутри Llama и тому, почему управление активацией может давать сбой, когда оно выводит модель за пределы многообразия. Затем МакГрат обосновывает необходимость целенаправленного проектирования, используя интерпретируемость как часть цикла обучения. Они рассматривают контролируемое обобщение, признаки в качестве вознаграждений, отладку прогнозных данных и неприятный факт, что модель может распознать галлюцинацию или взлом системы вознаграждения и все равно воспроизвести ее. Обсуждение завершается обсуждением осведомленности оценщиков, контроля и сговора между адаптивными агентами, а затем возвращается к разреженным автокодировщикам. Макграт утверждает, что SAE полезны, но они могут нарушать многомерные структуры, которые сети фактически используют. Этот эпизод был подготовлен при поддержке Goodfire. -- ВРЕМЕННЫЕ МЕТКИ: 00:00:00 Введение: Может ли интерпретируемость ускорить научные исследования? 00:02:03 Невидимый оценщик 00:06:51 Чему AlphaZero научилась у мира 00:12:24 Интерпретируемость как контур управления 00:21:54 Запретный метод и более безопасные вмешательства 00:37:36 Почему модели слишком поздно обнаруживают галлюцинации 00:46:19 Отладка набора данных перед обучением 00:50:44 Почему нейронные сети становятся модульными 00:55:57 Поиск геометрии внутри сети 01:02:55 Почему управление выходит за пределы многообразия 01:12:10 Многоразовый калькулятор внутри Llama 01:17:19 От абстракций к целям 01:25:28 Вознаграждение за взлом, недосмотр и сговор 01:37:23 Умерли ли разреженные автокодировщики? --- ССЫЛКИ: статья: [00:05:45] Возникающее несоответствие: узкая тонкая настройка может привести к широкому несоответствию LLM https://arxiv.org/abs/2502.17424v7 [00:11:05] Приобретение шахматных знаний в AlphaZero https://arxiv.org/abs/2111.09259 [00:25:30] Управление обобщением вне распределения с помощью тонкой настройки с удалением концепций https://arxiv.org/abs/2507.16795 [00:29:30] Векторы персон: мониторинг и управление чертами характера в языковых моделях https://arxiv.org/abs/2507.21509 [00:41:14] Признаки как награды: масштабируемое обучение для открытых задач Задачи с помощью интерпретируемости https://arxiv.org/abs/2602.10067 [00:47:03] Анатомия постобучения: использование интерпретируемости для характеристики данных и формирования сигнала обучения https://arxiv.org/abs/2606.12360 [01:00:26] Захватывают ли разреженные автокодировщики концептуальные многообразия? https://arxiv.org/abs/2604.28119 [01:03:04] Многоуровневое управление выявляет общую геометрию представления и поведения нейронной сети https://arxiv.org/abs/2605.05115 [01:14:20] Арифметика в дикой природе: лама использует десятичное сложение для рассуждений о циклических понятиях https://arxiv.org/abs/2605.01148 [01:29:35] Измерение стремления к вознаграждению с помощью контрастных обновлений убеждений https://arxiv.org/abs/2607.18966v1 другое: [00:15:44] Преднамеренный дизайн https://www.goodfire.com/blog/intenti... [00:56:12] Мир внутри Нейронные сети https://www.goodfire.com/research/the... [01:37:28] Прагматический подход к интерпретируемости https://www.alignmentforum.org/posts/... --- RESCRIPT: https://app.rescript.info/share/846cf...