Странные геометрические фигуры, найденные внутри ИИ — Том МакГрат
Machine Learning Street Talk
0:00 / 0:00
Странные геометрические фигуры, найденные внутри ИИ — Том МакГрат
11 932 просмотра · 14 часов назад
Machine Learning Street Talk
219 тыс. подписчиков
11 932 просмотра · 14 часов назад
Том МакГрат — соучредитель и главный научный сотрудник Goodfire, а также бывший исследователь Google DeepMind. Он присоединяется к Тиму Скарфу, чтобы обсудить, чему на самом деле учатся нейронные сети, сходятся ли их внутренние представления со структурами окружающего мира и может ли интерпретируемость извлекать новые научные знания, а не просто объяснять результаты работы модели.
Начиная с AlphaZero и изученной модульности, разговор переходит к нейронной геометрии: концептуальным многообразиям, многократно используемым вычислениям внутри Llama и тому, почему управление активацией может давать сбой, когда оно выводит модель за пределы многообразия. Затем МакГрат обосновывает необходимость целенаправленного проектирования, используя интерпретируемость как часть цикла обучения. Они рассматривают контролируемое обобщение, признаки в качестве вознаграждений, отладку прогнозных данных и неприятный факт, что модель может распознать галлюцинацию или взлом системы вознаграждения и все равно воспроизвести ее.
Обсуждение завершается обсуждением осведомленности оценщиков, контроля и сговора между адаптивными агентами, а затем возвращается к разреженным автокодировщикам. Макграт утверждает, что SAE полезны, но они могут нарушать многомерные структуры, которые сети фактически используют. Этот эпизод был подготовлен при поддержке Goodfire.
--
ВРЕМЕННЫЕ МЕТКИ:
00:00:00 Введение: Может ли интерпретируемость ускорить научные исследования?
00:02:03 Невидимый оценщик
00:06:51 Чему AlphaZero научилась у мира
00:12:24 Интерпретируемость как контур управления
00:21:54 Запретный метод и более безопасные вмешательства
00:37:36 Почему модели слишком поздно обнаруживают галлюцинации
00:46:19 Отладка набора данных перед обучением
00:50:44 Почему нейронные сети становятся модульными
00:55:57 Поиск геометрии внутри сети
01:02:55 Почему управление выходит за пределы многообразия
01:12:10 Многоразовый калькулятор внутри Llama
01:17:19 От абстракций к целям
01:25:28 Вознаграждение за взлом, недосмотр и сговор
01:37:23 Умерли ли разреженные автокодировщики?
---
ССЫЛКИ:
статья:
[00:05:45] Возникающее несоответствие: узкая тонкая настройка может привести к широкому несоответствию LLM
https://arxiv.org/abs/2502.17424v7
[00:11:05] Приобретение шахматных знаний в AlphaZero
https://arxiv.org/abs/2111.09259
[00:25:30] Управление обобщением вне распределения с помощью тонкой настройки с удалением концепций
https://arxiv.org/abs/2507.16795
[00:29:30] Векторы персон: мониторинг и управление чертами характера в языковых моделях
https://arxiv.org/abs/2507.21509
[00:41:14] Признаки как награды: масштабируемое обучение для открытых задач Задачи с помощью интерпретируемости
https://arxiv.org/abs/2602.10067
[00:47:03] Анатомия постобучения: использование интерпретируемости для характеристики данных и формирования сигнала обучения
https://arxiv.org/abs/2606.12360
[01:00:26] Захватывают ли разреженные автокодировщики концептуальные многообразия?
https://arxiv.org/abs/2604.28119
[01:03:04] Многоуровневое управление выявляет общую геометрию представления и поведения нейронной сети
https://arxiv.org/abs/2605.05115
[01:14:20] Арифметика в дикой природе: лама использует десятичное сложение для рассуждений о циклических понятиях
https://arxiv.org/abs/2605.01148
[01:29:35] Измерение стремления к вознаграждению с помощью контрастных обновлений убеждений
https://arxiv.org/abs/2607.18966v1
другое:
[00:15:44] Преднамеренный дизайн
https://www.goodfire.com/blog/intenti...
[00:56:12] Мир внутри Нейронные сети
https://www.goodfire.com/research/the...
[01:37:28] Прагматический подход к интерпретируемости
https://www.alignmentforum.org/posts/...
---
RESCRIPT:
https://app.rescript.info/share/846cf...