ИИ обучается на неверном уровне абстракции — Матье Вайар
Machine Learning Street Talk
0:00 / 0:00
ИИ обучается на неверном уровне абстракции — Матье Вайар
14 434 просмотра · 13 дней назад
Machine Learning Street Talk
219 тыс. подписчиков
14 434 просмотра · 13 дней назад
Этот эпизод спонсируется компанией Notion. Узнайте больше о платформе для разработчиков Notion уже сегодня на https://notion.com/mlst
Почему глубокие нейронные сети могут обнаруживать абстракции, которые упускают поверхностные модели? Статистический физик Матье Вайар присоединяется к Тиму Скарфу, чтобы доказать, что ответ кроется в скрытой иерархии данных. Язык и изображения строятся из частей внутри частей; глубина позволяет сети восстанавливать эти крупнозернистые переменные и избегать проклятия размерности.
Разговор переходит от блокирующих переходов и грубых поверхностей потерь к Хомскому, контекстно-свободным грамматикам и машинному творчеству. Вайар объясняет, почему предсказание следующего токена все еще может восстанавливать композиционную структуру, где современные системы не дотягивают до подлинного научного изобретения, и почему предсказание скрытых представлений, а не необработанных токенов, может сделать обучение гораздо более эффективным с точки зрения выборки.
Они также рассматривают модели диффузии, законы нейронного масштабирования и пределы теории, вдохновленной физикой. Последний вопрос, на личном уровне: если ошибки — это цена отклонения от проторенной дороги, то какой научный риск стоит брать на себя?
---
ВРЕМЕННЫЕ МЕТКИ:
00:00:00 Могут ли машины обучаться абстракциям на основе данных?
00:02:00 Понятие агентного рабочего пространства
00:02:49 От статистической физики к машинному обучению
00:06:40 Что физика может объяснить об обучении
00:16:37 От Карно до бульдозера Хомского
00:21:21 Как глубокие сети восстанавливают скрытые иерархии
00:32:43 Где машинное творчество все еще не дотягивает
00:40:48 Как глубокие сети избегают проклятия размерности
00:52:19 Почему предсказывать латентные значения, а не токены
01:02:49 Пример эффективности выборки для предсказания латентных значений
01:08:31 Диффузия, законы масштабирования и текстовая энтропия
01:16:40 Ученые, у которых мы учимся, и ошибки, которые мы совершаем
---
ССЫЛКИ:
человек:
[00:00:43] Ноам Хомский
https://linguistics.mit.edu/user/chom...
инструмент:
[00:02:08] Платформа разработчиков Notion
https://www.notion.com/en-gb/blog/int...
статья:
[00:04:43] Освоение игры в Го с помощью глубоких нейронных сетей и поиска по дереву
https://www.nature.com/articles/natur...
[00:05:52] Согласование современной практики машинного обучения и компромисса между смещением и дисперсией
https://arxiv.org/abs/1812.11118
[00:25:54] Как глубокие нейронные сети обучаются композиционным данным: модель случайной иерархии
https://arxiv.org/abs/2307.02129
[00:42:12] Эффективная оценка Представления слов в векторном пространстве
https://arxiv.org/abs/1301.3781
[00:52:46] Самостоятельное обучение на основе изображений с использованием архитектуры прогнозирования с совместным встраиванием
https://arxiv.org/abs/2301.08243
[00:52:54] Обучение на основе собственных латентных данных, а не токенов: теория сложности выборки
https://arxiv.org/abs/2605.27734
[01:08:31] Фазовый переход в диффузионных моделях выявляет иерархическую природу данных
https://arxiv.org/abs/2402.16991
[01:11:39] Законы масштабирования для нейронного языка Модели
https://arxiv.org/abs/2001.08361
[01:12:17] Выведение законов нейронного масштабирования из статистики естественного языка
https://arxiv.org/abs/2602.07488
[01:13:34] Прогнозирование и энтропия печатного английского языка
https://ieeexplore.ieee.org/document/...
---
ССЫЛКИ:
Скачать PDF-транскрипт: https://app.rescript.info/share/f7644...