Перейти к содержимому

ИИ обучается на неверном уровне абстракции — Матье Вайар

Machine Learning Street Talk

0:00 / 0:00

ИИ обучается на неверном уровне абстракции — Матье Вайар

14 434 просмотра · 13 дней назад
Machine Learning Street Talk
219 тыс. подписчиков
14 434 просмотра · 13 дней назад
Этот эпизод спонсируется компанией Notion. Узнайте больше о платформе для разработчиков Notion уже сегодня на https://notion.com/mlst Почему глубокие нейронные сети могут обнаруживать абстракции, которые упускают поверхностные модели? Статистический физик Матье Вайар присоединяется к Тиму Скарфу, чтобы доказать, что ответ кроется в скрытой иерархии данных. Язык и изображения строятся из частей внутри частей; глубина позволяет сети восстанавливать эти крупнозернистые переменные и избегать проклятия размерности. Разговор переходит от блокирующих переходов и грубых поверхностей потерь к Хомскому, контекстно-свободным грамматикам и машинному творчеству. Вайар объясняет, почему предсказание следующего токена все еще может восстанавливать композиционную структуру, где современные системы не дотягивают до подлинного научного изобретения, и почему предсказание скрытых представлений, а не необработанных токенов, может сделать обучение гораздо более эффективным с точки зрения выборки. Они также рассматривают модели диффузии, законы нейронного масштабирования и пределы теории, вдохновленной физикой. Последний вопрос, на личном уровне: если ошибки — это цена отклонения от проторенной дороги, то какой научный риск стоит брать на себя? --- ВРЕМЕННЫЕ МЕТКИ: 00:00:00 Могут ли машины обучаться абстракциям на основе данных? 00:02:00 Понятие агентного рабочего пространства 00:02:49 От статистической физики к машинному обучению 00:06:40 Что физика может объяснить об обучении 00:16:37 От Карно до бульдозера Хомского 00:21:21 Как глубокие сети восстанавливают скрытые иерархии 00:32:43 Где машинное творчество все еще не дотягивает 00:40:48 Как глубокие сети избегают проклятия размерности 00:52:19 Почему предсказывать латентные значения, а не токены 01:02:49 Пример эффективности выборки для предсказания латентных значений 01:08:31 Диффузия, законы масштабирования и текстовая энтропия 01:16:40 Ученые, у которых мы учимся, и ошибки, которые мы совершаем --- ССЫЛКИ: человек: [00:00:43] Ноам Хомский https://linguistics.mit.edu/user/chom... инструмент: [00:02:08] Платформа разработчиков Notion https://www.notion.com/en-gb/blog/int... статья: [00:04:43] Освоение игры в Го с помощью глубоких нейронных сетей и поиска по дереву https://www.nature.com/articles/natur... [00:05:52] Согласование современной практики машинного обучения и компромисса между смещением и дисперсией https://arxiv.org/abs/1812.11118 [00:25:54] Как глубокие нейронные сети обучаются композиционным данным: модель случайной иерархии https://arxiv.org/abs/2307.02129 [00:42:12] Эффективная оценка Представления слов в векторном пространстве https://arxiv.org/abs/1301.3781 [00:52:46] Самостоятельное обучение на основе изображений с использованием архитектуры прогнозирования с совместным встраиванием https://arxiv.org/abs/2301.08243 [00:52:54] Обучение на основе собственных латентных данных, а не токенов: теория сложности выборки https://arxiv.org/abs/2605.27734 [01:08:31] Фазовый переход в диффузионных моделях выявляет иерархическую природу данных https://arxiv.org/abs/2402.16991 [01:11:39] Законы масштабирования для нейронного языка Модели https://arxiv.org/abs/2001.08361 [01:12:17] Выведение законов нейронного масштабирования из статистики естественного языка https://arxiv.org/abs/2602.07488 [01:13:34] Прогнозирование и энтропия печатного английского языка https://ieeexplore.ieee.org/document/... --- ССЫЛКИ: Скачать PDF-транскрипт: https://app.rescript.info/share/f7644...