Перейти к содержимому

Математика, стоящая за интуицией: как LLM понимают абстрактные концепции

MartinHanderPhD

0:00 / 0:00

Математика, стоящая за интуицией: как LLM понимают абстрактные концепции

47 просмотров · 1 дн. назад
MartinHanderPhD
202 подписчика
47 просмотров · 1 дн. назад
Как большая языковая модель «понимает» нечто столь абстрактное, как истина, время или мост в Сан-Франциско? В этом подробном исследовании мы раскрываем математическую основу этой интуиции: как нейронные сети кодируют значение в виде геометрии. Мы начинаем с дистрибутивной гипотезы и word2vec, рассматриваем, как предсказание связывает совместное появление с векторной геометрией, и следуем по пути к трансформерам, механизму внимания и остаточному потоку. Затем мы исследуем гипотезу линейного представления, линейные зонды, которые раскрывают карты мира и временные шкалы внутри Llama-2, суперпозицию в многомерных пространствах и разреженные автокодировщики, которые извлекли до 34 миллионов признаков из сонета Клода 3. Наконец, мы управляем моделями, добавляя векторы (Клод из «Золотых ворот»), изучаем, как удаление направления, связанного с отказом, меняет поведение, обнаруживаем круговые представления дней недели и рассматриваем свидетельства многоступенчатой ​​обработки и планирования в выбранных примерах хайку Клода 3.5. Все формулы показаны на экране с кратким пояснением; Повествование сосредоточено на интуитивном понимании каждого из них. ⏱️ Разделы 00:00 Вступление: мост внутри машины 00:44 Что вы узнаете 01:34 Дистрибутивная гипотеза 02:20 От токенов к векторам 03:07 Поиск встраивания 03:55 Косинусное сходство 04:41 word2vec и знаменитая аналогия 05:25 Векторная арифметика для аналогий 06:10 Почему предсказание создает геометрию (skip-gram и PMI) 06:54 Проблема статического значения 07:36 Внимание как маршрутизация информации 08:19 Внимание с масштабированным скалярным произведением 09:06 Остаточный поток 09:49 Обновление остаточного потока 10:34 Прямые слои как память 11:18 MLP как память ключ-значение 12:01 Гипотеза линейного представления 12:45 Определение направления концепции 13:27 Линейное зонды 14:11 Карта и часы внутри модели 14:54 Направления истины и модели мира 15:39 Слишком много концепций, слишком мало измерений 16:20 Почти ортогональность и Джонсон-Линденштраус 17:04 Суперпозиция и полисемантические нейроны 17:49 Разреженные автокодировщики 18:32 Цель SAE 19:18 Масштабирование моносемантичности (34 млн признаков) 20:01 Управление активацией 20:44 Одно направление для отказа 21:27 Когда концепции — это круги 22:12 Иерархии и ядро, свободное от языка 22:54 Рассуждения и планирование внутри модели 23:38 Ограничения и открытые вопросы 24:23 Резюме 📚 Статьи и ссылки Харрис (1954): Дистрибутивная структура Фирт (1957): Краткий обзор лингвистической теории 1930–1955 Миколов и др. (2013): Эффективная оценка представлений слов в векторном пространстве — arXiv:1301.3781 Миколов и др. (2013): Распределенные представления слов и фраз и их композиционность — arXiv:1310.4546 Леви и Голдберг (2014): Нейронное встраивание слов как неявная матричная факторизация (NeurIPS) Ниссим, ван Норд и ван дер Гоот (2020): Справедливость лучше, чем сенсационность — Вычислительная лингвистика Васвани и др. (2017): Внимание — это все, что вам нужно — arXiv:1706.03762 Браун и др. (2020): Языковые модели — это модели обучения с малым количеством примеров (GPT-3) — arXiv:2005.14165 Гева и др. (2021): Прямые слои трансформера — это память типа «ключ-значение» — arXiv:2012.14913 Парк, Чо и Вейч (2023): Гипотеза линейного представления и геометрия LLM — arXiv:2311.03658 Гурни и Тегмарк (2023): Языковые модели представляют пространство и время — arXiv:2310.02207 Ли и др. (2023): Возникающие представления мира: исследование модели последовательности, обученной на синтетической задаче (Othello-GPT) — arXiv:2210.13382 Нанда, Ли и Ваттенберг (2023): Возникающие линейные представления в моделях мира самообучающихся моделей последовательности — arXiv:2309.00941 Маркс и Тегмарк (2023): Геометрия истины: возникающая линейная структура в больших представлениях языковых моделей наборов данных «истина/ложь» — arXiv:2310.06824 Эльхаге и др. (2022): Игрушечные модели суперпозиции — transformer-circuits.pub Брикен и др. (2023): К моносемантичности — transformer-circuits.pub Темплтон и др. (2024): Масштабирование моносемантичности — transformer-circuits.pub/2024/scaling-monosemanticity Ардити и др. (2024): Отказ в языковых моделях опосредуется одним направлением — arXiv:2406.11717 Энгельс и др. (2024): Не все особенности языковых моделей линейны — arXiv:2405.14860 Парк и др. (2024): Геометрия категориальных и иерархических концептов в больших языковых моделях — arXiv:2406.01506 Линдси и др. (2025): О биологии большой языковой модели — transformer-circuits.pub/2025/attribution-graphs/biology.html Хух и др. (2024): Гипотеза платоновского представления — arXiv:2405.07987 🔔 Подпишитесь на MartinHanderPhD, чтобы получать подробные объяснения по искусственному интеллекту и машинному обучению.