Математика, стоящая за интуицией: как LLM понимают абстрактные концепции
MartinHanderPhD
0:00 / 0:00
Математика, стоящая за интуицией: как LLM понимают абстрактные концепции
47 просмотров · 1 дн. назад
MartinHanderPhD
202 подписчика
47 просмотров · 1 дн. назад
Как большая языковая модель «понимает» нечто столь абстрактное, как истина, время или мост в Сан-Франциско? В этом подробном исследовании мы раскрываем математическую основу этой интуиции: как нейронные сети кодируют значение в виде геометрии.
Мы начинаем с дистрибутивной гипотезы и word2vec, рассматриваем, как предсказание связывает совместное появление с векторной геометрией, и следуем по пути к трансформерам, механизму внимания и остаточному потоку. Затем мы исследуем гипотезу линейного представления, линейные зонды, которые раскрывают карты мира и временные шкалы внутри Llama-2, суперпозицию в многомерных пространствах и разреженные автокодировщики, которые извлекли до 34 миллионов признаков из сонета Клода 3. Наконец, мы управляем моделями, добавляя векторы (Клод из «Золотых ворот»), изучаем, как удаление направления, связанного с отказом, меняет поведение, обнаруживаем круговые представления дней недели и рассматриваем свидетельства многоступенчатой обработки и планирования в выбранных примерах хайку Клода 3.5.
Все формулы показаны на экране с кратким пояснением; Повествование сосредоточено на интуитивном понимании каждого из них.
⏱️ Разделы
00:00 Вступление: мост внутри машины
00:44 Что вы узнаете
01:34 Дистрибутивная гипотеза
02:20 От токенов к векторам
03:07 Поиск встраивания
03:55 Косинусное сходство
04:41 word2vec и знаменитая аналогия
05:25 Векторная арифметика для аналогий
06:10 Почему предсказание создает геометрию (skip-gram и PMI)
06:54 Проблема статического значения
07:36 Внимание как маршрутизация информации
08:19 Внимание с масштабированным скалярным произведением
09:06 Остаточный поток
09:49 Обновление остаточного потока
10:34 Прямые слои как память
11:18 MLP как память ключ-значение
12:01 Гипотеза линейного представления
12:45 Определение направления концепции
13:27 Линейное зонды
14:11 Карта и часы внутри модели
14:54 Направления истины и модели мира
15:39 Слишком много концепций, слишком мало измерений
16:20 Почти ортогональность и Джонсон-Линденштраус
17:04 Суперпозиция и полисемантические нейроны
17:49 Разреженные автокодировщики
18:32 Цель SAE
19:18 Масштабирование моносемантичности (34 млн признаков)
20:01 Управление активацией
20:44 Одно направление для отказа
21:27 Когда концепции — это круги
22:12 Иерархии и ядро, свободное от языка
22:54 Рассуждения и планирование внутри модели
23:38 Ограничения и открытые вопросы
24:23 Резюме
📚 Статьи и ссылки
Харрис (1954): Дистрибутивная структура
Фирт (1957): Краткий обзор лингвистической теории 1930–1955
Миколов и др. (2013): Эффективная оценка представлений слов в векторном пространстве — arXiv:1301.3781
Миколов и др. (2013): Распределенные представления слов и фраз и их композиционность — arXiv:1310.4546
Леви и Голдберг (2014): Нейронное встраивание слов как неявная матричная факторизация (NeurIPS)
Ниссим, ван Норд и ван дер Гоот (2020): Справедливость лучше, чем сенсационность — Вычислительная лингвистика
Васвани и др. (2017): Внимание — это все, что вам нужно — arXiv:1706.03762
Браун и др. (2020): Языковые модели — это модели обучения с малым количеством примеров (GPT-3) — arXiv:2005.14165
Гева и др. (2021): Прямые слои трансформера — это память типа «ключ-значение» — arXiv:2012.14913
Парк, Чо и Вейч (2023): Гипотеза линейного представления и геометрия LLM — arXiv:2311.03658
Гурни и Тегмарк (2023): Языковые модели представляют пространство и время — arXiv:2310.02207
Ли и др. (2023): Возникающие представления мира: исследование модели последовательности, обученной на синтетической задаче (Othello-GPT) — arXiv:2210.13382
Нанда, Ли и Ваттенберг (2023): Возникающие линейные представления в моделях мира самообучающихся моделей последовательности — arXiv:2309.00941
Маркс и Тегмарк (2023): Геометрия истины: возникающая линейная структура в больших представлениях языковых моделей наборов данных «истина/ложь» — arXiv:2310.06824
Эльхаге и др. (2022): Игрушечные модели суперпозиции — transformer-circuits.pub
Брикен и др. (2023): К моносемантичности — transformer-circuits.pub
Темплтон и др. (2024): Масштабирование моносемантичности — transformer-circuits.pub/2024/scaling-monosemanticity
Ардити и др. (2024): Отказ в языковых моделях опосредуется одним направлением — arXiv:2406.11717
Энгельс и др. (2024): Не все особенности языковых моделей линейны — arXiv:2405.14860
Парк и др. (2024): Геометрия категориальных и иерархических концептов в больших языковых моделях — arXiv:2406.01506
Линдси и др. (2025): О биологии большой языковой модели — transformer-circuits.pub/2025/attribution-graphs/biology.html
Хух и др. (2024): Гипотеза платоновского представления — arXiv:2405.07987
🔔 Подпишитесь на MartinHanderPhD, чтобы получать подробные объяснения по искусственному интеллекту и машинному обучению.