Feedback Transformers: решение ограничений трансформеров с помощью памяти обратной связи (разбор)
Yannic Kilcher
0:00 / 0:00
Feedback Transformers: решение ограничений трансформеров с помощью памяти обратной связи (разбор)
16 055 просмотров · 5 лет назад
Yannic Kilcher
331 тыс. подписчиков
16 055 просмотров · 5 лет назад
#ai #science #transformers
Авторегрессивные трансформеры захватили мир языкового моделирования (GPT-3). Однако для их обучения используются причинно-следственная маскировка и параллелизм выборок, что означает, что вычисления происходят только в прямом направлении. Это приводит к тому, что информация верхнего слоя, которая была бы доступна, не используется в нижних слоях последующих токенов, и это ведет к потере вычислительных возможностей всей модели. Трансформеры с обратной связью жертвуют скоростью обучения ради доступа к этим представлениям и демонстрируют значительные улучшения в задачах сложного рассуждения и анализа зависимостей на больших расстояниях.
ПЛАН:
0:00 - Введение и обзор
1:55 - Проблемы авторегрессивной обработки
3:30 - Информационный поток в рекуррентных нейронных сетях
7:15 - Информационный поток в трансформерах
9:10 - Решение сложных вычислительных задач с помощью нейронных сетей
16:45 - Причинное маскирование в трансформерах
19:00 - Отсутствующий информационный поток в верхнем слое
26:10 - Архитектура трансформера с обратной связью
30:00 - Связь с Attention-RNN
36:00 - Формальное определение
37:05 - Экспериментальные результаты
43:10 - Заключение и комментарии
Статья: https://arxiv.org/abs/2002.09402
Мое видео об Attention: • Attention Is All You Need
ОШИБКА: Иногда я говорю «Switch Transformer» вместо «Feedback Transformer». Простите меня :)
Аннотация:
Трансформеры успешно применяются в последовательных авторегрессивных задачах, несмотря на то, что являются сетями прямого распространения. В отличие от рекуррентных нейронных сетей, трансформеры используют механизм внимания для захвата временных связей при параллельной обработке входных токенов. Хотя такая параллелизация делает их вычислительно эффективными, она ограничивает модель в полной мере в использовании последовательного характера входных данных. Представление на данном слое может получать доступ только к представлениям из нижних слоев, а не к уже доступным представлениям более высокого уровня. В этой работе мы предлагаем архитектуру Feedback Transformer, которая предоставляет доступ ко всем предыдущим представлениям для всех будущих представлений, то есть самое низкое представление текущего временного шага формируется из самого высокоуровневого абстрактного представления прошлого. Мы демонстрируем на различных тестовых примерах в области языкового моделирования, машинного перевода и обучения с подкреплением, что увеличенная емкость представления может создавать небольшие, неглубокие модели с гораздо более высокой производительностью, чем сопоставимые трансформеры.
Авторы: Анжела Фан, Тибо Лаврил, Эдуард Грав, Арман Жулен, Сайнбаяр Сухбаатар
Ссылки:
Авторский код TabNine (реферальная ссылка): http://bit.ly/tabnine-yannick
YouTube: / yannickilcher
Twitter: / ykilcher
Discord: / discord
BitChute: https://www.bitchute.com/channel/yann...
Minds: https://www.minds.com/ykilcher
Parler: https://parler.com/profile/YannicKilcher
LinkedIn: / yannic-kilcher-488534136
BiliBili: https://space.bilibili.com/1824646584
Если вы хотите меня поддержать, лучше всего поделиться контентом :)
Если вы хотите поддержать меня финансово (это совершенно необязательно и добровольно, но многие просили об этом):
SubscribeStar: https://www.subscribestar.com/yannick...
Patreon: / yannickilcher
Bitcoin (BTC): bc1q49lsw3q325tr58ygf8sudx2dqfguclvngvy2cq
Ethereum (ETH): 0x7ad3513E3B8f66799f507Aa7874b1B0eBC7F85e2
Litecoin (LTC): LQW2TRyKYetVC8WjFkhpPhtpbDM4Vw7r9m
Monero (XMR): 4ACL8AGrEo5hAir8A9CeVrW8pEauWvnp1WnSDZxW7tziCDLhZAGsgzhRQABDnFy8yuM9fWJDviJPHKRjV4FWt19CJZN9D4n