Перейти к содержимому

Feedback Transformers: решение ограничений трансформеров с помощью памяти обратной связи (разбор)

Yannic Kilcher

0:00 / 0:00

Feedback Transformers: решение ограничений трансформеров с помощью памяти обратной связи (разбор)

16 055 просмотров · 5 лет назад
Yannic Kilcher
331 тыс. подписчиков
16 055 просмотров · 5 лет назад
#ai #science #transformers Авторегрессивные трансформеры захватили мир языкового моделирования (GPT-3). Однако для их обучения используются причинно-следственная маскировка и параллелизм выборок, что означает, что вычисления происходят только в прямом направлении. Это приводит к тому, что информация верхнего слоя, которая была бы доступна, не используется в нижних слоях последующих токенов, и это ведет к потере вычислительных возможностей всей модели. Трансформеры с обратной связью жертвуют скоростью обучения ради доступа к этим представлениям и демонстрируют значительные улучшения в задачах сложного рассуждения и анализа зависимостей на больших расстояниях. ПЛАН: 0:00 - Введение и обзор 1:55 - Проблемы авторегрессивной обработки 3:30 - Информационный поток в рекуррентных нейронных сетях 7:15 - Информационный поток в трансформерах 9:10 - Решение сложных вычислительных задач с помощью нейронных сетей 16:45 - Причинное маскирование в трансформерах 19:00 - Отсутствующий информационный поток в верхнем слое 26:10 - Архитектура трансформера с обратной связью 30:00 - Связь с Attention-RNN 36:00 - Формальное определение 37:05 - Экспериментальные результаты 43:10 - Заключение и комментарии Статья: https://arxiv.org/abs/2002.09402 Мое видео об Attention:    • Attention Is All You Need   ОШИБКА: Иногда я говорю «Switch Transformer» вместо «Feedback Transformer». Простите меня :) Аннотация: Трансформеры успешно применяются в последовательных авторегрессивных задачах, несмотря на то, что являются сетями прямого распространения. В отличие от рекуррентных нейронных сетей, трансформеры используют механизм внимания для захвата временных связей при параллельной обработке входных токенов. Хотя такая параллелизация делает их вычислительно эффективными, она ограничивает модель в полной мере в использовании последовательного характера входных данных. Представление на данном слое может получать доступ только к представлениям из нижних слоев, а не к уже доступным представлениям более высокого уровня. В этой работе мы предлагаем архитектуру Feedback Transformer, которая предоставляет доступ ко всем предыдущим представлениям для всех будущих представлений, то есть самое низкое представление текущего временного шага формируется из самого высокоуровневого абстрактного представления прошлого. Мы демонстрируем на различных тестовых примерах в области языкового моделирования, машинного перевода и обучения с подкреплением, что увеличенная емкость представления может создавать небольшие, неглубокие модели с гораздо более высокой производительностью, чем сопоставимые трансформеры. Авторы: Анжела Фан, Тибо Лаврил, Эдуард Грав, Арман Жулен, Сайнбаяр Сухбаатар Ссылки: Авторский код TabNine (реферальная ссылка): http://bit.ly/tabnine-yannick YouTube:    / yannickilcher   Twitter:   / ykilcher   Discord:   / discord   BitChute: https://www.bitchute.com/channel/yann... Minds: https://www.minds.com/ykilcher Parler: https://parler.com/profile/YannicKilcher LinkedIn:   / yannic-kilcher-488534136   BiliBili: https://space.bilibili.com/1824646584 Если вы хотите меня поддержать, лучше всего поделиться контентом :) Если вы хотите поддержать меня финансово (это совершенно необязательно и добровольно, но многие просили об этом): SubscribeStar: https://www.subscribestar.com/yannick... Patreon:   / yannickilcher   Bitcoin (BTC): bc1q49lsw3q325tr58ygf8sudx2dqfguclvngvy2cq Ethereum (ETH): 0x7ad3513E3B8f66799f507Aa7874b1B0eBC7F85e2 Litecoin (LTC): LQW2TRyKYetVC8WjFkhpPhtpbDM4Vw7r9m Monero (XMR): 4ACL8AGrEo5hAir8A9CeVrW8pEauWvnp1WnSDZxW7tziCDLhZAGsgzhRQABDnFy8yuM9fWJDviJPHKRjV4FWt19CJZN9D4n