Перейти к содержимому

Mamba: линейное моделирование последовательностей с селективными пространствами состояний (разбор...

Yannic Kilcher

0:00 / 0:00

Mamba: линейное моделирование последовательностей с селективными пространствами состояний (разбор...

176 665 просмотров · 2 года назад
Yannic Kilcher
331 тыс. подписчиков
176 665 просмотров · 2 года назад
#mamba #s4 #ssm ПЛАН: 0:00 - Введение 0:45 - Трансформеры против RNN против S4 6:10 - Что такое модели пространства состояний? 12:30 - Селективные модели пространства состояний 17:55 - Архитектура Mamba 22:20 - Слой SSM и прямое распространение 31:15 - Использование иерархии памяти GPU 34:05 - Эффективные вычисления с помощью префиксных сумм / параллельного сканирования 36:01 - Экспериментальные результаты и комментарии 38:00 - Краткий обзор кода Статья: https://arxiv.org/abs/2312.00752 Аннотация: Фундаментальные модели, которые сейчас лежат в основе большинства интересных приложений глубокого обучения, почти повсеместно базируются на архитектуре Трансформера и его основном модуле внимания. Для решения проблемы вычислительной неэффективности трансформеров на длинных последовательностях было разработано множество архитектур с субквадратичной сложностью, таких как линейное внимание, вентильная свертка и рекуррентные модели, а также структурированные модели пространства состояний (SSM), однако они показали себя хуже, чем модели с вниманием, на важных модальностях, таких как язык. Мы выявили, что ключевой слабостью таких моделей является их неспособность выполнять рассуждения на основе содержимого, и внесли ряд улучшений. Во-первых, простое присвоение параметрам SSM статуса функций входных данных решает их проблему с дискретными модальностями, позволяя модели избирательно распространять или забывать информацию вдоль длины последовательности в зависимости от текущего токена. Во-вторых, хотя это изменение препятствует использованию эффективных сверток, мы разработали аппаратно-ориентированный параллельный алгоритм в рекуррентном режиме. Мы интегрировали эти избирательные SSM в упрощенную сквозную архитектуру нейронной сети без внимания или даже блоков MLP (Mamba). Mamba отличается высокой скоростью вывода (в 5 раз большей пропускной способностью, чем Transformers) и линейной зависимостью от длины последовательности, а её производительность улучшается на реальных данных длиной до миллиона последовательностей. Как универсальная модель для моделирования последовательностей, Mamba демонстрирует передовые результаты в различных областях, таких как язык, аудио и геномика. В области языкового моделирования наша модель Mamba-3B превосходит Transformers того же размера и соответствует Transformers вдвое большего размера как на этапе предварительного обучения, так и на этапе последующей оценки. Авторы: Альберт Гу, Три Дао Ссылки: Главная страница: https://ykilcher.com Товары: https://ykilcher.com/merch YouTube:    / yannickilcher   Twitter:   / ykilcher   Discord: https://ykilcher.com/discord LinkedIn:   / ykilcher   Если вы хотите меня поддержать, лучше всего поделиться контентом :) Если вы хотите поддержать меня финансово (это совершенно необязательно и добровольно, но многие просили об этом): SubscribeStar: https://www.subscribestar.com/yannick... Patreon:   / yannickilcher   Bitcoin (BTC): bc1q49lsw3q325tr58ygf8sudx2dqfguclvngvy2cq Эфириум (ETH): 0x7ad3513E3B8f66799f507Aa7874b1B0eBC7F85e2 Лайткоин (LTC): LQW2TRyKYetVC8WjFkhpPhtpbDM4Vw7r9m Monero (XMR): 4ACL8AGrEo5hAir8A9CeVrW8pEauWvnp1WnSDZxW7tziCDLhZAGsgzhRQABDnFy8yuM9fWJDviJPHKRjV4FWt19CJZN9D4n