Как внимание стало настолько эффективным [GQA/MLA/DSA]
Jia-Bin Huang
0:00 / 0:00
Как внимание стало настолько эффективным [GQA/MLA/DSA]
104 425 просмотров · 9 месяцев назад
Jia-Bin Huang
48,2 тыс. подписчиков
104 425 просмотров · 9 месяцев назад
Механизмы внимания стали ключом к недавнему буму искусственного интеллекта. Что произошло после многоголового внимания, описанного в основополагающей статье журнала Transformer 2017 года?
В этом видео мы разбираем несколько основных идей, которые делают внимание эффективным и масштабируемым.
00:00 Введение
00:35 Токенизация
01:21 Внимание (векторная форма)
04:26 Внимание (матричная форма)
07:07 Кэширование пар «ключ-значение»
09:42 Многозадачное внимание (MQA)
11:03 Групповое внимание (GQA)
13:32 Многозадачное латентное внимание (MLA)
15:37 MLA во время вывода
18:15 Применение RoPE к MLA (разделённый RoPE)
22:18 Разреженное внимание DeepSeek (DSA)
23:57 Квантование и вращение в DSA
27:44 Обучение DSA
Ссылки:
Многозадачное внимание (MHA): https://arxiv.org/abs/1706.03762
Многозадачное внимание (MQA): https://arxiv.org/abs/1911.02150
Групповое внимание (GQA): https://arxiv.org/abs/2305.13245
Многоголовое латентное внимание (MLA): https://arxiv.org/abs/2405.04434
Разреженное внимание (DSA) с глубоким поиском (DeepSeek): https://api-docs.deepseek.com/news/ne...
Встраивание вращающейся позиции (RoPE): https://arxiv.org/abs/2104.09864
Видео, созданное с помощью Manim: https://www.manim.community/