Перейти к содержимому

Как внимание стало настолько эффективным [GQA/MLA/DSA]

Jia-Bin Huang

0:00 / 0:00

Как внимание стало настолько эффективным [GQA/MLA/DSA]

104 425 просмотров · 9 месяцев назад
Jia-Bin Huang
48,2 тыс. подписчиков
104 425 просмотров · 9 месяцев назад
Механизмы внимания стали ключом к недавнему буму искусственного интеллекта. Что произошло после многоголового внимания, описанного в основополагающей статье журнала Transformer 2017 года? В этом видео мы разбираем несколько основных идей, которые делают внимание эффективным и масштабируемым. 00:00 Введение 00:35 Токенизация 01:21 Внимание (векторная форма) 04:26 Внимание (матричная форма) 07:07 Кэширование пар «ключ-значение» 09:42 Многозадачное внимание (MQA) 11:03 Групповое внимание (GQA) 13:32 Многозадачное латентное внимание (MLA) 15:37 MLA во время вывода 18:15 Применение RoPE к MLA (разделённый RoPE) 22:18 Разреженное внимание DeepSeek (DSA) 23:57 Квантование и вращение в DSA 27:44 Обучение DSA Ссылки: Многозадачное внимание (MHA): https://arxiv.org/abs/1706.03762 Многозадачное внимание (MQA): https://arxiv.org/abs/1911.02150 Групповое внимание (GQA): https://arxiv.org/abs/2305.13245 Многоголовое латентное внимание (MLA): https://arxiv.org/abs/2405.04434 Разреженное внимание (DSA) с глубоким поиском (DeepSeek): https://api-docs.deepseek.com/news/ne... Встраивание вращающейся позиции (RoPE): https://arxiv.org/abs/2104.09864 Видео, созданное с помощью Manim: https://www.manim.community/