KV Cache, MQA и GQA: простыми словами (как LLM экономят память)
Arivu
0:00 / 0:00
KV Cache, MQA и GQA: простыми словами (как LLM экономят память)
809 просмотров · 1 месяц назад
Arivu
480 подписчиков
809 просмотров · 1 месяц назад
Каждый трансформер генерирует текст по одному токену за раз — и без кэша ключ-значение это невероятно медленно. В этом видео подробно объясняется, как кэш ключ-значение ускоряет вывод LLM, почему он становится узким местом в памяти и как многоголовочный механизм внимания (MQA), многозапросный механизм внимания (MQA) и групповой механизм внимания (GQA) решают эту проблему.
Мы начнем с того, почему авторегрессивная генерация обходится дорого, а затем рассмотрим, как кэширование пар ключ-значение в механизме внимания устраняет избыточные вычисления. Далее мы рассмотрим основной компромисс: MQA использует один набор ключей и значений для всех механизмов внимания, чтобы значительно сократить объем памяти, а GQA находит компромисс, используя ключи и значения для меньших групп механизмов — сохраняя большую часть скорости, но восстанавливая качество, которым жертвует MQA.
В конце вы поймете весь спектр от стандартного механизма внимания с несколькими головками (Multi-Head Attention) → MQA → GQA, а также более важный инженерный урок, лежащий в его основе: на практике машинное обучение редко предполагает поиск идеальных решений, оно направлено на поиск 99%, которые работают в рамках ваших ограничений.
⏱️ Разделы
0:00 Почему пошаговая генерация токенов происходит медленно
0:50 Кэш ключ-значение
1:18 Механизм внимания
1:52 Узкое место памяти GPU
2:30 Многоголовочное внимание (MHA)
3:14 Многозапросное внимание (MQA)
4:36 Группированное внимание (GQA)
🔑 Рассматриваемые темы
Кэш ключ-значение, Многозапросное внимание, Группированное внимание, оптимизация вывода трансформеров, механизмы внимания, эффективность использования памяти LLM, авторегрессивное декодирование
#МашинноеОбучение #LLM #ГлубокоеОбучение #Трансформеры #ИскусственныйИскусственныйИнтеллект