Перейти к содержимому

KV Cache, MQA и GQA: простыми словами (как LLM экономят память)

Arivu

0:00 / 0:00

KV Cache, MQA и GQA: простыми словами (как LLM экономят память)

809 просмотров · 1 месяц назад
Arivu
480 подписчиков
809 просмотров · 1 месяц назад
Каждый трансформер генерирует текст по одному токену за раз — и без кэша ключ-значение это невероятно медленно. В этом видео подробно объясняется, как кэш ключ-значение ускоряет вывод LLM, почему он становится узким местом в памяти и как многоголовочный механизм внимания (MQA), многозапросный механизм внимания (MQA) и групповой механизм внимания (GQA) решают эту проблему. Мы начнем с того, почему авторегрессивная генерация обходится дорого, а затем рассмотрим, как кэширование пар ключ-значение в механизме внимания устраняет избыточные вычисления. Далее мы рассмотрим основной компромисс: MQA использует один набор ключей и значений для всех механизмов внимания, чтобы значительно сократить объем памяти, а GQA находит компромисс, используя ключи и значения для меньших групп механизмов — сохраняя большую часть скорости, но восстанавливая качество, которым жертвует MQA. В конце вы поймете весь спектр от стандартного механизма внимания с несколькими головками (Multi-Head Attention) → MQA → GQA, а также более важный инженерный урок, лежащий в его основе: на практике машинное обучение редко предполагает поиск идеальных решений, оно направлено на поиск 99%, которые работают в рамках ваших ограничений. ⏱️ Разделы 0:00 Почему пошаговая генерация токенов происходит медленно 0:50 Кэш ключ-значение 1:18 Механизм внимания 1:52 Узкое место памяти GPU 2:30 Многоголовочное внимание (MHA) 3:14 Многозапросное внимание (MQA) 4:36 Группированное внимание (GQA) 🔑 Рассматриваемые темы Кэш ключ-значение, Многозапросное внимание, Группированное внимание, оптимизация вывода трансформеров, механизмы внимания, эффективность использования памяти LLM, авторегрессивное декодирование #МашинноеОбучение #LLM #ГлубокоеОбучение #Трансформеры #ИскусственныйИскусственныйИнтеллект