Перейти к содержимому

Визуальное объяснение работы KV-кэша в LLM-системах | Как LLM-системы быстрее генерируют токены

ExplainingAI

0:00 / 0:00

Визуальное объяснение работы KV-кэша в LLM-системах | Как LLM-системы быстрее генерируют токены

17 390 просмотров · 5 месяцев назад
ExplainingAI
16 тыс. подписчиков
17 390 просмотров · 5 месяцев назад
Кэширование ключ-значение (KV-кэш) — одна из ключевых техник, обеспечивающих высокую скорость инференса в современных больших языковых моделях (LLM). В этом видео мы наглядно и интуитивно разбираем KV-кэш в LLM и показываем, как именно он ускоряет генерацию токенов. Начиная с вычислений механизма внимания, мы сначала понимаем, почему трансформеры пересчитывают представления ключа и значения на каждом шаге, что приводит к квадратичной сложности вычислений во время генерации. Затем мы представляем оптимизацию инференса LLM с помощью KV-кэша, где ранее вычисленные тензоры ключа и значения повторно используются на разных шагах генерации. Это снижает сложность вычислений с квадратичной до линейной, что значительно ускоряет инференс. Мы также рассматриваем полную реализацию KV-кэша в модели в стиле GPT (на основе minGPT), а также сравнение производительности и компромиссы в отношении памяти. Временные метки: 00:00 Введение - Объяснение кэша ключ-значение в LLM 00:36 Вычисления с самовниманием в трансформерах 04:19 Кэшированные вычисления - Зачем нужен кэш ключ-значение 07:28 Обзор реализации GPT (без кэша ключ-значение) 10:48 Реализация кэша ключ-значение в трансформерах (PyTorch) 17:34 Результаты - Ускорение и компромиссы в использовании памяти при использовании кэша ключ-значение 🔔 Подписаться: https://tinyurl.com/exai-channel-link 📌 Ключевые слова: #llm Электронная почта - explainingai.official@gmail.com