Как LLM генерируют текст: GPU, KV-кэш и фазы Prefill/Decode
The Cef Experience
0:00 / 0:00
Как LLM генерируют текст: GPU, KV-кэш и фазы Prefill/Decode
552 просмотра · 3 недели назад
The Cef Experience
1,63 тыс. подписчиков
552 просмотра · 3 недели назад
📝 Блог: https://cefboud.com/
X: https://x.com/moncef_abboud
0:00 Введение в вывод LLM
0:24 Ингредиент 1: Веса модели
0:46 Ингредиент 2: Аппаратные ускорители (GPU)
1:29 Ингредиент 3: Механизмы вывода (vLLM)
2:36 Объяснение характеристик GPU: видеопамять и объем памяти
3:34 Объяснение характеристик GPU: пропускная способность памяти
4:57 Объяснение характеристик GPU: FLOPS (вычислительная и ограниченная памятью производительность)
5:34 Токенизация: преобразование текста в числа
6:00 Прогнозирование токенов и кэш ключ-значение
7:42 Этап предварительного заполнения
8:20 Этап декодирования
8:50 Разъяснение ценообразования и задержки API LLM