Перейти к содержимому

Как LLM генерируют текст: GPU, KV-кэш и фазы Prefill/Decode

The Cef Experience

0:00 / 0:00

Как LLM генерируют текст: GPU, KV-кэш и фазы Prefill/Decode

552 просмотра · 3 недели назад
The Cef Experience
1,63 тыс. подписчиков
552 просмотра · 3 недели назад
📝 Блог: https://cefboud.com/ X: https://x.com/moncef_abboud 0:00 Введение в вывод LLM 0:24 Ингредиент 1: Веса модели 0:46 Ингредиент 2: Аппаратные ускорители (GPU) 1:29 Ингредиент 3: Механизмы вывода (vLLM) 2:36 Объяснение характеристик GPU: видеопамять и объем памяти 3:34 Объяснение характеристик GPU: пропускная способность памяти 4:57 Объяснение характеристик GPU: FLOPS (вычислительная и ограниченная памятью производительность) 5:34 Токенизация: преобразование текста в числа 6:00 Прогнозирование токенов и кэш ключ-значение 7:42 Этап предварительного заполнения 8:20 Этап декодирования 8:50 Разъяснение ценообразования и задержки API LLM