llm-d: распределенный инференс LLM на Kubernetes
The Cef Experience
0:00 / 0:00
llm-d: распределенный инференс LLM на Kubernetes
2 111 просмотров · 2 месяца назад
The Cef Experience
1,63 тыс. подписчиков
2 111 просмотров · 2 месяца назад
Статья в блоге: https://cefboud.com/posts/llm-d/
llm-d: https://llm-d.ai/docs/getting-started
00:00 Введение в LLMD
00:32 Почему для вывода LLM требуется более интеллектуальная балансировка нагрузки
01:31 Объяснение Prefill и Decode
03:15 Осведомленность о кэше KV и маршрутизация сессий
04:10 Как LLMD оценивает серверы моделей
06:36 Архитектура маршрутизатора LLMD
07:48 Поток запросов клиента
08:34 Внешняя обработка Envoy (ExtProc)
10:04 Сквозная маршрутизация запросов
12:49 Расширение вывода API шлюза
15:18 Разделение Prefill/Decode
17:13 Передача кэша KV с помощью NCCL и RDMA
18:13 Архитектура плагинов и расширяемость
19:59 Управление потоком, приоритеты и автомасштабирование
20:47 Заключительные мысли