Перейти к содержимому

llm-d: распределенный инференс LLM на Kubernetes

The Cef Experience

0:00 / 0:00

llm-d: распределенный инференс LLM на Kubernetes

2 111 просмотров · 2 месяца назад
The Cef Experience
1,63 тыс. подписчиков
2 111 просмотров · 2 месяца назад
Статья в блоге: https://cefboud.com/posts/llm-d/ llm-d: https://llm-d.ai/docs/getting-started 00:00 Введение в LLMD 00:32 Почему для вывода LLM требуется более интеллектуальная балансировка нагрузки 01:31 Объяснение Prefill и Decode 03:15 Осведомленность о кэше KV и маршрутизация сессий 04:10 Как LLMD оценивает серверы моделей 06:36 Архитектура маршрутизатора LLMD 07:48 Поток запросов клиента 08:34 Внешняя обработка Envoy (ExtProc) 10:04 Сквозная маршрутизация запросов 12:49 Расширение вывода API шлюза 15:18 Разделение Prefill/Decode 17:13 Передача кэша KV с помощью NCCL и RDMA 18:13 Архитектура плагинов и расширяемость 19:59 Управление потоком, приоритеты и автомасштабирование 20:47 Заключительные мысли