Перейти к содержимому

Как развернуть LLM | Стек LLMOps с vLLM, Docker, Grafana и MLflow

Venelin Valkov

0:00 / 0:00

Как развернуть LLM | Стек LLMOps с vLLM, Docker, Grafana и MLflow

7 956 просмотров · 9 месяцев назад
Venelin Valkov
35,4 тыс. подписчиков
7 956 просмотров · 9 месяцев назад
Запускать LLM на локальном хосте легко. Развернуть их в рабочей среде, не сойдя с ума, сложно. Большинство разработчиков просто оборачивают Python-скрипт в Docker-контейнер и на этом останавливаются. Это приводит к высокой задержке, уязвимостям безопасности и полной неразличимости при сбоях. В этом видео я покажу вам, как создать стек вывода на уровне рабочей среды с использованием потребительских графических процессоров. AI Academy: https://www.mlexpert.io/ LinkedIn:   / venelin-valkov   Подписывайтесь на меня в X:   / venelin_valkov   Discord:   / discord   Подпишитесь: http://bit.ly/venelin-subscribe Репозиторий GitHub: https://github.com/curiousily/AI-Boot... 👍 Не забудьте поставить лайк, оставить комментарий и подписаться, чтобы увидеть больше обучающих материалов! 00:00 — Почему скрипт Python не работает в продакшене 01:47 — Архитектура стека (vLLM, nginx, Grafana) 04:42 — Определение Docker Compose 08:35 — Конфигурация Nginx 09:08 — Мониторинг с помощью Prometheus и конфигурация Grafana 10:13 — Настройка виртуального экземпляра 13:54 — Тестирование нагрузки в режиме реального времени с помощью клиента LangChain Подпишитесь на этот канал, чтобы получить доступ к бонусам и поддержать мою работу:    / @venelin_valkov