Перейти к содержимому

Локальные LLM на своём железе: через что запускать, какую модель выбрать и где польза

Vladimir Novator

0:00 / 0:00

Локальные LLM на своём железе: через что запускать, какую модель выбрать и где польза

2 337 просмотров · 4 дн. назад
Vladimir Novator
80 подписчиков
2 337 просмотров · 4 дн. назад
Как запустить свой ChatGPT прямо на видеокарте: без интернета, без подписок и без лимитов на токены. Разбираю локальные LLM на RTX 5090 и в конце собираю рой из трёх AI-агентов, которые одним промптом пишут игру В видео: зачем запускать нейросети у себя и когда это не окупается какие модели брать (Qwen, Gemma) и подвох с лицензиями сколько видеопамяти нужно: 8, 16, 24 и 32 ГБ квантизация простыми словами: Q4, Q6, Q8 LM Studio, Ollama или llama.cpp: что выбрать почему важно ограничивать контекст рой агентов в OpenCode: оркестратор + reviewer + QA честный итог: где польза, а где пока игрушка Мой телеграм канал: https://t.me/noovator 0:00 Вступление 0:18 Что значит запустить нейросеть у себя 1:17 Зачем это нужно: 5 причин 2:46 Что можно запускать локально 3:35 Какие модели брать и подвох с лицензиями 4:19 Какое железо нужно 5:26 Квантизация простыми словами 6:22 Чем запускать: LM Studio, Ollama, llama.cpp 7:36 LM Studio: обзор и настройки 9:11 Почему контекст надо ограничивать 9:33 Max Concurrent Predictions 10:09 Рой агентов: как устроен 11:09 Демо: Tower Defense одним промптом 12:23 Что нашли reviewer и QA 13:45 Тестим игру 14:57 Итог: игра за 10 минут 15:09 Модели без отказов 15:45 Честный итог: где польза, а где игрушка 16:31 С чего начать: 4 шага