Локальные LLM на своём железе: через что запускать, какую модель выбрать и где польза
Vladimir Novator
0:00 / 0:00
Локальные LLM на своём железе: через что запускать, какую модель выбрать и где польза
2 337 просмотров · 4 дн. назад
Vladimir Novator
80 подписчиков
2 337 просмотров · 4 дн. назад
Как запустить свой ChatGPT прямо на видеокарте: без интернета, без подписок и без лимитов на токены. Разбираю локальные LLM на RTX 5090 и в конце собираю рой из трёх AI-агентов, которые одним промптом пишут игру
В видео:
зачем запускать нейросети у себя и когда это не окупается
какие модели брать (Qwen, Gemma) и подвох с лицензиями
сколько видеопамяти нужно: 8, 16, 24 и 32 ГБ
квантизация простыми словами: Q4, Q6, Q8
LM Studio, Ollama или llama.cpp: что выбрать
почему важно ограничивать контекст
рой агентов в OpenCode: оркестратор + reviewer + QA
честный итог: где польза, а где пока игрушка
Мой телеграм канал: https://t.me/noovator
0:00 Вступление
0:18 Что значит запустить нейросеть у себя
1:17 Зачем это нужно: 5 причин
2:46 Что можно запускать локально
3:35 Какие модели брать и подвох с лицензиями
4:19 Какое железо нужно
5:26 Квантизация простыми словами
6:22 Чем запускать: LM Studio, Ollama, llama.cpp
7:36 LM Studio: обзор и настройки
9:11 Почему контекст надо ограничивать
9:33 Max Concurrent Predictions
10:09 Рой агентов: как устроен
11:09 Демо: Tower Defense одним промптом
12:23 Что нашли reviewer и QA
13:45 Тестим игру
14:57 Итог: игра за 10 минут
15:09 Модели без отказов
15:45 Честный итог: где польза, а где игрушка
16:31 С чего начать: 4 шага