Перейти к содержимому

Запуск нейросети на 125 млрд параметров на домашнем ПК (это реально работает)

Singularity Feed | AI Models , Agents & Robotics

0:00 / 0:00

Запуск нейросети на 125 млрд параметров на домашнем ПК (это реально работает)

657 просмотров · 3 дня назад
Singularity Feed | AI Models , Agents & Robotics
309 подписчиков
657 просмотров · 3 дня назад
Может ли обычный игровой ПК запустить модель искусственного интеллекта с 125 миллиардами параметров? С Strata — да: одна видеокарта NVIDIA с 12 ГБ видеопамяти, 64 ГБ оперативной памяти и ответами со скоростью от 60 до 95 токенов в секунду, быстрее, чем вы успеете прочитать. В этом видео я объясняю, что такое Strata, как она умещает модель с 66 ГБ на видеокарте с 12 ГБ (используя простую кухонную аналогию), и как установить и использовать её в Windows или Linux. Strata на GitHub: https://github.com/Niko1221/Strata РАЗДЕЛЫ 0:00 Модель с 125 миллиардами параметров на игровом ПК 0:20 Что такое Strata? 0:34 Проблема: модель 66 ГБ, карта 12 ГБ 0:46 Аналогия с кухней 1:07 24 576 экспертов, 10 на слово 1:26 GPU, RAM + CPU и SSD: кто что делает 1:59 Предположение, затем проверка (спекулятивное декодирование) 2:21 Измеренная скорость на RTX 5070 2:37 Что вам нужно 3:02 Как установить 3:33 Внимание: первый запуск 3:47 Использование Strata: чат, монитор и API 4:19 Какой размер выбрать? ЧТО ТАКОЕ STRATA? Strata — это бесплатный движок вывода с открытым исходным кодом (MIT), который запускает Qwen3.8-Flash-Next, модель смешения экспертов с 125 миллиардами параметров, для которой обычно требуется сервер, на вашем собственном компьютере. Он построен таким образом, что видеокарта, процессор, оперативная память и SSD работают одновременно, а не ждут друг друга. Установка выполняется в один клик: устанавливается Python, движок и модель. КАК ЭТО РАБОТАЕТ (КУХОННАЯ АНАЛОГИЯ) Представьте себе кухню ресторана: то, что шеф-повар использует постоянно, лежит на прилавке, остальное ждет в кладовой, а основные запасы хранятся на складе. Модель представляет собой команду из 24 576 маленьких специалистов, называемых экспертами, и для каждого написанного слова требуется всего 10 из них. Видеокарта (счетчик): выполняет основную работу для каждого слова и хранит несколько тысяч наиболее часто используемых экспертов. Она постоянно изучает, какие именно эксперты используются, пока вы общаетесь. Оперативная память + ЦП (кладовая): оперативная память хранит всех экспертов. Когда для слова требуется эксперт, которого нет на видеокарте, процессор вычисляет его на месте, одновременно с графическим процессором. - SSD (хранилище): содержит таблицу поиска размером 29 ГБ, и модель считывает лишь несколько небольших строк из неё на каждое слово. Угадывание, затем проверка: небольшой вспомогательный модуль, встроенный в модель, угадывает следующие несколько слов, а основная модель проверяет их все за один проход. Основная модель по-прежнему определяет каждое слово, поэтому качество остаётся тем же, а ответы поступают в 1,6–1,8 раза быстрее. ИЗМЕРЕННАЯ СКОРОСТЬ (RTX 5070 12 ГБ, Ryzen 5 7600, 64 ГБ ОЗУ, короткий чат) Q2_0: около 93 токенов/с (самый быстрый) IQ2_XS: около 79 токенов/с (рекомендуемый) IQ3_XXS: около 62 токенов/с Coder: около 55 токенов/с IQ3_S: около 53 токенов/с (лучшее качество) Длинные подсказки считываются со скоростью более 1000 токенов в секунду (до примерно 2170 токенов/с при подсказке 32K). Чем больше видеопамяти, тем быстрее: для RTX 3090 это примерно 100-140 токенов/с. ЧТО ВАМ ПОНАДОБИТСЯ Видеокарта NVIDIA RTX 20, 30, 40 или 50 серии с 12 ГБ видеопамяти или больше Достаточно оперативной памяти для выбранного вами объема: 64 ГБ подойдут для любого объема, а версия Coder работает на 32 ГБ Около 80 ГБ свободного места на диске, в идеале SSD Windows 10/11 или Linux Актуальный драйвер NVIDIA (единственное, что вы устанавливаете самостоятельно) КАК УСТАНОВИТЬ 1. Скачайте проект с GitHub и распакуйте его (или клонируйте репозиторий git). 2. Windows: дважды щелкните START-HERE.bat. Linux: запустите ./setup.sh. 3. Ответьте на несколько вопросов (модель, размер, контекст, изображения) или нажимайте Enter каждый раз для рекомендуемого варианта ответа. 4. Он загружает всё. Модель занимает около 70 ГБ, поэтому первый запуск занимает некоторое время, и если вы его остановите, он продолжит с того места, где остановился. При первом запуске ваш компьютер может зависнуть на 1-3 минуты, пока Strata загружает десятки гигабайт данных в память. Это нормально: не закрывайте окно. В следующий раз он запустится сразу же. ИСПОЛЬЗОВАНИЕ Приложение Strata открывается в вашем браузере по адресу http://127.0.0.1:8080: чат, монитор в реальном времени графического процессора, центрального процессора и оперативной памяти, а также раздел «О программе». Приложения и агенты кодирования: добавьте провайдер, совместимый с OpenAI, с базовым URL-адресом http://127.0.0.1:8080/v1, любым ключом API и любым именем модели. Приложения, созданные для API Anthropic, могут использовать http://127.0.0.1:8080/v1/messages. Уровень мышления: выключен, низкий, средний или высокий. Он также умеет считывать изображения. КАКОЙ РАЗМЕР ВЫБРАТЬ? Не уверены? Возьмите IQ2_XS. Выберите Coder, если вы в основном пишете код или у вас от 32 до 48 ГБ оперативной памяти. ССЫЛКИ Strata (GitHub): https://github.com/Niko1221/Strata Все ...