Перейти к содержимому

Qwen 180B на 12 ГБ видеопамяти? Разбираем заявление Strata о 45.8 ток/с

CloudAICode

0:00 / 0:00

Qwen 180B на 12 ГБ видеопамяти? Разбираем заявление Strata о 45.8 ток/с

4 049 просмотров · 5 дней назад
CloudAICode
132 подписчика
4 049 просмотров · 5 дней назад
#strata #qwen3 #localllm Может ли 12-гигабайтная RTX 5070 действительно запустить Qwen3.8-Flash-Next со скоростью 45,8 токенов в секунду? Strata распределяет 180-битную систему параметров между видеопамятью графического процессора, системной оперативной памятью и NVMe SSD, при этом вычисляя некэшированные эксперты на ЦП вместо многократного переноса их весов. Этот анализ охватывает все основные компоненты: ядро ​​с 125-битной смесью экспертов, 51-битную таблицу n-грамм, 4-битный слой предсказания многотокенов, адаптивный кэш экспертов, варианты квантизации, ограничения контекста и представленные результаты бенчмарков. Он также рассматривает отсутствующее независимое воспроизведение, недокументированную базовую скорость 15 токенов/с, лежащую в основе заявления о «в 3 раза большей скорости», оценочные результаты для других графических процессоров и отсутствие лицензии у Strata. 🔗 Движок и модель: Strata (движок вывода, на GitHub, без файла лицензии) Qwen3.8-Flash-Next (модель 180 байт) Qwen на GitHub https://github.com/QwenLM ⚡ Упомянуто вскользь: • llama.cpp (стандартный вариант, с разгрузкой памяти) https://github.com/ggml-org/llama.cpp • Hugging Face (где хранятся квантованные файлы) https://huggingface.co #strata #qwen3 #localllm #mixtureofexperts #12gbvram #llamacpp #quantization #inference #localai 👇 ПОДПИСЫВАЙТЕСЬ И СМОТРИТЕ ДАЛЕЕ Подписывайтесь, чтобы каждую неделю получать новые подробные обзоры:    / @cloudaicode   Пользователь Запросы: запуск модели 180b на 12 ГБ GPU движок вывода Strata qwen3.8 flash next local сколько видеопамяти для qwen3.8 flash next как работает Mixed of Experts разгрузка ЦП вместо перемещения весов качество квантования 2 бит против 3 бит лучший локальный LLM для 64 ГБ ОЗУ Llama C++ медленная с разгрузкой GPU объяснение ускорения предсказания нескольких токенов