Qwen 180B на 12 ГБ видеопамяти? Разбираем заявление Strata о 45.8 ток/с
CloudAICode
0:00 / 0:00
Qwen 180B на 12 ГБ видеопамяти? Разбираем заявление Strata о 45.8 ток/с
4 049 просмотров · 5 дней назад
CloudAICode
132 подписчика
4 049 просмотров · 5 дней назад
#strata #qwen3 #localllm
Может ли 12-гигабайтная RTX 5070 действительно запустить Qwen3.8-Flash-Next со скоростью 45,8 токенов в секунду? Strata распределяет 180-битную систему параметров между видеопамятью графического процессора, системной оперативной памятью и NVMe SSD, при этом вычисляя некэшированные эксперты на ЦП вместо многократного переноса их весов.
Этот анализ охватывает все основные компоненты: ядро с 125-битной смесью экспертов, 51-битную таблицу n-грамм, 4-битный слой предсказания многотокенов, адаптивный кэш экспертов, варианты квантизации, ограничения контекста и представленные результаты бенчмарков. Он также рассматривает отсутствующее независимое воспроизведение, недокументированную базовую скорость 15 токенов/с, лежащую в основе заявления о «в 3 раза большей скорости», оценочные результаты для других графических процессоров и отсутствие лицензии у Strata.
🔗 Движок и модель:
Strata (движок вывода, на GitHub, без файла лицензии)
Qwen3.8-Flash-Next (модель 180 байт)
Qwen на GitHub
https://github.com/QwenLM
⚡ Упомянуто вскользь:
• llama.cpp (стандартный вариант, с разгрузкой памяти)
https://github.com/ggml-org/llama.cpp
• Hugging Face (где хранятся квантованные файлы)
https://huggingface.co
#strata #qwen3 #localllm #mixtureofexperts #12gbvram #llamacpp #quantization #inference #localai
👇 ПОДПИСЫВАЙТЕСЬ И СМОТРИТЕ ДАЛЕЕ
Подписывайтесь, чтобы каждую неделю получать новые подробные обзоры: / @cloudaicode
Пользователь Запросы:
запуск модели 180b на 12 ГБ GPU
движок вывода Strata
qwen3.8 flash next local
сколько видеопамяти для qwen3.8 flash next
как работает Mixed of Experts
разгрузка ЦП вместо перемещения весов
качество квантования 2 бит против 3 бит
лучший локальный LLM для 64 ГБ ОЗУ
Llama C++ медленная с разгрузкой GPU
объяснение ускорения предсказания нескольких токенов