Qwen запустили с 177 млрд параметров на видеокарте с 12 ГБ памяти
Code Unpacked
0:00 / 0:00
Qwen запустили с 177 млрд параметров на видеокарте с 12 ГБ памяти
11 866 просмотров · 2 дня назад
Code Unpacked
370 подписчиков
11 866 просмотров · 2 дня назад
Файл модели размером 82 гигабайта. Видеокарта с 12 гигабайтами видеопамяти. И модель генерирует токены — не по одному каждые несколько секунд, а со скоростью, которую вы действительно можете использовать.
Интересная часть не в видеокарте. А в SSD. Qwen3.8-Flash-Next никогда не нужно помещать внутрь карты или даже в системную оперативную память: часть его остается на NVMe-накопителе и перемещается вверх по иерархии памяти только тогда, когда это необходимо.
Это работает только благодаря тому, как построена модель — и именно поэтому тот же трюк не работает с плотной моделью.
🔔 Подписаться https://www.youtube.com/@Code-Unpacke...
📌 Разделы:
00:00 - Больше, чем карта. Генерация продолжается.
00:55 - Какое число является реальным?
01:41 - Важна форма
02:27 - Гораздо более полезный вопрос
03:20 - Самая странная часть Qwen
04:10 - Подтягивается по мере необходимости, отбрасывается, когда не нужно
05:10 - 12 гигабайт: рабочий набор, а не модель
06:04 - Отображение памяти изменило все
06:50 - GPU остается почти полностью заполненным
07:39 - С 16,5 до 24,4, тот же GPU
08:31 - Близко к вычислительной мощности или по запросу
09:21 - Каждая из этих частей необходима
В этом видео мы разберем, как работает модель с "177 миллиардами параметров" на пятилетней RTX 3060 — и почему изменился именно SSD, а не GPU.
Начнем с числа. Собственная модель Qwen разделяет данные на три части: основная языковая модель объемом 125 байт, таблица встраивания n-грамм объемом 51 байт и модуль прогнозирования нескольких токенов объемом 4 байта. В зависимости от того, что считать, это 125 байт, 176–177 байт или примерно 180 байт. Название важнее формы.
Во-первых, смесь экспертов: 512 маршрутизируемых экспертов, из которых каждый токен использует 10 плюс общий эксперт — около 6 миллиардов активных параметров. Таким образом, вопрос сводится к тому, «какие эксперты мне нужны прямо сейчас?». Форк llama.cpp, созданный сообществом, отвечает на него с помощью кэша экспертов на GPU: механизмы внимания, маршрутизации и общие компоненты остаются на GPU, востребованные эксперты получают собственные слоты VRAM, а промах выбирается из более медленного уровня.
Во-вторых, таблица n-грамм объемом 51 байт — это обученная таблица поиска. Qwen хеширует биграммы и триграммы ближайших токенов и ищет их встраивания. Он был разработан таким образом, чтобы не задействовать ускоритель, и одновременно обрабатывались лишь крошечные участки, поэтому он может оставаться отображенным в памяти на NVMe, пока ОС подгружает необходимые данные.
Что фактически показала работа RTX 3060:
• 3-битный квант: ~76,3 ГиБ файлов GGUF (~82 ГБ в десятичном представлении)
• 12 ГБ видеопамяти + 32 ГБ оперативной памяти: загрузка всего этого в обычную память зависла Linux — оперативная память заполнилась, файл подкачки взорвался. Загрузка с отображением в память исправила это.
• 32K контекст, 8-битный кэш ключ-значение (примерно половина 16-битного), освобожденная видеопамять, потраченная на большее количество кэшированных экспертов.
• Использование GPU 9,6–11,2 ГБ, декодирование 10,8–12,4 токенов/сек, пики выше 13.
• Оценка запроса coding-agent на 2603 токена заняла около 4 минут; Кэшированные потоки стали намного дешевле
• Та же видеокарта, 64 ГБ ОЗУ и шестиядерный Ryzen: 16,5 токенов/сек в стандартной конфигурации → ~24,4 с экспертной конфигурацией кэширования и потоками, распределенными на шесть физических ядер
Подвох: «работает на 12 ГБ» не означает, что модель уменьшилась. 12 ГБ достаточно для активного рабочего набора GPU — вам по-прежнему нужна оперативная память, быстрое хранилище и подходящее программное обеспечение, а пропускная способность ОЗУ, PCI Express и задержка NVMe имеют значение. SSD не заменили VRAM: при высокой плотности преобразователя пропускная способность хранилища сразу становится узким местом.
Что вы думаете: остается ли утверждение «помещается на 12 ГБ» актуальным, когда SSD является частью процесса вывода? Дайте мне знать в комментариях.
🔗 Источники и дополнительная литература:
Модель видеокарты Qwen3.8-Flash-Next (Hugging Face):
https://huggingface.co/Qwen/Qwen3.8-F...
Репозиторий Qwen3.8-Flash-Next (QwenLM):
https://github.com/QwenLM/Qwen3.8-Fla...
О проектировании архитектуры Qwen3.8-Next (статья):
https://arxiv.org/pdf/2608.30320
RFC в llama.cpp — кэш экспертов MoE в видеопамяти:
https://github.com/ggml-org/llama.cpp...
PR в llama.cpp — кэш LRU, расположенный на GPU, для разгруженного MoE эксперты:
https://github.com/ggml-org/llama.cpp...
Форк llama.cpp от сообщества с кэшем экспертов CUDA MoE:
https://github.com/GenerelSchwerz/lla...
Обсуждение в сообществе — сохранение таблицы n-грамм на NVMe:
https://huggingface.co/unsloth/Qwen3....
#Qwen #LocalAI #MixtureOfExperts #RTX3060 #LlamaCpp #LLMInference #NVMe #MoE #CodeUnpacked