Перейти к содержимому

Qwen запустили с 177 млрд параметров на видеокарте с 12 ГБ памяти

Code Unpacked

0:00 / 0:00

Qwen запустили с 177 млрд параметров на видеокарте с 12 ГБ памяти

11 866 просмотров · 2 дня назад
Code Unpacked
370 подписчиков
11 866 просмотров · 2 дня назад
Файл модели размером 82 гигабайта. Видеокарта с 12 гигабайтами видеопамяти. И модель генерирует токены — не по одному каждые несколько секунд, а со скоростью, которую вы действительно можете использовать. Интересная часть не в видеокарте. А в SSD. Qwen3.8-Flash-Next никогда не нужно помещать внутрь карты или даже в системную оперативную память: часть его остается на NVMe-накопителе и перемещается вверх по иерархии памяти только тогда, когда это необходимо. Это работает только благодаря тому, как построена модель — и именно поэтому тот же трюк не работает с плотной моделью. 🔔 Подписаться https://www.youtube.com/@Code-Unpacke... 📌 Разделы: 00:00 - Больше, чем карта. Генерация продолжается. 00:55 - Какое число является реальным? 01:41 - Важна форма 02:27 - Гораздо более полезный вопрос 03:20 - Самая странная часть Qwen 04:10 - Подтягивается по мере необходимости, отбрасывается, когда не нужно 05:10 - 12 гигабайт: рабочий набор, а не модель 06:04 - Отображение памяти изменило все 06:50 - GPU остается почти полностью заполненным 07:39 - С 16,5 до 24,4, тот же GPU 08:31 - Близко к вычислительной мощности или по запросу 09:21 - Каждая из этих частей необходима В этом видео мы разберем, как работает модель с "177 миллиардами параметров" на пятилетней RTX 3060 — и почему изменился именно SSD, а не GPU. Начнем с числа. Собственная модель Qwen разделяет данные на три части: основная языковая модель объемом 125 байт, таблица встраивания n-грамм объемом 51 байт и модуль прогнозирования нескольких токенов объемом 4 байта. В зависимости от того, что считать, это 125 байт, 176–177 байт или примерно 180 байт. Название важнее формы. Во-первых, смесь экспертов: 512 маршрутизируемых экспертов, из которых каждый токен использует 10 плюс общий эксперт — около 6 миллиардов активных параметров. Таким образом, вопрос сводится к тому, «какие эксперты мне нужны прямо сейчас?». Форк llama.cpp, созданный сообществом, отвечает на него с помощью кэша экспертов на GPU: механизмы внимания, маршрутизации и общие компоненты остаются на GPU, востребованные эксперты получают собственные слоты VRAM, а промах выбирается из более медленного уровня. Во-вторых, таблица n-грамм объемом 51 байт — это обученная таблица поиска. Qwen хеширует биграммы и триграммы ближайших токенов и ищет их встраивания. Он был разработан таким образом, чтобы не задействовать ускоритель, и одновременно обрабатывались лишь крошечные участки, поэтому он может оставаться отображенным в памяти на NVMe, пока ОС подгружает необходимые данные. Что фактически показала работа RTX 3060: • 3-битный квант: ~76,3 ГиБ файлов GGUF (~82 ГБ в десятичном представлении) • 12 ГБ видеопамяти + 32 ГБ оперативной памяти: загрузка всего этого в обычную память зависла Linux — оперативная память заполнилась, файл подкачки взорвался. Загрузка с отображением в память исправила это. • 32K контекст, 8-битный кэш ключ-значение (примерно половина 16-битного), освобожденная видеопамять, потраченная на большее количество кэшированных экспертов. • Использование GPU 9,6–11,2 ГБ, декодирование 10,8–12,4 токенов/сек, пики выше 13. • Оценка запроса coding-agent на 2603 токена заняла около 4 минут; Кэшированные потоки стали намного дешевле • Та же видеокарта, 64 ГБ ОЗУ и шестиядерный Ryzen: 16,5 токенов/сек в стандартной конфигурации → ~24,4 с экспертной конфигурацией кэширования и потоками, распределенными на шесть физических ядер Подвох: «работает на 12 ГБ» не означает, что модель уменьшилась. 12 ГБ достаточно для активного рабочего набора GPU — вам по-прежнему нужна оперативная память, быстрое хранилище и подходящее программное обеспечение, а пропускная способность ОЗУ, PCI Express и задержка NVMe имеют значение. SSD не заменили VRAM: при высокой плотности преобразователя пропускная способность хранилища сразу становится узким местом. Что вы думаете: остается ли утверждение «помещается на 12 ГБ» актуальным, когда SSD является частью процесса вывода? Дайте мне знать в комментариях. 🔗 Источники и дополнительная литература: Модель видеокарты Qwen3.8-Flash-Next (Hugging Face): https://huggingface.co/Qwen/Qwen3.8-F... Репозиторий Qwen3.8-Flash-Next (QwenLM): https://github.com/QwenLM/Qwen3.8-Fla... О проектировании архитектуры Qwen3.8-Next (статья): https://arxiv.org/pdf/2608.30320 RFC в llama.cpp — кэш экспертов MoE в видеопамяти: https://github.com/ggml-org/llama.cpp... PR в llama.cpp — кэш LRU, расположенный на GPU, для разгруженного MoE эксперты: https://github.com/ggml-org/llama.cpp... Форк llama.cpp от сообщества с кэшем экспертов CUDA MoE: https://github.com/GenerelSchwerz/lla... Обсуждение в сообществе — сохранение таблицы n-грамм на NVMe: https://huggingface.co/unsloth/Qwen3.... #Qwen #LocalAI #MixtureOfExperts #RTX3060 #LlamaCpp #LLMInference #NVMe #MoE #CodeUnpacked