Qwen 3.8 27B в 8,4 ГБ. Но не скачивайте эту версию
Cloud Codes
0:00 / 0:00
Qwen 3.8 27B в 8,4 ГБ. Но не скачивайте эту версию
24 651 просмотр · 1 день назад
Cloud Codes
38,5 тыс. подписчиков
24 651 просмотр · 1 день назад
При одинаковом размере файла в 8,4 ГБ квантизация Qwen 3.8 27B с помощью GSQ-RCO от ISTA DASLab превосходит сборки Unsloth GGUF, используемые сообществом, на 7,72 балла в тестах AIME25, GPQA-Diamond и LiveCodeBench v6, оставаясь при этом на 100% совместимой с нативным llama.cpp. Благодаря сочетанию квантизации Гумбеля-Софтмакса (GSQ) для дифференцируемого округления весов с оптимизацией с ограничениями Римана (RCO) в пространстве поиска из 851 тензора, этот конвейер преодолевает барьер ошибок скалярных значений менее 4 бит без необходимости использования пользовательских ядер декомпрессии.
🔔 Подпишитесь: / @cloud-codes
💙 Станьте участником: / @cloud-codes
🐦 Twitter/X:
https://x.com/cloud_codes
💬 Discord:
/ discord
В этом подробном анализе Cloud Codes разбирает дамп распределения ресурсов для каждого тензора, который выявляет недостатки традиционных настроек GGUF по умолчанию: почему математический градиентный спуск сдвинул таблицу встраивания токенов до IQ1_M (близко к самой низкой точности в файле), сохранил выходной заголовок на уровне IQ4_XS и кластеризовал тридцать девять 1-битных тензоров в первой четверти сети, оставив последнюю четверть без кластеризации без изменений. Мы также провели реальные расчеты объема видеопамяти для 16 ГБ GPU — с учетом гибридной архитектуры Gated DeltaNet от Qwen, проектора зрения объемом 0,93 ГБ и кэша KV объемом 8,6 ГБ с контекстом 128k — чтобы объяснить, почему контрольная точка 9,3 ГБ (IQ2_S) является оптимальным вариантом для локального программирования и математических вычислений.
Если этот анализ помог вам понять квантование LLM с низким битовым кодом, оптимизацию римановых многообразий и определение размера локальной памяти GPU, подпишитесь на Cloud Codes, чтобы каждую неделю получать новый подробный обзор инфраструктуры.
Создавайте, решайте, развертывайте.
🔗 Упомянутые ресурсы:
• Репозиторий ISTA DASLab Qwen 3.8 27B GSQ-RCO GGUF:
https://huggingface.co/ISTA-DASLab/Qw...
• Дамп тензорного распределения GSQ-RCO, 8,4 ГБ (rco-allocation.txt):
https://huggingface.co/ISTA-DASLab/Qw...
• Документ GSQ (Дадгарния и др., arXiv:2604.18556):
https://arxiv.org/abs/2604.18556
• Статья RCO (Helcig & Alistarh, arXiv:2605.00649):
https://arxiv.org/abs/2605.00649
• Официальная модель карты Qwen 3.8 27B:
https://huggingface.co/Qwen/Qwen3.8-27B
• Релиз Unsloth Qwen 3.8 27B GGUF:
https://huggingface.co/unsloth/Qwen3....
• Исходный код настроек квантования по умолчанию в llama.cpp (llama-quant.cpp):
https://github.com/ggml-org/llama.cpp...
• Бенджамин Анализ результатов бенчмарка 15-GGUF от Мари (Kaitchup):
https://kaitchup.substack.com/p/qwen3...
⏱️ Разделы:
0:00 - Два файла по 8,4 ГБ: аномалия 7,7 точек
0:25 - Qwen 3.8 27B: сжатие 54 ГБ до 8,4 ГБ
0:56 - Стена ошибки квантования ниже 4 бит
1:47 - GSQ: обеспечение дифференцируемости округления весов
3:00 - RCO: распределение 851 тензора на поверхности
4:32 - Открытие дампа выделения памяти: вызов llama.cpp
5:24 - Почему ранние слои были сжаты до 1 бита
5:55 - 8,4 ГБ Ловушка бенчмарка: деградация кода
6:45 - Реалии VRAM: механизм внимания DeltaNet и кэш ключ-значение
6:58 - Вердикт: Почему вам следует запустить сборку на 9,3 ГБ
#qwen #llamacpp #quantization #gguf #localllm #machinelearning #deeplearning #cloudcodes #aihardware #vram
Запросы пользователей:
qwen 3 8 27b gguf
qwen 3 8 gsq rco
объяснение квантования gsq rco
лучшая 27-битная модель для 16-гигабайтного GPU
2-битное квантование llama cpp
квантование gumbel softmax llm
оптимизация с ограничениями риманова ядра rco
бенчмарк qwen 3 8 27b
qwen 3.8 iq2_xs против unsloth
unsloth qwen 3 8 27b gguf
как запустить 27-битная модель на RTX 5060 Ti
Требования к видеопамяти для QWEN 3 8 27b
token_embd.weight iq1_m
dan alistarh ista daslab
gsq vs gptq
Размер кэша kv для QWEN 3 8 27b
Gated Deltanet QWEN 3 8
Ошибка квантования с низким битом
Лучшее квантование для кодирования LLM
Cloud Codes