Перейти к содержимому

Qwen 3.8 27B в 8,4 ГБ. Но не скачивайте эту версию

Cloud Codes

0:00 / 0:00

Qwen 3.8 27B в 8,4 ГБ. Но не скачивайте эту версию

24 651 просмотр · 1 день назад
Cloud Codes
38,5 тыс. подписчиков
24 651 просмотр · 1 день назад
При одинаковом размере файла в 8,4 ГБ квантизация Qwen 3.8 27B с помощью GSQ-RCO от ISTA DASLab превосходит сборки Unsloth GGUF, используемые сообществом, на 7,72 балла в тестах AIME25, GPQA-Diamond и LiveCodeBench v6, оставаясь при этом на 100% совместимой с нативным llama.cpp. Благодаря сочетанию квантизации Гумбеля-Софтмакса (GSQ) для дифференцируемого округления весов с оптимизацией с ограничениями Римана (RCO) в пространстве поиска из 851 тензора, этот конвейер преодолевает барьер ошибок скалярных значений менее 4 бит без необходимости использования пользовательских ядер декомпрессии. 🔔 Подпишитесь:    / @cloud-codes   💙 Станьте участником:    / @cloud-codes   🐦 Twitter/X: https://x.com/cloud_codes 💬 Discord:   / discord   В этом подробном анализе Cloud Codes разбирает дамп распределения ресурсов для каждого тензора, который выявляет недостатки традиционных настроек GGUF по умолчанию: почему математический градиентный спуск сдвинул таблицу встраивания токенов до IQ1_M (близко к самой низкой точности в файле), сохранил выходной заголовок на уровне IQ4_XS и кластеризовал тридцать девять 1-битных тензоров в первой четверти сети, оставив последнюю четверть без кластеризации без изменений. Мы также провели реальные расчеты объема видеопамяти для 16 ГБ GPU — с учетом гибридной архитектуры Gated DeltaNet от Qwen, проектора зрения объемом 0,93 ГБ и кэша KV объемом 8,6 ГБ с контекстом 128k — чтобы объяснить, почему контрольная точка 9,3 ГБ (IQ2_S) является оптимальным вариантом для локального программирования и математических вычислений. Если этот анализ помог вам понять квантование LLM с низким битовым кодом, оптимизацию римановых многообразий и определение размера локальной памяти GPU, подпишитесь на Cloud Codes, чтобы каждую неделю получать новый подробный обзор инфраструктуры. Создавайте, решайте, развертывайте. 🔗 Упомянутые ресурсы: • Репозиторий ISTA DASLab Qwen 3.8 27B GSQ-RCO GGUF: https://huggingface.co/ISTA-DASLab/Qw... • Дамп тензорного распределения GSQ-RCO, 8,4 ГБ (rco-allocation.txt): https://huggingface.co/ISTA-DASLab/Qw... • Документ GSQ (Дадгарния и др., arXiv:2604.18556): https://arxiv.org/abs/2604.18556 • Статья RCO (Helcig & Alistarh, arXiv:2605.00649): https://arxiv.org/abs/2605.00649 • Официальная модель карты Qwen 3.8 27B: https://huggingface.co/Qwen/Qwen3.8-27B • Релиз Unsloth Qwen 3.8 27B GGUF: https://huggingface.co/unsloth/Qwen3.... • Исходный код настроек квантования по умолчанию в llama.cpp (llama-quant.cpp): https://github.com/ggml-org/llama.cpp... • Бенджамин Анализ результатов бенчмарка 15-GGUF от Мари (Kaitchup): https://kaitchup.substack.com/p/qwen3... ⏱️ Разделы: 0:00 - Два файла по 8,4 ГБ: аномалия 7,7 точек 0:25 - Qwen 3.8 27B: сжатие 54 ГБ до 8,4 ГБ 0:56 - Стена ошибки квантования ниже 4 бит 1:47 - GSQ: обеспечение дифференцируемости округления весов 3:00 - RCO: распределение 851 тензора на поверхности 4:32 - Открытие дампа выделения памяти: вызов llama.cpp 5:24 - Почему ранние слои были сжаты до 1 бита 5:55 - 8,4 ГБ Ловушка бенчмарка: деградация кода 6:45 - Реалии VRAM: механизм внимания DeltaNet и кэш ключ-значение 6:58 - Вердикт: Почему вам следует запустить сборку на 9,3 ГБ #qwen #llamacpp #quantization #gguf #localllm #machinelearning #deeplearning #cloudcodes #aihardware #vram Запросы пользователей: qwen 3 8 27b gguf qwen 3 8 gsq rco объяснение квантования gsq rco лучшая 27-битная модель для 16-гигабайтного GPU 2-битное квантование llama cpp квантование gumbel softmax llm оптимизация с ограничениями риманова ядра rco бенчмарк qwen 3 8 27b qwen 3.8 iq2_xs против unsloth unsloth qwen 3 8 27b gguf как запустить 27-битная модель на RTX 5060 Ti Требования к видеопамяти для QWEN 3 8 27b token_embd.weight iq1_m dan alistarh ista daslab gsq vs gptq Размер кэша kv для QWEN 3 8 27b Gated Deltanet QWEN 3 8 Ошибка квантования с низким битом Лучшее квантование для кодирования LLM Cloud Codes