Перейти к содержимому

Qwen 3.8 27B. Качество FP8 на одной 3090

Галера Морева

0:00 / 0:00

Qwen 3.8 27B. Качество FP8 на одной 3090

6 844 просмотра · 14 часов назад
Галера Морева
10,6 тыс. подписчиков
6 844 просмотра · 14 часов назад
Мое закрытое сообщество https://amorev.ru/promo Мой ИИ-провайдер https://ai.wormsoft.ru. Мой Telegram-канал https://t.me/gmoreva Мне посоветовали квант Qwen 3.8 27B — GSCU RCO, у которого другая механика квантования и по бенчмаркам качество не отстаёт от FP8. И так совпало, что одну из моих 3090 как раз переводили на воду — а работать с локальной моделью надо. Запустил квант на одной 3090: уместилось 220 000 контекста в 23.1 ГБ, да ещё и mmproj-голова для Vision влезла. Прогнал модель через реальные задачи — не игрушечные, а те, что делаю каждый день. 🔹 Новый квант Qwen 3.8 27B GSCU RCO — что за механика и почему обещают уровень FP8 🔹 Запуск на одной 3090 через llama.cpp: 220К контекста, 23.1 ГБ, Vision работает 🔹 Тест-лендинг: интерактивная страница про квантизацию — сравнение с FP8 и почему это лучше, чем Q4_K_M (контекст не теряется!) 🔹 Реальная задача: доработка моей платформы amorev.ru — textarea с авторостом на 10 строк в виджете и админке 🔹 Агент настраивает сам себя: перенос скиллов управления задачами в проект поддержки, правка Agents.md, доска в Taskpad 🔹 Проектирование мультисайт-виджета техподдержки: спека, вопросы, wildcard-домены, лист разрешённых сайтов 🔹 Task Solver в деле: модель взяла задачку из Taskpad и реализовала через субагентов 🔹 Падение от переполнения RAM — перезапуск без кэша в оперативу 🔹 Доработка MCP-сервера Taskpad: теперь агенты видят скриншоты и вложения задач (presigned URL, типы файлов) 🔹 Финальный вердикт: квант vs FP8 vs DeepSeek V4.1 Flash и железо за 200 тысяч против 30 миллионов Таймкоды: 00:00 Введение 01:58 Про провайдер 03:07 Вторая модель для теста 04:13 Первая задача 08:33 Вторая задача. Доработка виджета поддержки 13:28 Третья задача 19:14 Многосайтовость техподдержки 36:23 Четвертая задача. Расширение MCP 43:48 Подведение итогов