Qwen 3.8 27B. Качество FP8 на одной 3090
Галера Морева
0:00 / 0:00
Qwen 3.8 27B. Качество FP8 на одной 3090
6 844 просмотра · 14 часов назад
Галера Морева
10,6 тыс. подписчиков
6 844 просмотра · 14 часов назад
Мое закрытое сообщество
https://amorev.ru/promo
Мой ИИ-провайдер
https://ai.wormsoft.ru.
Мой Telegram-канал
https://t.me/gmoreva
Мне посоветовали квант Qwen 3.8 27B — GSCU RCO, у которого другая механика квантования и по бенчмаркам качество не отстаёт от FP8. И так совпало, что одну из моих 3090 как раз переводили на воду — а работать с локальной моделью надо. Запустил квант на одной 3090: уместилось 220 000 контекста в 23.1 ГБ, да ещё и mmproj-голова для Vision влезла. Прогнал модель через реальные задачи — не игрушечные, а те, что делаю каждый день.
🔹 Новый квант Qwen 3.8 27B GSCU RCO — что за механика и почему обещают уровень FP8
🔹 Запуск на одной 3090 через llama.cpp: 220К контекста, 23.1 ГБ, Vision работает
🔹 Тест-лендинг: интерактивная страница про квантизацию — сравнение с FP8 и почему это лучше, чем Q4_K_M (контекст не теряется!)
🔹 Реальная задача: доработка моей платформы amorev.ru — textarea с авторостом на 10 строк в виджете и админке
🔹 Агент настраивает сам себя: перенос скиллов управления задачами в проект поддержки, правка Agents.md, доска в Taskpad
🔹 Проектирование мультисайт-виджета техподдержки: спека, вопросы, wildcard-домены, лист разрешённых сайтов
🔹 Task Solver в деле: модель взяла задачку из Taskpad и реализовала через субагентов
🔹 Падение от переполнения RAM — перезапуск без кэша в оперативу
🔹 Доработка MCP-сервера Taskpad: теперь агенты видят скриншоты и вложения задач (presigned URL, типы файлов)
🔹 Финальный вердикт: квант vs FP8 vs DeepSeek V4.1 Flash и железо за 200 тысяч против 30 миллионов
Таймкоды:
00:00 Введение
01:58 Про провайдер
03:07 Вторая модель для теста
04:13 Первая задача
08:33 Вторая задача. Доработка виджета поддержки
13:28 Третья задача
19:14 Многосайтовость техподдержки
36:23 Четвертая задача. Расширение MCP
43:48 Подведение итогов