Насколько быстро RTX 3060 на самом деле тянет модель на 35B (улучшение llama.cpp)?
Codacus
0:00 / 0:00
Насколько быстро RTX 3060 на самом деле тянет модель на 35B (улучшение llama.cpp)?
6 081 просмотр · 7 часов назад
Codacus
33,7 тыс. подписчиков
6 081 просмотр · 7 часов назад
Я создал кэш экспертов для моделей MoE, самые популярные эксперты храню в видеопамяти, а остальные обрабатываю из системной оперативной памяти.
Базовое значение было 42. Вот что потребовалось, чтобы понять, почему, и к чему это привело: 80 токенов в секунду на пике, и всё ещё более 70 с реальным контекстом в окне.
Одна RTX 3060. Модель 35B. Неожиданная часть: сам по себе кэш почти ничего не стоит. Ценность ему придаёт то, как он влияет на спекулятивное декодирование.
⚙️ ДВА ФЛАГА
Всё остальное здесь — это команды, которые вы уже запускали. Эти два — новые:
--moe-cache-profile [path.csv]
--moe-cache-slots [n]
Полные команды, оба шага, в закреплённом комментарии.
⏱️ РАЗДЕЛЫ
0:00 Введение
0:31 Кладбище
2:35 Данные говорят, что не стоит
5:47 Сборка и удар под дых
7:42 Предательство планировщика
10:54 Увеличение производительности
14:08 Почему это работает
17:58 Ваша видеокарта
📊 ЦИФРЫ
базовый уровень, без кэша ............ 42 ток/с
кэш "работает" ............... 6 ток/с ← два дня
кэш фактически работает ........ 44 ток/с
кэш, 124 слота .............. 55 ток/с
спекулятивное декодирование само по себе .... 55 ток/с
оба вместе ................. 70 ток/с ← больше, чем по отдельности
параллельные цепочки GPU/CPU ....... 75 ток/с
пик .......................... 80 ток/с
с реальным контекстом ............. 70+ tok/s
⚠️ ПОМОЖЕТ ЛИ ЭТО ВАМ?
Зависит от того, сколько модулей помещается в модель. На 3060 с 35B помещается примерно половина модулей Expert, и прирост большой. На модели 118B, где помещается только 36 из 256 модулей Expert, прирост падает до 5%. При уровне менее 15–20% фиксированный набор модулей перестает быть оптимальным решением. В главе 7 рассматривается, где проходит граница для вашей карты.
🔧 НАСТРОЙКА
Qwen3.6-35B-A3B UD-Q4_K_M
RTX 3060 12 ГБ · Ryzen 5600X · 30 ГБ ОЗУ · Ubuntu 24.04 llama.cpp с кэшированием MoE Expert
—
Если вы запускаете модели локально и хотите получить больше от уже имеющегося у вас оборудования, то этот канал именно для этого. Подписывайтесь, впереди ещё много интересного.
#localllm #llamacpp #rtx3060 #qwen3 #selfhostedai #localai