Перейти к содержимому

Насколько быстро RTX 3060 на самом деле тянет модель на 35B (улучшение llama.cpp)?

Codacus

0:00 / 0:00

Насколько быстро RTX 3060 на самом деле тянет модель на 35B (улучшение llama.cpp)?

6 081 просмотр · 7 часов назад
Codacus
33,7 тыс. подписчиков
6 081 просмотр · 7 часов назад
Я создал кэш экспертов для моделей MoE, самые популярные эксперты храню в видеопамяти, а остальные обрабатываю из системной оперативной памяти. Базовое значение было 42. Вот что потребовалось, чтобы понять, почему, и к чему это привело: 80 токенов в секунду на пике, и всё ещё более 70 с реальным контекстом в окне. Одна RTX 3060. Модель 35B. Неожиданная часть: сам по себе кэш почти ничего не стоит. Ценность ему придаёт то, как он влияет на спекулятивное декодирование. ⚙️ ДВА ФЛАГА Всё остальное здесь — это команды, которые вы уже запускали. Эти два — новые: --moe-cache-profile [path.csv] --moe-cache-slots [n] Полные команды, оба шага, в закреплённом комментарии. ⏱️ РАЗДЕЛЫ 0:00 Введение 0:31 Кладбище 2:35 Данные говорят, что не стоит 5:47 Сборка и удар под дых 7:42 Предательство планировщика 10:54 Увеличение производительности 14:08 Почему это работает 17:58 Ваша видеокарта 📊 ЦИФРЫ базовый уровень, без кэша ............ 42 ток/с кэш "работает" ............... 6 ток/с ← два дня кэш фактически работает ........ 44 ток/с кэш, 124 слота .............. 55 ток/с спекулятивное декодирование само по себе .... 55 ток/с оба вместе ................. 70 ток/с ← больше, чем по отдельности параллельные цепочки GPU/CPU ....... 75 ток/с пик .......................... 80 ток/с с реальным контекстом ............. 70+ tok/s ⚠️ ПОМОЖЕТ ЛИ ЭТО ВАМ? Зависит от того, сколько модулей помещается в модель. На 3060 с 35B помещается примерно половина модулей Expert, и прирост большой. На модели 118B, где помещается только 36 из 256 модулей Expert, прирост падает до 5%. При уровне менее 15–20% фиксированный набор модулей перестает быть оптимальным решением. В главе 7 рассматривается, где проходит граница для вашей карты. 🔧 НАСТРОЙКА Qwen3.6-35B-A3B UD-Q4_K_M RTX 3060 12 ГБ · Ryzen 5600X · 30 ГБ ОЗУ · Ubuntu 24.04 llama.cpp с кэшированием MoE Expert — Если вы запускаете модели локально и хотите получить больше от уже имеющегося у вас оборудования, то этот канал именно для этого. Подписывайтесь, впереди ещё много интересного. #localllm #llamacpp #rtx3060 #qwen3 #selfhostedai ​​#localai