Смесь экспертов
Jimmy's Tech Deep Dive
0:00 / 0:00
Смесь экспертов
9 просмотров · 6 дней назад
Jimmy's Tech Deep Dive
9 подписчиков
9 просмотров · 6 дней назад
1,6 триллиона параметров. Только 49 миллиардов отвечают на ваши вопросы. Это — «Смесь экспертов».
Полный обзор принципов работы разреженных моделей, от маршрутизатора до затрат на память.
В этом подробном исследовании мы создаём «Смесь экспертов» с нуля: что теряет плотная модель, как маршрутизатор оценивает и выбирает экспертов с помощью алгоритма top-k, почему общее количество и активные параметры — это два совершенно разных числа, и сколько памяти всё ещё стоит разреженная активация. Мы рассматриваем общие и мелкозернистые эксперты, коллапс экспертов и решения по балансировке нагрузки, которые его предотвращают, параллелизм экспертов и трафик «все ко всем» между машинами, а также то, как выглядит ландшафт разреженных моделей к 2026 году — включая небольшие модели, работающие на одной потребительской видеокарте.
• Плотные модели: каждый параметр обрабатывает каждый токен, и почему это перестает быть удобным
• Маршрутизатор, выбор топ-k и почему невыбранные эксперты никогда не вычисляются
• Общее количество активных параметров и их количество, на конкретных примерах Mixtral и DeepSeek V3
• Мелкозернистые эксперты, общий эксперт и схлопывание эксперта во время обучения
• Вспомогательная функция потерь против балансировки нагрузки на основе смещения и почему разреженность экономит вычислительные ресурсы, но не память
• Параллелизм экспертов, отбрасывание токенов и почему разреженные модели являются самыми дешевыми при нагрузке
Разделы
0:00 Основная идея
0:37 Параметры и плотные слои
1:49 Замена блока прямого распространения
2:20 Маршрутизатор и топ-k
3:10 Почему разреженность экономит вычислительные ресурсы
3:42 Общее количество активных параметров и их количество
4:39 Что на самом деле означает «эксперт»
5:15 Краткая история MoE
5:57 Мелкозернистые и общие эксперты
6:53 Схлопывание эксперта и балансировка
7:48 Память не сохраняется
8:08 Обслуживание между машинами
9:22 Стоимость и перспективы на 2026 год
10:49 Когда плотная сеть по-прежнему побеждает
11:08 Краткий обзор полного пути
Источники
Стратегия балансировки нагрузки без дополнительных потерь для смешанной среды экспертов - https://arxiv.org/html/2408.15664v1
Что такое смешанная среда экспертов (MoE) и как она работает? - https://www.nvidia.com/en-us/glossary...
Объяснение смешанной среды экспертов LLM - Полевое руководство 2026 года - https://tensorops.ai/blog/what-is-mix...
Инфраструктура смешанной среды экспертов | Блог Introl - https://introl.com/blog/mixture-of-ex...
Как модели смешанных экспертов изменили экономику LLM - https://deepinfra.com/blog/mixture-of...
7 лучших моделей ИИ смешанных экспертов для разработчиков в 2026 году - https://www.labellerr.com/blog/top-op...
#MixtureOfExperts #MoE #SparseModels #LLM #AI