Перейти к содержимому

Смесь экспертов

Jimmy's Tech Deep Dive

0:00 / 0:00

Смесь экспертов

9 просмотров · 6 дней назад
Jimmy's Tech Deep Dive
9 подписчиков
9 просмотров · 6 дней назад
1,6 триллиона параметров. Только 49 миллиардов отвечают на ваши вопросы. Это — «Смесь экспертов». Полный обзор принципов работы разреженных моделей, от маршрутизатора до затрат на память. В этом подробном исследовании мы создаём «Смесь экспертов» с нуля: что теряет плотная модель, как маршрутизатор оценивает и выбирает экспертов с помощью алгоритма top-k, почему общее количество и активные параметры — это два совершенно разных числа, и сколько памяти всё ещё стоит разреженная активация. Мы рассматриваем общие и мелкозернистые эксперты, коллапс экспертов и решения по балансировке нагрузки, которые его предотвращают, параллелизм экспертов и трафик «все ко всем» между машинами, а также то, как выглядит ландшафт разреженных моделей к 2026 году — включая небольшие модели, работающие на одной потребительской видеокарте. • Плотные модели: каждый параметр обрабатывает каждый токен, и почему это перестает быть удобным • Маршрутизатор, выбор топ-k и почему невыбранные эксперты никогда не вычисляются • Общее количество активных параметров и их количество, на конкретных примерах Mixtral и DeepSeek V3 • Мелкозернистые эксперты, общий эксперт и схлопывание эксперта во время обучения • Вспомогательная функция потерь против балансировки нагрузки на основе смещения и почему разреженность экономит вычислительные ресурсы, но не память • Параллелизм экспертов, отбрасывание токенов и почему разреженные модели являются самыми дешевыми при нагрузке Разделы 0:00 Основная идея 0:37 Параметры и плотные слои 1:49 Замена блока прямого распространения 2:20 Маршрутизатор и топ-k 3:10 Почему разреженность экономит вычислительные ресурсы 3:42 Общее количество активных параметров и их количество 4:39 Что на самом деле означает «эксперт» 5:15 Краткая история MoE 5:57 Мелкозернистые и общие эксперты 6:53 Схлопывание эксперта и балансировка 7:48 Память не сохраняется 8:08 Обслуживание между машинами 9:22 Стоимость и перспективы на 2026 год 10:49 Когда плотная сеть по-прежнему побеждает 11:08 Краткий обзор полного пути Источники Стратегия балансировки нагрузки без дополнительных потерь для смешанной среды экспертов - https://arxiv.org/html/2408.15664v1 Что такое смешанная среда экспертов (MoE) и как она работает? - https://www.nvidia.com/en-us/glossary... Объяснение смешанной среды экспертов LLM - Полевое руководство 2026 года - https://tensorops.ai/blog/what-is-mix... Инфраструктура смешанной среды экспертов | Блог Introl - https://introl.com/blog/mixture-of-ex... Как модели смешанных экспертов изменили экономику LLM - https://deepinfra.com/blog/mixture-of... 7 лучших моделей ИИ смешанных экспертов для разработчиков в 2026 году - https://www.labellerr.com/blog/top-op... #MixtureOfExperts #MoE #SparseModels #LLM #AI