DeepSeek подарил магистрам права настоящую память (это не RAG).
Jia-Bin Huang
0:00 / 0:00
DeepSeek подарил магистрам права настоящую память (это не RAG).
61 155 просмотров · 4 месяца назад
Jia-Bin Huang
47,9 тыс. подписчиков
61 155 просмотров · 4 месяца назад
Энграмма DeepSeek представляет новый способ извлечения знаний с помощью масштабируемых поисков. Это повышает эффективность LLM во всех задачах (включая задачи рассуждения), освобождая слои внимания и MoE от необходимости восстанавливать факты в статических шаблонах.
В этом видео давайте рассмотрим, как и почему работает энграмма.
00:00 Внимание
01:56 Как факты хранятся в LLM (FFN/MoE)
06:27 Извлечение знаний с помощью поиска
07:32 Хэширование
10:47 Многоголовочное хэширование
11:56 Контекстно-зависимое управление
16:06 Многоветвевая архитектура (mHC)
16:53 Интеграция энграммы в трансформер
18:01 Распределение разреженности (энграмма против MoE)
20:16 Производительность в тестовых задачах
22:08 Почему энграмма улучшает рассуждения LLM?
23:45 Где следует размещать энграмму? 25:41 Действительно ли модель энграмм делает модель более глубокой?
27:05 Масштабирование встраивания и будущее LLM
Ссылки:
[Энграмма] https://arxiv.org/abs/2601.07372
[Встраивание слоев] https://developers.googleblog.com/en/...
[DeepEmbed] https://www.rwkv.com/
[SuperBPE] https://arxiv.org/abs/2503.13423
[SCONE] https://arxiv.org/abs/2502.01637
[OverEncoding] https://arxiv.org/abs/2501.16975
[Byte Latent Transformer] https://arxiv.org/abs/2412.09871
[LongCat-Flash-Lite] https://arxiv.org/abs/2601.21204
[Large Lookup Layers] https://arxiv.org/abs/2601.21461
Видео создано с помощью manim: https://www.manim.community/
Примечание: Во время создания этого видео я простудился 🤒, поэтому часть озвучки сгенерирована моим клонированным голосом. Извините, если озвучка звучит немного неестественно.