Перейти к содержимому

DeepSeek подарил магистрам права настоящую память (это не RAG).

Jia-Bin Huang

0:00 / 0:00

DeepSeek подарил магистрам права настоящую память (это не RAG).

61 155 просмотров · 4 месяца назад
Jia-Bin Huang
47,9 тыс. подписчиков
61 155 просмотров · 4 месяца назад
Энграмма DeepSeek представляет новый способ извлечения знаний с помощью масштабируемых поисков. Это повышает эффективность LLM во всех задачах (включая задачи рассуждения), освобождая слои внимания и MoE от необходимости восстанавливать факты в статических шаблонах. В этом видео давайте рассмотрим, как и почему работает энграмма. 00:00 Внимание 01:56 Как факты хранятся в LLM (FFN/MoE) 06:27 Извлечение знаний с помощью поиска 07:32 Хэширование 10:47 Многоголовочное хэширование 11:56 Контекстно-зависимое управление 16:06 Многоветвевая архитектура (mHC) 16:53 Интеграция энграммы в трансформер 18:01 Распределение разреженности (энграмма против MoE) 20:16 Производительность в тестовых задачах 22:08 Почему энграмма улучшает рассуждения LLM? 23:45 Где следует размещать энграмму? 25:41 Действительно ли модель энграмм делает модель более глубокой? 27:05 Масштабирование встраивания и будущее LLM Ссылки: [Энграмма] https://arxiv.org/abs/2601.07372 [Встраивание слоев] https://developers.googleblog.com/en/... [DeepEmbed] https://www.rwkv.com/ [SuperBPE] https://arxiv.org/abs/2503.13423 [SCONE] https://arxiv.org/abs/2502.01637 [OverEncoding] https://arxiv.org/abs/2501.16975 [Byte Latent Transformer] https://arxiv.org/abs/2412.09871 [LongCat-Flash-Lite] https://arxiv.org/abs/2601.21204 [Large Lookup Layers] https://arxiv.org/abs/2601.21461 Видео создано с помощью manim: https://www.manim.community/ Примечание: Во время создания этого видео я простудился 🤒, поэтому часть озвучки сгенерирована моим клонированным голосом. Извините, если озвучка звучит немного неестественно.