Как DeepSeek сделала ИИ в 10 раз дешевле с помощью одного трюка
Adem B10
0:00 / 0:00
Как DeepSeek сделала ИИ в 10 раз дешевле с помощью одного трюка
847 просмотров · 2 нед. назад
Adem B10
361 подписчик
847 просмотров · 2 нед. назад
У вашего мозга есть два способа ответить на вопрос. Он может запомнить его или
продумать. Он выбирает правильный способ, не спрашивая вас.
У ИИ же только один способ. Он всё продумывает с нуля каждый раз —
включая утверждение «столица Франции — Париж». В январе DeepSeek опубликовала статью, в которой исправляет эту проблему, и решение заключается в использовании таблицы поиска. Затем их следующая модель вышла без неё. А следом — с 183 ГБ этой таблицы.
Вот что они обнаружили, почему это улучшило способность модели к рассуждениям, хотя она должна была помогать только с фактами, и почему она пропустила одно поколение.
ГЛАВЫ
0:00 Семь раз по восемь
0:43 Внутри нет списка
1:23 Тридцать шагов и на что они тратятся впустую
2:10 Просто дайте ему блокнот
3:08 Нет, он все равно вас не помнит
3:31 Результат, которого они не ожидали
4:22 Почему больший блокнот ухудшает ситуацию
4:56 Часть, для которой не нужен дорогой чип
5:35 А затем V4 был выпущен без него
6:09 Сентябрь
6:45 Мы создали его в своей собственной форме
ЦИФРЫ
MMLU +3,4 по знаниям. BBH +5,0 по рассуждениям — то, что они не пытались исправить.
ARC-Challenge +3,7, HumanEval +3,0, MATH +2,4.
Многозапросный NIAH: 84,2 → 97,0.
Таблица поиска параметров объемом 100 байт перемещена в память хоста: менее 3% накладных расходов.
DeepSeek V4.1 Flash: 552 байта параметров основной сети + 196 байт параметров энграммы,
в двух модулях на уровнях 1 и 14. Это примерно 183 ГиБ чистого поиска внутри
контрольной точки объемом 475 ГиБ.
Оптимальный вариант: примерно четверть памяти, три четверти вычислений.
ИСТОЧНИКИ
Engram — «Условная память посредством масштабируемого поиска: новая ось разреженности для
больших языковых моделей» (Cheng et al., 12 января 2026 г.), соавтором Вэньфэна Ляна:
https://arxiv.org/abs/2601.07372
Код, предоставленный бесплатно:
https://github.com/deepseek-ai/Engram
Технический отчет DeepSeek-V4 — тот, в котором Engram не упоминается:
https://arxiv.org/abs/2606.19348
DeepSeek-V4.1-Flash — где он наконец появляется:
https://huggingface.co/deepseek-ai/De...
Все числа в этом видео взяты из этих документов. Никто в DeepSeek не объяснил, почему эта идея пропустила поколение, поэтому я не буду строить предположения, выходящие за рамки того, что подтверждается в статье — в статье энграмма была масштабирована до 27 миллиардов параметров, а выпущена в масштабе 196 миллиардов, и то, что работает в малом масштабе, не всегда выживает в большом. Это единственное честное предположение.
#DeepSeek #AI #MachineLearning