Перейти к содержимому

Как DeepSeek сделала ИИ в 10 раз дешевле с помощью одного трюка

Adem B10

0:00 / 0:00

Как DeepSeek сделала ИИ в 10 раз дешевле с помощью одного трюка

847 просмотров · 2 нед. назад
Adem B10
361 подписчик
847 просмотров · 2 нед. назад
У вашего мозга есть два способа ответить на вопрос. Он может запомнить его или продумать. Он выбирает правильный способ, не спрашивая вас. У ИИ же только один способ. Он всё продумывает с нуля каждый раз — включая утверждение «столица Франции — Париж». В январе DeepSeek опубликовала статью, в которой исправляет эту проблему, и решение заключается в использовании таблицы поиска. Затем их следующая модель вышла без неё. А следом — с 183 ГБ этой таблицы. Вот что они обнаружили, почему это улучшило способность модели к рассуждениям, хотя она должна была помогать только с фактами, и почему она пропустила одно поколение. ГЛАВЫ 0:00 Семь раз по восемь 0:43 Внутри нет списка 1:23 Тридцать шагов и на что они тратятся впустую 2:10 Просто дайте ему блокнот 3:08 Нет, он все равно вас не помнит 3:31 Результат, которого они не ожидали 4:22 Почему больший блокнот ухудшает ситуацию 4:56 Часть, для которой не нужен дорогой чип 5:35 А затем V4 был выпущен без него 6:09 Сентябрь 6:45 Мы создали его в своей собственной форме ЦИФРЫ MMLU +3,4 по знаниям. BBH +5,0 по рассуждениям — то, что они не пытались исправить. ARC-Challenge +3,7, HumanEval +3,0, MATH +2,4. Многозапросный NIAH: 84,2 → 97,0. Таблица поиска параметров объемом 100 байт перемещена в память хоста: менее 3% накладных расходов. DeepSeek V4.1 Flash: 552 байта параметров основной сети + 196 байт параметров энграммы, в двух модулях на уровнях 1 и 14. Это примерно 183 ГиБ чистого поиска внутри контрольной точки объемом 475 ГиБ. Оптимальный вариант: примерно четверть памяти, три четверти вычислений. ИСТОЧНИКИ Engram — «Условная память посредством масштабируемого поиска: новая ось разреженности для больших языковых моделей» (Cheng et al., 12 января 2026 г.), соавтором Вэньфэна Ляна: https://arxiv.org/abs/2601.07372 Код, предоставленный бесплатно: https://github.com/deepseek-ai/Engram Технический отчет DeepSeek-V4 — тот, в котором Engram не упоминается: https://arxiv.org/abs/2606.19348 DeepSeek-V4.1-Flash — где он наконец появляется: https://huggingface.co/deepseek-ai/De... Все числа в этом видео взяты из этих документов. Никто в DeepSeek не объяснил, почему эта идея пропустила поколение, поэтому я не буду строить предположения, выходящие за рамки того, что подтверждается в статье — в статье энграмма была масштабирована до 27 миллиардов параметров, а выпущена в масштабе 196 миллиардов, и то, что работает в малом масштабе, не всегда выживает в большом. Это единственное честное предположение. #DeepSeek #AI #MachineLearning