DeepSeek V4.1 Flash: архитектура, которая сократила расходы на кэш в 437 раз
Cloud Codes
0:00 / 0:00
DeepSeek V4.1 Flash: архитектура, которая сократила расходы на кэш в 437 раз
12 025 просмотров · 2 недели назад
Cloud Codes
40,5 тыс. подписчиков
12 025 просмотров · 2 недели назад
DeepSeek-V4.1-Flash представляет асимметричную архитектуру MoE с 552 байтами параметров, использующую 20-слойное разделение кодировщика и декодировщика на основе причинно-следственной связи, алгоритм сжатого разреженного внимания 2 (CSA2) и 196 байтами параметров памяти энграмм, выгруженных в память. За счет уменьшения глобального объема кэша ключ-значение до 890 байт на токен в точности FP4 — 437-кратное сокращение по сравнению с DeepSeek-V1 — эта конструкция снижает стоимость мгновенного попадания в кэш до 0,003 доллара за миллион токенов, при этом активируя 8 байт параметров во время предварительного заполнения и 16 байт во время декодирования.
🔔 Подпишитесь: / @cloud-codes
💙 Станьте участником: / @cloud-codes
🐦 Twitter/X:
https://x.com/cloud_codes
💬 Discord:
/ discord
В этом подробном обзоре Cloud Codes анализирует исходный код и 51-страничный технический отчет, лежащие в основе DeepSeek V4.1 Flash: как проецирование состояний KV декодера непосредственно из конечного слоя кодировщика почти вдвое сокращает вычислительные затраты на предварительное заполнение до O(N·L/2), почему только 4 из 40 слоев фактически хранят глобальный кэш KV, в то время как 36 слоев заимствуют его через режимы переиндексации и повторного использования, и Как иерархический разреженный индексатор ограничивает сканирование миллиона токенов постоянным пулом кандидатов из 16 384 позиций. Мы также изучаем таблицы поиска Engram в оперативной памяти хоста, проводим аудит реальной сессии агента на 447 оборотов, которая стоит 55,06 долларов на GPT-6 Astra против 0,36 долларов на DeepSeek, и оцениваем честные результаты бенчмарка, где V4.1-Flash соответствует Claude Opus 5 на DeepSWE (74,2 против 74,0), но отстает на 20,6 баллов на Terminal-Bench 4.0.
Если этот анализ помог вам понять оптимизацию архитектуры трансформеров, сжатие кэша ключ-значение и экономику обслуживания крупномасштабных моделей, подпишитесь на Cloud Codes, чтобы каждую неделю получать новый подробный обзор инфраструктуры.
Создавайте, решайте, развертывайте.
🔗 Упомянутые ресурсы:
• Технический отчет по DeepSeek V4.1 Flash (PDF):
https://huggingface.co/deepseek-ai/De...
• Репозиторий DeepSeek V4.1 Flash на Hugging Face и выпущенный код:
https://huggingface.co/deepseek-ai/De...
• Официальная таблица цен на API DeepSeek:
https://api-docs.deepseek.com/quick_s...
• Официальное объявление о выпуске DeepSeek V4.1 Flash:
https://api-docs.deepseek.com/news/ne...
• Обсуждение запуска на Hacker News и стоимость токенов Анализ:
https://news.ycombinator.com/item?id=...
• Тест производительности DeepSeek V4.1 Flash от Artificial Analysis:
https://artificialanalysis.ai/models/...
• Статья об архитектуре YoCo (You Only Cache Once, arXiv:2405.05254):
https://arxiv.org/abs/2405.05254
⏱️ Разделы:
0:00 - Реальная стоимость кодирования агентов: повторное чтение кэша
0:31 - Метрика 437x: от 389 120 до 890 байт/токен
1:26 - Счет за 447-оборотный код: 55 долларов на Astra против 0,36 долларов на DeepSeek
2:37 - Причинно-следственный кодировщик-декодер: зачем читать Затраты на написание вдвое меньше
5:01 - CSA2 + FP4: Как 1 миллион токенов помещается в 890 МБ
5:53 - Секрет кода: Только 4 из 40 слоев имеют кэш ключ-значение
7:44 - Иерархический разреженный индексатор: Кто выбирает 512?
9:23 - Энграмма: 196 байт параметров выгружены в системную оперативную память
11:18 - Проблема аппроксимации и собственные ограничения DeepSeek
12:10 - Таблица результатов: где он побеждает Opus 5 (и проигрывает на 20 очков)
13:02 - Споры о замене модели и предупреждение Саймона Уиллисона
13:56 - Окончательный вердикт: Разработано вопреки закону
#deepseek #deepseekv4 #aiarchitecture #machinelearning #deeplearning #kvcache #llm #cloudcodes #aihardware #softwareengineering
Запросы пользователей:
deepseek v4.1 flash architecture explained
deepseek v4.1 flash technical report analysis
how deepseek v4.1 flash reduces kv cache
compressed sparse attention 2 csa2 deepseek
deepseek 890 байты на токен kv кэш
каузальный кодировщик декодер предварительное заполнение декодирование deepseek
энграмма deepseek 196b параметры память хоста
бенчмарк deepseek v4.1 flash против Claude Opus 5
иерархический разреженный индексатор deepseek
почему deepseek v4.1 flash дешевле, чем v4 pro
ценообразование попаданий в кэш deepseek prompt 0.003
deepseek v4.1 flash 447 turn agent bill
deepseek v4.1 flash 552b параметры moe
deepseek v4.1 flash скорость искусственного анализа
deepseek ограниченное воспроизведение SWA аппроксимация
саймон уиллисон deepseek обмен моделями hacker news
deepseek v4.1 flash fp4 e2m1 kv кэш
почему чтение стоит вдвое дешевле записи deepseek
deepseek v4.1 flash terminal bench 4.0
облачные коды