Перейти к содержимому

DeepSeek V4.1 Flash: архитектура, которая сократила расходы на кэш в 437 раз

Cloud Codes

0:00 / 0:00

DeepSeek V4.1 Flash: архитектура, которая сократила расходы на кэш в 437 раз

12 025 просмотров · 2 недели назад
Cloud Codes
40,5 тыс. подписчиков
12 025 просмотров · 2 недели назад
DeepSeek-V4.1-Flash представляет асимметричную архитектуру MoE с 552 байтами параметров, использующую 20-слойное разделение кодировщика и декодировщика на основе причинно-следственной связи, алгоритм сжатого разреженного внимания 2 (CSA2) и 196 байтами параметров памяти энграмм, выгруженных в память. За счет уменьшения глобального объема кэша ключ-значение до 890 байт на токен в точности FP4 — 437-кратное сокращение по сравнению с DeepSeek-V1 — эта конструкция снижает стоимость мгновенного попадания в кэш до 0,003 доллара за миллион токенов, при этом активируя 8 байт параметров во время предварительного заполнения и 16 байт во время декодирования. 🔔 Подпишитесь:    / @cloud-codes   💙 Станьте участником:    / @cloud-codes   🐦 Twitter/X: https://x.com/cloud_codes 💬 Discord:   / discord   В этом подробном обзоре Cloud Codes анализирует исходный код и 51-страничный технический отчет, лежащие в основе DeepSeek V4.1 Flash: как проецирование состояний KV декодера непосредственно из конечного слоя кодировщика почти вдвое сокращает вычислительные затраты на предварительное заполнение до O(N·L/2), почему только 4 из 40 слоев фактически хранят глобальный кэш KV, в то время как 36 слоев заимствуют его через режимы переиндексации и повторного использования, и Как иерархический разреженный индексатор ограничивает сканирование миллиона токенов постоянным пулом кандидатов из 16 384 позиций. Мы также изучаем таблицы поиска Engram в оперативной памяти хоста, проводим аудит реальной сессии агента на 447 оборотов, которая стоит 55,06 долларов на GPT-6 Astra против 0,36 долларов на DeepSeek, и оцениваем честные результаты бенчмарка, где V4.1-Flash соответствует Claude Opus 5 на DeepSWE (74,2 против 74,0), но отстает на 20,6 баллов на Terminal-Bench 4.0. Если этот анализ помог вам понять оптимизацию архитектуры трансформеров, сжатие кэша ключ-значение и экономику обслуживания крупномасштабных моделей, подпишитесь на Cloud Codes, чтобы каждую неделю получать новый подробный обзор инфраструктуры. Создавайте, решайте, развертывайте. 🔗 Упомянутые ресурсы: • Технический отчет по DeepSeek V4.1 Flash (PDF): https://huggingface.co/deepseek-ai/De... • Репозиторий DeepSeek V4.1 Flash на Hugging Face и выпущенный код: https://huggingface.co/deepseek-ai/De... • Официальная таблица цен на API DeepSeek: https://api-docs.deepseek.com/quick_s... • Официальное объявление о выпуске DeepSeek V4.1 Flash: https://api-docs.deepseek.com/news/ne... • Обсуждение запуска на Hacker News и стоимость токенов Анализ: https://news.ycombinator.com/item?id=... • Тест производительности DeepSeek V4.1 Flash от Artificial Analysis: https://artificialanalysis.ai/models/... • Статья об архитектуре YoCo (You Only Cache Once, arXiv:2405.05254): https://arxiv.org/abs/2405.05254 ⏱️ Разделы: 0:00 - Реальная стоимость кодирования агентов: повторное чтение кэша 0:31 - Метрика 437x: от 389 120 до 890 байт/токен 1:26 - Счет за 447-оборотный код: 55 долларов на Astra против 0,36 долларов на DeepSeek 2:37 - Причинно-следственный кодировщик-декодер: зачем читать Затраты на написание вдвое меньше 5:01 - CSA2 + FP4: Как 1 миллион токенов помещается в 890 МБ 5:53 - Секрет кода: Только 4 из 40 слоев имеют кэш ключ-значение 7:44 - Иерархический разреженный индексатор: Кто выбирает 512? 9:23 - Энграмма: 196 байт параметров выгружены в системную оперативную память 11:18 - Проблема аппроксимации и собственные ограничения DeepSeek 12:10 - Таблица результатов: где он побеждает Opus 5 (и проигрывает на 20 очков) 13:02 - Споры о замене модели и предупреждение Саймона Уиллисона 13:56 - Окончательный вердикт: Разработано вопреки закону #deepseek #deepseekv4 #aiarchitecture #machinelearning #deeplearning #kvcache #llm #cloudcodes #aihardware #softwareengineering Запросы пользователей: deepseek v4.1 flash architecture explained deepseek v4.1 flash technical report analysis how deepseek v4.1 flash reduces kv cache compressed sparse attention 2 csa2 deepseek deepseek 890 байты на токен kv кэш каузальный кодировщик декодер предварительное заполнение декодирование deepseek энграмма deepseek 196b параметры память хоста бенчмарк deepseek v4.1 flash против Claude Opus 5 иерархический разреженный индексатор deepseek почему deepseek v4.1 flash дешевле, чем v4 pro ценообразование попаданий в кэш deepseek prompt 0.003 deepseek v4.1 flash 447 turn agent bill deepseek v4.1 flash 552b параметры moe deepseek v4.1 flash скорость искусственного анализа deepseek ограниченное воспроизведение SWA аппроксимация саймон уиллисон deepseek обмен моделями hacker news deepseek v4.1 flash fp4 e2m1 kv кэш почему чтение стоит вдвое дешевле записи deepseek deepseek v4.1 flash terminal bench 4.0 облачные коды