Перейти к содержимому

Сжатие KV-кэша делает агентов с контекстом в миллион токенов практичными

Neural Trend Hub

0:00 / 0:00

Сжатие KV-кэша делает агентов с контекстом в миллион токенов практичными

194 просмотра · 12 дней назад
Neural Trend Hub
163 подписчика
194 просмотра · 12 дней назад
Проблема нехватки памяти в ИИ начинает выглядеть не столько как аппаратное ограничение, сколько как системная проблема. Исследования этой недели показывают, как модели с длинным контекстом сжимают кэши ключ-значение, обучение MoE сглаживает пики потребления памяти в худшем случае, а системы на базе Qwen с 35 миллиардами параметров передают экспертные данные с SSD на потребительском оборудовании. Общий сдвиг заключается в переходе от хранения всего к прогнозированию, маршрутизации, планированию и перемещению только необходимого — при сохранении поведения, важного для инженеров. Мы увидим, как DeepSeek, Salesforce AI Research и AutoArk превращают память, пропускную способность и задержку в управляемые инженерные компромиссы. Статьи, рассмотренные в этом эпизоде: https://arxiv.org/abs/2609.19969 https://arxiv.org/abs/2609.14306 https://arxiv.org/abs/2609.18063 #AI #MachineLearning #ResearchPapers