Сжатие KV-кэша делает агентов с контекстом в миллион токенов практичными
Neural Trend Hub
0:00 / 0:00
Сжатие KV-кэша делает агентов с контекстом в миллион токенов практичными
194 просмотра · 12 дней назад
Neural Trend Hub
163 подписчика
194 просмотра · 12 дней назад
Проблема нехватки памяти в ИИ начинает выглядеть не столько как аппаратное ограничение, сколько как системная проблема. Исследования этой недели показывают, как модели с длинным контекстом сжимают кэши ключ-значение, обучение MoE сглаживает пики потребления памяти в худшем случае, а системы на базе Qwen с 35 миллиардами параметров передают экспертные данные с SSD на потребительском оборудовании. Общий сдвиг заключается в переходе от хранения всего к прогнозированию, маршрутизации, планированию и перемещению только необходимого — при сохранении поведения, важного для инженеров. Мы увидим, как DeepSeek, Salesforce AI Research и AutoArk превращают память, пропускную способность и задержку в управляемые инженерные компромиссы.
Статьи, рассмотренные в этом эпизоде:
https://arxiv.org/abs/2609.19969
https://arxiv.org/abs/2609.14306
https://arxiv.org/abs/2609.18063
#AI #MachineLearning #ResearchPapers