Как ускорить механизм внимания для длинных контекстов в 4,5 раза | Коулман Хупер, Калифорнийский ...
Frontier Research Club
0:00 / 0:00
Как ускорить механизм внимания для длинных контекстов в 4,5 раза | Коулман Хупер, Калифорнийский ...
208 просмотров · 6 дней назад
Frontier Research Club
464 подписчика
208 просмотров · 6 дней назад
Коулман Хупер — научный сотрудник Калифорнийского университета в Беркли, работающий с Куртом Койтцером в BAIR и Софией Шао в SLICE в рамках SqueezeAILab. Он занимается исследованиями эффективных систем вывода LLM и систем искусственного интеллекта, является первым автором KVQuant (NeurIPS 2024) и соавтором Multipole Attention (NeurIPS 2025).
По мере увеличения времени работы агентов и кодовых систем их контекст расширяется. Во время авторегрессивного декодирования вычислительные ресурсы графического процессора используются не в полной мере, поскольку узким местом является перемещение данных, а не арифметические операции; при больших длинах контекста трафик KV-кэша превышает весовые коэффициенты модели и доминирует в объеме памяти и пропускной способности.
Коулман предлагает два взаимодополняющих решения. KVQuant сочетает в себе квантование ключей до RoPE для каждого канала с неравномерным кодированием с учетом чувствительности и разложением на плотные и разреженные части, достигая снижения перплексии менее чем на 0,1 при 3-битной точности (примерно 5-кратное сжатие). Его 4-битная реализация обеспечивает 3,7-кратную экономию памяти в KV-кэше и 1,7-кратное ускорение загрузки в KV-кэш для Llama-2-7B при 16K контексте на A6000. Multipole Attention вычисляет точное внимание только для важных токенов, аппроксимируя остальные; в задачах рассуждения с длинным контекстом он сохраняет точность, близкую к точности полного внимания, при бюджете на пропускную способность памяти в 8% и достигает ускорения внимания до 4,5 раз. Компромисс заключается в дополнительной сложности кодирования, кластеризации и аппроксимации — а разреженные методы должны оцениваться на тестах рассуждения, а не только на тестах поиска.
Рассматриваемые темы:
• Вывод LLM с длинным контекстом
• Квантование KV-кэша и пропускная способность памяти
• KVQuant, 3-битное квантование и квантование ключей до RoPE
• Неравномерное квантование с учетом чувствительности
• Разложение на плотные и разреженные части
• Разреженное внимание и мультипольное внимание
• Тесты производительности рассуждений с длинным контекстом и ускорение работы с вниманием
Статья по KVQuant: https://proceedings.neurips.cc/paper_...
Код KVQuant: https://github.com/SqueezeAILab/KVQuant
Статья по мультипольному вниманию: https://proceedings.neurips.cc/paper_...
Код Multipole Attention: https://github.com/SqueezeAILab/Multi...
Докладчик: https://colemanhooper.org/
Представлено на: Bay Area Frontier Research Club #18 — Цена интеллекта
Запись: Pebblebed, Сан-Франциско, 19 августа 2026 г.
Frontier Research Club — это тщательно отобранный форум для серьезного обсуждения того, как ИИ меняет процесс научных исследований. Мы объединяем исследователей, специалистов по вычислительным наукам и инженеров-исследователей для изучения конкретных работ в области синтеза литературы, выдвижения гипотез, экспериментального проектирования, моделирования, анализа, безопасности и воспроизводимости.
Присоединяйтесь к предстоящим мероприятиям Frontier Syndicate: https://luma.com/frontiersyndicate
Подпишитесь на канал, чтобы получать больше докладов и обсуждений по передовым исследованиям: / @frontierresearchclub