Перейти к содержимому

Как ускорить механизм внимания для длинных контекстов в 4,5 раза | Коулман Хупер, Калифорнийский ...

Frontier Research Club

0:00 / 0:00

Как ускорить механизм внимания для длинных контекстов в 4,5 раза | Коулман Хупер, Калифорнийский ...

208 просмотров · 6 дней назад
Frontier Research Club
464 подписчика
208 просмотров · 6 дней назад
Коулман Хупер — научный сотрудник Калифорнийского университета в Беркли, работающий с Куртом Койтцером в BAIR и Софией Шао в SLICE в рамках SqueezeAILab. Он занимается исследованиями эффективных систем вывода LLM и систем искусственного интеллекта, является первым автором KVQuant (NeurIPS 2024) и соавтором Multipole Attention (NeurIPS 2025). По мере увеличения времени работы агентов и кодовых систем их контекст расширяется. Во время авторегрессивного декодирования вычислительные ресурсы графического процессора используются не в полной мере, поскольку узким местом является перемещение данных, а не арифметические операции; при больших длинах контекста трафик KV-кэша превышает весовые коэффициенты модели и доминирует в объеме памяти и пропускной способности. Коулман предлагает два взаимодополняющих решения. KVQuant сочетает в себе квантование ключей до RoPE для каждого канала с неравномерным кодированием с учетом чувствительности и разложением на плотные и разреженные части, достигая снижения перплексии менее чем на 0,1 при 3-битной точности (примерно 5-кратное сжатие). Его 4-битная реализация обеспечивает 3,7-кратную экономию памяти в KV-кэше и 1,7-кратное ускорение загрузки в KV-кэш для Llama-2-7B при 16K контексте на A6000. Multipole Attention вычисляет точное внимание только для важных токенов, аппроксимируя остальные; в задачах рассуждения с длинным контекстом он сохраняет точность, близкую к точности полного внимания, при бюджете на пропускную способность памяти в 8% и достигает ускорения внимания до 4,5 раз. Компромисс заключается в дополнительной сложности кодирования, кластеризации и аппроксимации — а разреженные методы должны оцениваться на тестах рассуждения, а не только на тестах поиска. Рассматриваемые темы: • Вывод LLM с длинным контекстом • Квантование KV-кэша и пропускная способность памяти • KVQuant, 3-битное квантование и квантование ключей до RoPE • Неравномерное квантование с учетом чувствительности • Разложение на плотные и разреженные части • Разреженное внимание и мультипольное внимание • Тесты производительности рассуждений с длинным контекстом и ускорение работы с вниманием Статья по KVQuant: https://proceedings.neurips.cc/paper_... Код KVQuant: https://github.com/SqueezeAILab/KVQuant Статья по мультипольному вниманию: https://proceedings.neurips.cc/paper_... Код Multipole Attention: https://github.com/SqueezeAILab/Multi... Докладчик: https://colemanhooper.org/ Представлено на: Bay Area Frontier Research Club #18 — Цена интеллекта Запись: Pebblebed, Сан-Франциско, 19 августа 2026 г. Frontier Research Club — это тщательно отобранный форум для серьезного обсуждения того, как ИИ меняет процесс научных исследований. Мы объединяем исследователей, специалистов по вычислительным наукам и инженеров-исследователей для изучения конкретных работ в области синтеза литературы, выдвижения гипотез, экспериментального проектирования, моделирования, анализа, безопасности и воспроизводимости. Присоединяйтесь к предстоящим мероприятиям Frontier Syndicate: https://luma.com/frontiersyndicate Подпишитесь на канал, чтобы получать больше докладов и обсуждений по передовым исследованиям:    / @frontierresearchclub