Перейти к содержимому

"AI PC" — это ложь. Ваш NPU уже является узким местом.

Macro Lens

0:00 / 0:00

"AI PC" — это ложь. Ваш NPU уже является узким местом.

9 909 просмотров · 3 месяца назад
Macro Lens
17 тыс. подписчиков
9 909 просмотров · 3 месяца назад
Каждый производитель ноутбуков продает вам наклейку с показателем 45 TOPS, скрывая узкое место в 30 ГБ/с. Для локального вывода LLM только одно из этих чисел определяет, действительно ли чип работает — и это не то, что указано на коробке. Поддержите меня на Patreon:   / macrolens   Продвижение «AI PC» — это крупнейшая маркетинговая ставка индустрии ноутбуков за десятилетие. Qualcomm Snapdragon X Elite, Intel Lunar Lake, AMD Strix Halo, Apple M4 — каждый производитель чипов стремится к сертификации Copilot+ с показателем 40 TOPS. Но TOPS измеряет скорость выполнения вычислений нейронным процессором (NPU). Он ничего не говорит о том, может ли чип получить данные для выполнения вычислений. Для языковых моделей вся рабочая нагрузка ограничена памятью: каждый сгенерированный токен требует потоковой передачи полной матрицы весов через математический блок. 7-битная модель с 4-битным квантованием занимает примерно 4 ГБ. При пропускной способности общей памяти LPDDR5X 20–40 ГБ/с это примерно 7 токенов в секунду. На дискретной видеокарте с выделенной памятью GDDR6X 700 ГБ/с — 175. Та же модель. Та же математика. Другой канал передачи данных. В этом видео разбирается спецификация, которую индустрия приучила вас игнорировать, почему существует ограничение в 40 TOPS от Microsoft и куда на самом деле движется следующая волна серьезных локальных ИИ-микросхем — Apple M-Ultra, Strix Halo с 256-битной памятью, NVIDIA Project Digits. ━━━━━━━━━━━━━━━━━━━ СМОТРЕТЬ ДАЛЕЕ ━━━━━━━━━━━━━━━━━━ Антропный проект Glasswing: ИИ обнаруживает уязвимости нулевого дня раньше хакеров — тот же ракурс, другой заголовок. Разница между тем, что было объявлено, и тем, что произошло на самом деле. ━━━━━━━━━━━━━━━━━━━ РАЗДЕЛЫ ━━━━━━━━━━━━━━━━━━━ 0:00 Число, которое они скрывают 0:27 Маркетинговая ставка на ПК с ИИ 0:50 TOPS: Главное число 1:13 Почему 40 TOPS стало наклейкой 1:52 Шина общей памяти 2:30 Реальная пропускная способность NPU: 20-40 ГБ/с 2:42 Дискретные графические процессоры не используют общую память 3:04 LLM ограничены памятью, а не вычислительными ресурсами 3:36 Спецификация, которая Не указано на коробке 3:58 Почему каждый производитель использует этот подход 4:38 Для чего на самом деле хороши NPU 4:54 Победители и проигравшие 5:10 Куда на самом деле движется локальный ИИ 5:56 Как читать технические характеристики ━━━━━━━━━━━━━━━━━━ КЛЮЧЕВЫЕ ПОНЯТИЯ / УПОМЯНУТЫЕ ХАРАКТЕРИСТИКИ ━━━━━━━━━━━━━━━━━━━ NPU Snapdragon X Elite: 45 TOPS (INT8) / ~75 TOPS общий стек NPU Intel Lunar Lake: 48 TOPS (INT8) AMD Strix Halo NPU: ~50 TOPS (INT8) Apple M4 Neural Engine: 38 TOPS (INT8) Сертификационный шлюз Microsoft Copilot+ для ПК: 40 TOPS на NPU LPDDR5X-8533, 128-битная шина: ~136 ГБ/с пиковая, распределяется между NPU + CPU + GPU + дисплей Реальная полезная пропускная способность NPU: 20-40 ГБ/с при конкуренции со стороны ОС RTX 4080 (GDDR6X): ~717 ГБ/с выделенной памяти RTX 4090 (GDDR6X): ~1008 ГБ/с выделенной памяти H100 (HBM3): ~3350 ГБ/с выделенной памяти 7B INT4 модель: ~4 ГБ веса; Ограниченная пропускной способностью производительность при выводе данных (~7 ток/с на NPU, ~175 ток/с на дискретных процессорах среднего уровня) Соотношение TOPS / ГБ-с: NPU AI PC ≈ 2,5; RTX 4070 Ti ≈ 0,96 (вычислительных мощностей достаточно; ограничение — пропускная способность) Унифицированная память следующего поколения: Strix Halo (256-бит) ~256 ГБ/с, Apple M4 Max ~546 ГБ/с, M2 Ultra ~800 ГБ/с, Project Digits ~400-512 ГБ/с ━━━━━━━━━━━━━━━━━━━ Часто задаваемые вопросы ━━━━━━━━━━━━━━━━━━ Почему показатель NPU TOPS не имеет значения для LLM? Поскольку вывод LLM ограничен объемом памяти, а не вычислительной мощностью, каждый токен требует потоковой передачи полной матрицы весов из памяти через математический блок, поэтому пропускная способность ограничивается пропускной способностью памяти, а не количеством триллионов операций в секунду, которые NPU теоретически может выполнить. Что же на самом деле является узким местом в ПК для ИИ? Общая системная шина памяти LPDDR5X. NPU не имеет выделенной памяти и конкурирует с ЦП, интегрированным графическим процессором и контроллером дисплея за ту же пиковую пропускную способность ~136 ГБ/с, оставляя 20-40 ГБ/с доступной в реальных условиях. Насколько быстро ПК Copilot+ может реально обрабатывать 7-битную языковую модель? При доступной пропускной способности 20-40 ГБ/с и ~4 ГБ весов INT4 ожидайте примерно 5-10 токенов в секунду. Та же модель на дискретном графическом процессоре среднего уровня с 700 ГБ/с выделенной памяти GDDR6X достигает ~175 токенов в секунду. Решит ли это унифицированные чипы памяти, такие как AMD Strix Halo или Apple M-Ultra? Да, частично. Более широкие шины памяти (256-битные и выше) и выделенное распределение увеличивают полезную пропускную способность до 250-800 ГБ/с, что делает серьезную локальную обработку LLM-процессов действительно жизнеспособной. Именно за этими платформами стоит следить, а не за Copilot+ с производительностью 40 TOPS. Для че...