"AI PC" — это ложь. Ваш NPU уже является узким местом.
Macro Lens
0:00 / 0:00
"AI PC" — это ложь. Ваш NPU уже является узким местом.
9 909 просмотров · 3 месяца назад
Macro Lens
17 тыс. подписчиков
9 909 просмотров · 3 месяца назад
Каждый производитель ноутбуков продает вам наклейку с показателем 45 TOPS, скрывая узкое место в 30 ГБ/с. Для локального вывода LLM только одно из этих чисел определяет, действительно ли чип работает — и это не то, что указано на коробке.
Поддержите меня на Patreon: / macrolens
Продвижение «AI PC» — это крупнейшая маркетинговая ставка индустрии ноутбуков за десятилетие. Qualcomm Snapdragon X Elite, Intel Lunar Lake, AMD Strix Halo, Apple M4 — каждый производитель чипов стремится к сертификации Copilot+ с показателем 40 TOPS. Но TOPS измеряет скорость выполнения вычислений нейронным процессором (NPU). Он ничего не говорит о том, может ли чип получить данные для выполнения вычислений. Для языковых моделей вся рабочая нагрузка ограничена памятью: каждый сгенерированный токен требует потоковой передачи полной матрицы весов через математический блок. 7-битная модель с 4-битным квантованием занимает примерно 4 ГБ. При пропускной способности общей памяти LPDDR5X 20–40 ГБ/с это примерно 7 токенов в секунду. На дискретной видеокарте с выделенной памятью GDDR6X 700 ГБ/с — 175. Та же модель. Та же математика. Другой канал передачи данных.
В этом видео разбирается спецификация, которую индустрия приучила вас игнорировать, почему существует ограничение в 40 TOPS от Microsoft и куда на самом деле движется следующая волна серьезных локальных ИИ-микросхем — Apple M-Ultra, Strix Halo с 256-битной памятью, NVIDIA Project Digits.
━━━━━━━━━━━━━━━━━━━
СМОТРЕТЬ ДАЛЕЕ
━━━━━━━━━━━━━━━━━━
Антропный проект Glasswing: ИИ обнаруживает уязвимости нулевого дня раньше хакеров — тот же ракурс, другой заголовок. Разница между тем, что было объявлено, и тем, что произошло на самом деле.
━━━━━━━━━━━━━━━━━━━
РАЗДЕЛЫ
━━━━━━━━━━━━━━━━━━━
0:00 Число, которое они скрывают
0:27 Маркетинговая ставка на ПК с ИИ
0:50 TOPS: Главное число
1:13 Почему 40 TOPS стало наклейкой
1:52 Шина общей памяти
2:30 Реальная пропускная способность NPU: 20-40 ГБ/с
2:42 Дискретные графические процессоры не используют общую память
3:04 LLM ограничены памятью, а не вычислительными ресурсами
3:36 Спецификация, которая Не указано на коробке
3:58 Почему каждый производитель использует этот подход
4:38 Для чего на самом деле хороши NPU
4:54 Победители и проигравшие
5:10 Куда на самом деле движется локальный ИИ
5:56 Как читать технические характеристики
━━━━━━━━━━━━━━━━━━
КЛЮЧЕВЫЕ ПОНЯТИЯ / УПОМЯНУТЫЕ ХАРАКТЕРИСТИКИ
━━━━━━━━━━━━━━━━━━━
NPU Snapdragon X Elite: 45 TOPS (INT8) / ~75 TOPS общий стек
NPU Intel Lunar Lake: 48 TOPS (INT8)
AMD Strix Halo NPU: ~50 TOPS (INT8)
Apple M4 Neural Engine: 38 TOPS (INT8)
Сертификационный шлюз Microsoft Copilot+ для ПК: 40 TOPS на NPU
LPDDR5X-8533, 128-битная шина: ~136 ГБ/с пиковая, распределяется между NPU + CPU + GPU + дисплей
Реальная полезная пропускная способность NPU: 20-40 ГБ/с при конкуренции со стороны ОС
RTX 4080 (GDDR6X): ~717 ГБ/с выделенной памяти
RTX 4090 (GDDR6X): ~1008 ГБ/с выделенной памяти
H100 (HBM3): ~3350 ГБ/с выделенной памяти
7B INT4 модель: ~4 ГБ веса; Ограниченная пропускной способностью производительность при выводе данных (~7 ток/с на NPU, ~175 ток/с на дискретных процессорах среднего уровня)
Соотношение TOPS / ГБ-с: NPU AI PC ≈ 2,5; RTX 4070 Ti ≈ 0,96 (вычислительных мощностей достаточно; ограничение — пропускная способность)
Унифицированная память следующего поколения: Strix Halo (256-бит) ~256 ГБ/с, Apple M4 Max ~546 ГБ/с, M2 Ultra ~800 ГБ/с, Project Digits ~400-512 ГБ/с
━━━━━━━━━━━━━━━━━━━
Часто задаваемые вопросы
━━━━━━━━━━━━━━━━━━
Почему показатель NPU TOPS не имеет значения для LLM? Поскольку вывод LLM ограничен объемом памяти, а не вычислительной мощностью, каждый токен требует потоковой передачи полной матрицы весов из памяти через математический блок, поэтому пропускная способность ограничивается пропускной способностью памяти, а не количеством триллионов операций в секунду, которые NPU теоретически может выполнить.
Что же на самом деле является узким местом в ПК для ИИ? Общая системная шина памяти LPDDR5X. NPU не имеет выделенной памяти и конкурирует с ЦП, интегрированным графическим процессором и контроллером дисплея за ту же пиковую пропускную способность ~136 ГБ/с, оставляя 20-40 ГБ/с доступной в реальных условиях.
Насколько быстро ПК Copilot+ может реально обрабатывать 7-битную языковую модель? При доступной пропускной способности 20-40 ГБ/с и ~4 ГБ весов INT4 ожидайте примерно 5-10 токенов в секунду. Та же модель на дискретном графическом процессоре среднего уровня с 700 ГБ/с выделенной памяти GDDR6X достигает ~175 токенов в секунду.
Решит ли это унифицированные чипы памяти, такие как AMD Strix Halo или Apple M-Ultra? Да, частично. Более широкие шины памяти (256-битные и выше) и выделенное распределение увеличивают полезную пропускную способность до 250-800 ГБ/с, что делает серьезную локальную обработку LLM-процессов действительно жизнеспособной. Именно за этими платформами стоит следить, а не за Copilot+ с производительностью 40 TOPS.
Для че...