Тот самый «глупый» показатель, который важнее характеристик VRAM
Full Stack
0:00 / 0:00
Тот самый «глупый» показатель, который важнее характеристик VRAM
268 просмотров · 2 недели назад
Full Stack
5,69 тыс. подписчиков
268 просмотров · 2 недели назад
Показатель пропускной способности памяти, деленный на количество байтов, считываемых каждым токеном, определяет максимальное количество токенов в секунду — и ни на одной странице продукта это не указывается. Это подтверждается расчетами Databricks, сверяется с реальными измерениями llama.cpp и приводит к одному правилу: выбирайте устройство с учетом пропускной способности, проверяйте совместимость, ожидайте примерно вдвое меньшую производительность.
На серийном оборудовании: M1 — 14,19 токенов/с, M2 Ultra — 94,27 — в 11,8 раз большая пропускная способность, в 6,6 раз большая скорость, ни один из вариантов не выбран из-за объема памяти. Источники: сообщение инженера Databricks; обсуждение ggerganov/llama.cpp #4167.
Репозиторий: https://github.com/ggerganov/llama.cpp
0:00 Тест на рабочем столе: больший ящик отвечает последним
0:33 Число, которое не отображается на странице продукта
1:03 Декодирование — это настольный случай
1:33 Четырнадцать миллисекунд на токен
2:08 Использование полосы пропускания модели
3:06 Пропускная способность против пропускной способности
4:02 Квантование: в четыре раза меньше байтов
5:00 Схлопывание разгрузки
6:02 Налог на байты в кэше ключ-значение
6:54 M1: нижняя граница таблицы
7:27 M2 Ultra: в 11,8 раз больше пропускной способности, в 6,6 раз больше скорости
7:58 M2 Max: половина шины
8:28 Уменьшение числа вдвое
8:58 Диапазон M5: пропускная способность растет, пропускная способность — нет
10:00 Когда перестать использовать эту математику
11:06 Маленькие модели уже достаточно быстры
11:39 Где я земля
12:14 Открытый вопрос