Перейти к содержимому

Тот самый «глупый» показатель, который важнее характеристик VRAM

Full Stack

0:00 / 0:00

Тот самый «глупый» показатель, который важнее характеристик VRAM

268 просмотров · 2 недели назад
Full Stack
5,69 тыс. подписчиков
268 просмотров · 2 недели назад
Показатель пропускной способности памяти, деленный на количество байтов, считываемых каждым токеном, определяет максимальное количество токенов в секунду — и ни на одной странице продукта это не указывается. Это подтверждается расчетами Databricks, сверяется с реальными измерениями llama.cpp и приводит к одному правилу: выбирайте устройство с учетом пропускной способности, проверяйте совместимость, ожидайте примерно вдвое меньшую производительность. На серийном оборудовании: M1 — 14,19 токенов/с, M2 Ultra — 94,27 — в 11,8 раз большая пропускная способность, в 6,6 раз большая скорость, ни один из вариантов не выбран из-за объема памяти. Источники: сообщение инженера Databricks; обсуждение ggerganov/llama.cpp #4167. Репозиторий: https://github.com/ggerganov/llama.cpp 0:00 Тест на рабочем столе: больший ящик отвечает последним 0:33 Число, которое не отображается на странице продукта 1:03 Декодирование — это настольный случай 1:33 Четырнадцать миллисекунд на токен 2:08 Использование полосы пропускания модели 3:06 Пропускная способность против пропускной способности 4:02 Квантование: в четыре раза меньше байтов 5:00 Схлопывание разгрузки 6:02 Налог на байты в кэше ключ-значение 6:54 M1: нижняя граница таблицы 7:27 M2 Ultra: в 11,8 раз больше пропускной способности, в 6,6 раз больше скорости 7:58 M2 Max: половина шины 8:28 Уменьшение числа вдвое 8:58 Диапазон M5: пропускная способность растет, пропускная способность — нет 10:00 Когда перестать использовать эту математику 11:06 Маленькие модели уже достаточно быстры 11:39 Где я земля 12:14 Открытый вопрос