Перейти к содержимому

Сколько будет стоить запуск GPT-6 Astra локально? (Я всё посчитал)

Cloud Codes

0:00 / 0:00

Сколько будет стоить запуск GPT-6 Astra локально? (Я всё посчитал)

4 514 просмотров · 20 часов назад
Cloud Codes
38,5 тыс. подписчиков
4 514 просмотров · 20 часов назад
Для локального запуска OpenAI GPT-6 Astra требуется разместить примерно 3,9 терабайта 4-битных весов модели MXFP4 в архитектуре смешанных экспертов (MoE) с 7 триллионами параметров и 280 миллиардами активных параметров на токен. Хотя кластеризация из 31 компьютера Apple Mac Studio M5 Max или 31 узла NVIDIA DGX Spark обеспечивает необходимый общий объем памяти в 3,9 ТБ, ограничение пропускной способности памяти для одного потока ограничивает скорость вывода на уровне 1,31 токена в секунду, что делает его непригодным для использования. 🔔 Подпишитесь:    / @cloud-codes   💙 Станьте участником:    / @cloud-codes   🐦 Twitter/X: https://x.com/cloud_codes 💬 Discord:   / discord   В этом подробном обзоре Cloud Codes анализирует физическую и финансовую реальность передовых технологий саморазмещения: почему перемещение 156 гигабайт активных весов из памяти для одного токена превращает вывод в чистое узкое место пропускной способности, почему межсоединения Thunderbolt 5 делают параллелизм распределенных тензоров в 120 раз медленнее, чем встроенная оперативная память, и почему постоянное потребление 7,4 киловатт приводит к значительным затратам 11 953 долларов в год на оплату электроэнергии — почти в 6 раз дороже, чем аренда тех же 41 миллиона токенов напрямую через API OpenAI. Мы также анализируем, как скрытые циклы рекуррентной глубины Astra снижают скорость генерации, и объясняем, почему 18-месячная задержка локальных открытых весов остается единственной рациональной аппаратной стратегией. Если этот анализ помог вам понять физику пропускной способности памяти LLM, узкие места межкластерных соединений и экономику локальной инфраструктуры ИИ, подпишитесь на Cloud Codes, чтобы каждую неделю получать новый подробный обзор. Создавайте, решайте, развертывайте. 🔗 Упомянутые ресурсы: • Спецификации моделей OpenAI и цены на API: https://platform.openai.com/docs/models • Репозиторий карточек моделей и фрагментов модели Kimi K3 от Moonshot AI: https://huggingface.co/moonshotai/Kim... • Трекер вычислительных ресурсов для обучения ИИ от Epoch AI Frontier: https://epochai.org/data/notable-ai-m... • Технические характеристики Mac Studio M5 Max / M5 Ultra от Apple Newsroom: https://www.apple.com/newsroom/ • Архитектура и технические характеристики продукта NVIDIA DGX Spark: https://www.nvidia.com/en-us/data-cen... • Средние тарифы на электроэнергию для жилых домов в США от EIA (таблица 5.6.B): https://www.eia.gov/electricity/monthly/ • Статья о рекуррентном глубинном скрытом рассуждении (arXiv:2502.05171): https://arxiv.org/abs/2502.05171 • DeepSeek Open Weights (динамическое квантование): https://huggingface.co/unsloth ⏱️ Разделы: 0:00 - Отсутствующая спецификация на странице цен OpenAI 0:45 - Взвешивание Astra: линейка Kimi K3 1:55 - Оценка параметров: 7 триллионов MoE 4:22 - Сюрприз в виде 280 байт активных параметров 4:47 - Покупка 3,9 ТБ: Mac Studios против DGX Spark 6:49 - Реальное узкое место: 156 ГБ на токен 7:52 - Ловушка межсоединений: конвейер против тензорного параллелизма 9:15 - Счет за электроэнергию: 7,4 кВт и 60-летняя окупаемость 10:26 - Рекуррентная глубина: штраф за скрытое рассуждение 11:02 - Окончательный вердикт: 18-месячный закон локального оборудования #gpt6 #openai #macstudio #localllm #aihardware #nvidiadgx #deeplearning #cloudcodes #hardware #m5ultra #technews Запросы пользователей: количество параметров gpt 6 astra сколько будет стоить запуск gpt 6 локально можно ли запустить gpt 6 на Mac Studio требования к оборудованию gpt 6 astra сколько графических процессоров нужно для запуска модели с 7 триллионами параметров кластер DGX Spark GPT 6 ограничение пропускной способности памяти при выводе LLM объяснение рекуррентной глубины gpt 6 узкое место параллелизма тензоров Thunderbolt 5 почему локальные кластеры ИИ работают медленно активные параметры gpt 6 astra против gpt 4 размер параметров Kimi K3 байты запуск 70b против 7t LLM локально mac studio m5 ultra унифицированная память ИИ стоимость электроэнергии GPT 6 при локальном выводе стоимость API OpenAI против локального хостинга параллелизм конвейера против параллелизма тензоров в Mac Studio требования к локальному оборудованию Deepseek v4 m5 максимум 128 ГБ Llama C++ облачный код какое оборудование необходимо для запуска GPT 6 Astra локально оценка количества параметров GPT 6 Astra MOE сколько Mac Studios для запуска Frontier LLM формула пропускной способности памяти LLM токены в секунду пропускная способность Thunderbolt 5 против параллелизма тензоров в унифицированной памяти расчет стоимости локального кластера Nvidia DGX Spark почему параллелизм конвейера ограничен скоростью одного узла штраф за скорость вычислений при тестировании глубины скрытых рекуррентных процессов стоимость энергопотребления при локальном запуске Frontier AI точка безубыточности при самостоятельном хостинге LLM против API OpenAI