Перейти к содержимому

Запуск Kimi K3 на 8 ГБ ОЗУ (без GPU)

Cloud Codes

0:00 / 0:00

Запуск Kimi K3 на 8 ГБ ОЗУ (без GPU)

56 521 просмотр · 3 недели назад
Cloud Codes
37,9 тыс. подписчиков
56 521 просмотр · 3 недели назад
Физически возможно ли запустить модель искусственного интеллекта с 2,78 триллионами параметров на процессоре с всего лишь 8,24 ГБ оперативной памяти и без видеопамяти графического процессора? Представляем вашему вниманию движок на чистом C, состоящий из 6000 строк кода, который воспроизводит Kimi K3 от Moonshot напрямую с NVMe-накопителя с помощью скомпилированного бинарного файла размером 176 КБ. 🔔 Подпишитесь:    / @cloud-codes   💙 Станьте участником:    / @cloud-codes   🐦 Twitter/X: https://x.com/cloud_codes 💬 Discord:   / discord   В этом подробном обзоре Cloud Codes разбирает архитектуру компьютера и механику памяти, лежащие в основе чистого C-движка Фарида Хана, проекта WASTE Марко Бамбини и проекта deltafin на Rust. Мы исследуем, как архитектура Kimi K3 Mixture-of-Experts (MoE) поддерживает 96,3% своих весов неактивными (всего 104 байта активных параметров на токен), как Kimi Delta Attention поддерживает фиксированное рекуррентное состояние объемом 626 МБ и как NVMe Direct I/O передает 109 ГБ плотных весов транка с диска, не превышая лимит системной оперативной памяти в 8,24 ГБ. Кроме того, мы анализируем жесткий компромисс между памятью и скоростью: почему работа в 8 ГБ ОЗУ приводит к медленной скорости в 32,69 секунды на токен, как масштабирование до 29 ГБ ОЗУ (WASTE) ускоряет выполнение в 16 раз до 0,50 токенов/сек, и почему обмен объема памяти на пропускную способность хранилища доказывает, что локальные аппаратные ограничения являются предположениями о загрузке, а не законами физики. Если это помогло вам понять архитектуру бэкэнда, проектирование системы и как создавать более быстрое программное обеспечение, подпишитесь на Cloud Codes, чтобы каждую неделю получать новый разбор инфраструктуры! Создавайте, решайте задачи, развертывайте. 🔗 Упомянутые репозитории и источники: • Движок Fareed Khan C: https://github.com/FareedKhan-dev/kim... • Движок WASTE (SQLite Cloud): https://github.com/sqliteai/waste • Движок Deltafin (порт на Rust): https://github.com/gavamedia/deltafin • Модель карты Moonshot AI Kimi K3: https://huggingface.co/moonshotai/Kim... • Ссылка на llama2.c Андрея Карпати: https://github.com/karpathy/llama2.c ⏱️ Разделы видео: 0:00 - Прорыв в разработке ноутбука с 2,78 триллионами параметров 1:04 - Что такое Kimi K3? (Фронтенд-модель Arena #1) 2:35 - Трюк с активными параметрами 3,7% (разреженность MoE) 3:21 - 4 способа уменьшения: MXFP4, Delta Attention и Latent KV 4:22 - Потоковая передача NVMe и прямой ввод-вывод (в обход системной памяти) 5:23 - Подвох: 32,69 секунды на токен! 7:08 - Сравнение 3 движков: C, Rust (deltafin) и WASTE 8:46 - Регулировка памяти: бенчмарки 8 ГБ против 29 ГБ против 2300 ГБ 9:34 - Аналогия Карпати с C: почему это объясняет LLM 10:43 - Окончательный вердикт: предположение, а не закон физики #kimik3 #cprogramming #localai #cpu #systemdesign #ai #cloudcodes Запросы пользователей: fareed khan kimi k3 pure c engine github run kimi k3 2.8 trillion parameter on 8gb ram cpu kimi k3 mxfp4 nvme direct io streaming waste vs deltafin vs pure c kimi k3 benchmark how to run large moe models without gpu kimi delta attention recurrent state memory overhead 32 seconds per token kimi k3 cpu разгрузка чистый C вывод LLM Karpathy Llama C стена памяти против стены пропускной способности локальный ИИ облачные коды Kimi K3 8 ГБ ОЗУ разборка