Перейти к содержимому

Как создавать системы вывода ИИ [Филип Кили] - 766

The TWIML AI Podcast with Sam Charrington

0:00 / 0:00

Как создавать системы вывода ИИ [Филип Кили] - 766

2 667 просмотров · 4 месяца назад
The TWIML AI Podcast with Sam Charrington
30,8 тыс. подписчиков
2 667 просмотров · 4 месяца назад
В этом эпизоде ​​к нам присоединяется Филип Кили, руководитель отдела обучения ИИ в Baseten, чтобы обсудить быстро развивающуюся дисциплину проектирования инференции. Мы рассмотрим, почему инференция стала самой востребованной и критически важной рабочей нагрузкой в ​​ИИ, как она сочетает программирование на GPU, прикладные исследования и крупномасштабные распределенные системы, и где проходит граница между инференцией и развертыванием моделей. Филип расскажет, как переход от исследований к производству может происходить за часы, а не за месяцы, и почему понимание «ключевых параметров» инференции — пакетной обработки, квантования, спекуляции и повторного использования кэша ключ-значение — позволяет командам разрабатывать более качественные продукты и достигать более высоких соглашений об уровне обслуживания (SLA). Мы проследим путь развития инференции от закрытых API до выделенных развертываний и собственных платформ, обсудим жизненные циклы GPU и рассмотрим современный ландшафт сред выполнения, включая vLLM, SGLang и TensorRT LLM. Наконец, мы заглянем в будущее, к агентам и мультимодальности, обосновывая необходимость специализированных сред выполнения для конкретных рабочих нагрузок, когда производительность и эффективность имеют первостепенное значение. 🗒️ Полный список ресурсов к этому эпизоду смотрите на странице с примечаниями к выпуску: https://twimlai.com/go/766. 🔔 Подпишитесь на наш канал, чтобы получать больше интересного контента: https://youtube.com/twimlai?sub_confi... 🗣️ Свяжитесь с нами! =============================== Подпишитесь на подкаст TWIML AI: https://twimlai.com/podcast/twimlai/ Следите за нами в Twitter:   / twimlai   Следите за нами в LinkedIn:   / twimlai   Присоединяйтесь к нашему сообществу в Slack: https://twimlai.com/community/ Подпишитесь на нашу рассылку: https://twimlai.com/newsletter/ Хотите связаться с нами? Отправьте нам сообщение: https://twimlai.com/contact/ 📖 РАЗДЕЛЫ ============================== 00:00 - Введение 03:40 - Почему вывод результатов является наиболее важной задачей ИИ? 06:21 - Вывод результатов против обслуживания моделей 07:18 - Проблемы вывода результатов 09:57 - Темпы исследований в области вывода результатов и сроки внедрения в производство 13:41 - Причины, по которым важно заниматься разработкой систем вывода результатов 15:49 - Соображения при принятии решения о разработке или покупке 22:08 - Цикл зрелости продукта 27:14 - Жизненные циклы GPU в контексте зрелости вывода результатов 32:14 - Вывод результатов с помощью LLM 36:46 - Агенты и мультимодальные модели в специализированной оптимизации вывода результатов 47:21 - Среды выполнения с открытым исходным кодом: vLLM, SGLang и TensorRT LLM 49:50 - Специализированное оборудование для ИИ 51:24 - Будущие тенденции и прогнозы 52:36 - Где найти книгу по разработке систем вывода результатов 🔗 ССЫЛКИ И РЕСУРСЫ =============================== Книга по разработке систем вывода результатов - https://www.baseten.co/inference-engi... Baseten - https://www.baseten.co/ 📸 Камера: https://amzn.to/3TQ3zsg 🎙️ Микрофон: https://amzn.to/3t5zXeV 🚦 Освещение: https://amzn.to/3TQlX49 🎛️ Аудиоинтерфейс: https://amzn.to/3TVFAIq 🎚️ Stream Deck: https://amzn.to/3zzm7F5