Как создавать системы вывода ИИ [Филип Кили] - 766
The TWIML AI Podcast with Sam Charrington
0:00 / 0:00
Как создавать системы вывода ИИ [Филип Кили] - 766
2 667 просмотров · 4 месяца назад
The TWIML AI Podcast with Sam Charrington
30,8 тыс. подписчиков
2 667 просмотров · 4 месяца назад
В этом эпизоде к нам присоединяется Филип Кили, руководитель отдела обучения ИИ в Baseten, чтобы обсудить быстро развивающуюся дисциплину проектирования инференции. Мы рассмотрим, почему инференция стала самой востребованной и критически важной рабочей нагрузкой в ИИ, как она сочетает программирование на GPU, прикладные исследования и крупномасштабные распределенные системы, и где проходит граница между инференцией и развертыванием моделей. Филип расскажет, как переход от исследований к производству может происходить за часы, а не за месяцы, и почему понимание «ключевых параметров» инференции — пакетной обработки, квантования, спекуляции и повторного использования кэша ключ-значение — позволяет командам разрабатывать более качественные продукты и достигать более высоких соглашений об уровне обслуживания (SLA). Мы проследим путь развития инференции от закрытых API до выделенных развертываний и собственных платформ, обсудим жизненные циклы GPU и рассмотрим современный ландшафт сред выполнения, включая vLLM, SGLang и TensorRT LLM. Наконец, мы заглянем в будущее, к агентам и мультимодальности, обосновывая необходимость специализированных сред выполнения для конкретных рабочих нагрузок, когда производительность и эффективность имеют первостепенное значение.
🗒️ Полный список ресурсов к этому эпизоду смотрите на странице с примечаниями к выпуску: https://twimlai.com/go/766.
🔔 Подпишитесь на наш канал, чтобы получать больше интересного контента: https://youtube.com/twimlai?sub_confi...
🗣️ Свяжитесь с нами!
===============================
Подпишитесь на подкаст TWIML AI: https://twimlai.com/podcast/twimlai/
Следите за нами в Twitter: / twimlai
Следите за нами в LinkedIn: / twimlai
Присоединяйтесь к нашему сообществу в Slack: https://twimlai.com/community/
Подпишитесь на нашу рассылку: https://twimlai.com/newsletter/
Хотите связаться с нами? Отправьте нам сообщение: https://twimlai.com/contact/
📖 РАЗДЕЛЫ
==============================
00:00 - Введение
03:40 - Почему вывод результатов является наиболее важной задачей ИИ?
06:21 - Вывод результатов против обслуживания моделей
07:18 - Проблемы вывода результатов
09:57 - Темпы исследований в области вывода результатов и сроки внедрения в производство
13:41 - Причины, по которым важно заниматься разработкой систем вывода результатов
15:49 - Соображения при принятии решения о разработке или покупке
22:08 - Цикл зрелости продукта
27:14 - Жизненные циклы GPU в контексте зрелости вывода результатов
32:14 - Вывод результатов с помощью LLM
36:46 - Агенты и мультимодальные модели в специализированной оптимизации вывода результатов
47:21 - Среды выполнения с открытым исходным кодом: vLLM, SGLang и TensorRT LLM
49:50 - Специализированное оборудование для ИИ
51:24 - Будущие тенденции и прогнозы
52:36 - Где найти книгу по разработке систем вывода результатов
🔗 ССЫЛКИ И РЕСУРСЫ
===============================
Книга по разработке систем вывода результатов - https://www.baseten.co/inference-engi...
Baseten - https://www.baseten.co/
📸 Камера: https://amzn.to/3TQ3zsg
🎙️ Микрофон: https://amzn.to/3t5zXeV
🚦 Освещение: https://amzn.to/3TQlX49
🎛️ Аудиоинтерфейс: https://amzn.to/3TVFAIq
🎚️ Stream Deck: https://amzn.to/3zzm7F5