Перейти к содержимому

CEO Cerebras: почему GPU не обеспечивают быстрый инференс

The MAD Podcast with Matt Turck и Cerebras

0:00 / 0:00

CEO Cerebras: почему GPU не обеспечивают быстрый инференс

10 445 просмотров · 1 месяц назад
The MAD Podcast with Matt Turck и Cerebras
10 445 просмотров · 1 месяц назад
Искусственный интеллект перестал быть просто гонкой за обучением более интеллектуальных моделей. По мере внедрения ИИ в производство узким местом все чаще становится вывод результатов: насколько быстро модели могут генерировать токены, использовать инструменты, рассуждать, проверять и действовать. В этом эпизоде ​​подкаста MAD Мэтт Тёрк беседует с Эндрю Фельдманом, соучредителем и генеральным директором Cerebras, чтобы объяснить, почему быстрый вывод результатов может определить следующую эру ИИ. Компания Cerebras известна тем, что разработала чип размером с кремниевую пластину. Но этот разговор не ограничивается одной компанией или одним чипом. Это глубокое погружение в инфраструктуру ИИ: графические процессоры, ASIC, память, HBM, SRAM, центры обработки данных, питание, TSMC, AWS, OpenAI, агенты, модели рассуждений и почему скорость меняет то, какими могут стать продукты ИИ. Эндрю объясняет, почему важна «количество токенов в секунду на пользователя», почему для генерации одного слова может потребоваться перемещение в памяти эквивалента 100 HD-фильмов, почему агенты увеличивают задержку, почему графические процессоры испытывают трудности с определенными задачами вывода и почему быстрый ИИ в конечном итоге может изменить саму SaaS-индустрию. Это справочная беседа о быстром выводе, чипах для ИИ и следующем узком месте в вычислительных ресурсах. Эндрю Фельдман LinkedIn -   / andrewdfeldman   X/Twitter - https://x.com/andrewdfeldman Cerebras Веб-сайт - https://www.cerebras.ai/ X/Twitter - https://x.com/cerebras Мэтт Тёрк (управляющий директор) Блог - https://mattturck.com LinkedIn -   / turck   X/Twitter - https://x.com/mattturck FirstMark Capital Веб-сайт - https://firstmark.com X/Twitter - https://x.com/FirstMarkCap Слушайте на: Spotify - https://open.spotify.com/show/7yLATDS... Apple - https://podcasts.apple.com/us/podcast... 00:00 Вступление и вступительная часть 01:31 Почему скорость стала узким местом в ИИ 02:32 Токены в секунду на пользователя: объяснение 03:16 Момент широкополосного доступа ИИ и аналогия с Netflix 04:35 Ландшафт чипов для ИИ: GPU, TPU, Trainium, ASIC 06:36 Что такое ASIC? 08:08 Nvidia, Groq и война быстрых вычислений 09:16 OpenAI, Broadcom и специализированные кремниевые чипы 12:10 Китай, энергетика и суверенная инфраструктура ИИ 15:05 Является ли бум инфраструктуры ИИ пузырем? 18:56 Скрытые узкие места: HBM, CoWoS и 3 нм 22:57 Почему агенты создают нагрузку на ЦП 25:36 Путь Эндрю Фельдмана от SeaMicro до Cerebras 26:13 Почему Cerebras сделали ставку на ИИ в 2016 году 31:14 SRAM против HBM: почему вывод — это проблема памяти 33:19 Что на самом деле означает вычисление на уровне пластины 34:28 Проблема «Эвереста» в сфере глубоких технологий 36:07 Момент, когда заработала первая система Cerebras 36:49 Звон колокола и выживание в мире глубоких технологий 39:08 Как гигантский чип справляется с отказами 41:22 Почему графические процессоры испытывают трудности с декодированием 42:17 Объяснение предварительного заполнения и декодирования 44:01 Проблема «100 HD-фильмов» в выводе ИИ 45:04 Как быстрый вывод меняет обучение с подкреплением и тренировку 48:08 Модели рассуждений и почему они требуют больших вычислительных ресурсов 50:08 Верификация, ограничения и проверка больших моделей небольшими моделями 52:37 Мультимодальный ИИ и путь к видео 53:51 Бизнес-модель Cerebras: оборудование, облако и API 55:14 Сделка OpenAI по инференции мощностью 750 МВт 55:36 Почему центры обработки данных измеряются в мегаваттах 58:01 AWS Trainium + декодирование Cerebras 59:29 Быстрые токены как облачный продукт 01:00:52 Остается ли CUDA защитным барьером? 01:03:53 Как TSMC помогла Cerebras создать гигантский чип 01:07:41 Почему в 2020 году никому не было дела 01:08:15 Почему сложно диверсифицировать цепочки поставок чипов 01:09:54 Почему современные модели ИИ будут худшими из всех, что вы когда-либо использовали 01:10:38 Что быстрый ИИ может сделать с SaaS