CEO Cerebras: почему GPU не обеспечивают быстрый инференс
The MAD Podcast with Matt Turck и Cerebras
0:00 / 0:00
CEO Cerebras: почему GPU не обеспечивают быстрый инференс
10 445 просмотров · 1 месяц назад
The MAD Podcast with Matt Turck и Cerebras
10 445 просмотров · 1 месяц назад
Искусственный интеллект перестал быть просто гонкой за обучением более интеллектуальных моделей. По мере внедрения ИИ в производство узким местом все чаще становится вывод результатов: насколько быстро модели могут генерировать токены, использовать инструменты, рассуждать, проверять и действовать. В этом эпизоде подкаста MAD Мэтт Тёрк беседует с Эндрю Фельдманом, соучредителем и генеральным директором Cerebras, чтобы объяснить, почему быстрый вывод результатов может определить следующую эру ИИ.
Компания Cerebras известна тем, что разработала чип размером с кремниевую пластину. Но этот разговор не ограничивается одной компанией или одним чипом. Это глубокое погружение в инфраструктуру ИИ: графические процессоры, ASIC, память, HBM, SRAM, центры обработки данных, питание, TSMC, AWS, OpenAI, агенты, модели рассуждений и почему скорость меняет то, какими могут стать продукты ИИ. Эндрю объясняет, почему важна «количество токенов в секунду на пользователя», почему для генерации одного слова может потребоваться перемещение в памяти эквивалента 100 HD-фильмов, почему агенты увеличивают задержку, почему графические процессоры испытывают трудности с определенными задачами вывода и почему быстрый ИИ в конечном итоге может изменить саму SaaS-индустрию.
Это справочная беседа о быстром выводе, чипах для ИИ и следующем узком месте в вычислительных ресурсах.
Эндрю Фельдман
LinkedIn - / andrewdfeldman
X/Twitter - https://x.com/andrewdfeldman
Cerebras
Веб-сайт - https://www.cerebras.ai/
X/Twitter - https://x.com/cerebras
Мэтт Тёрк (управляющий директор)
Блог - https://mattturck.com
LinkedIn - / turck
X/Twitter - https://x.com/mattturck
FirstMark Capital
Веб-сайт - https://firstmark.com
X/Twitter - https://x.com/FirstMarkCap
Слушайте на:
Spotify - https://open.spotify.com/show/7yLATDS...
Apple - https://podcasts.apple.com/us/podcast...
00:00 Вступление и вступительная часть
01:31 Почему скорость стала узким местом в ИИ
02:32 Токены в секунду на пользователя: объяснение
03:16 Момент широкополосного доступа ИИ и аналогия с Netflix
04:35 Ландшафт чипов для ИИ: GPU, TPU, Trainium, ASIC
06:36 Что такое ASIC?
08:08 Nvidia, Groq и война быстрых вычислений
09:16 OpenAI, Broadcom и специализированные кремниевые чипы
12:10 Китай, энергетика и суверенная инфраструктура ИИ
15:05 Является ли бум инфраструктуры ИИ пузырем?
18:56 Скрытые узкие места: HBM, CoWoS и 3 нм
22:57 Почему агенты создают нагрузку на ЦП
25:36 Путь Эндрю Фельдмана от SeaMicro до Cerebras
26:13 Почему Cerebras сделали ставку на ИИ в 2016 году
31:14 SRAM против HBM: почему вывод — это проблема памяти
33:19 Что на самом деле означает вычисление на уровне пластины
34:28 Проблема «Эвереста» в сфере глубоких технологий
36:07 Момент, когда заработала первая система Cerebras
36:49 Звон колокола и выживание в мире глубоких технологий
39:08 Как гигантский чип справляется с отказами
41:22 Почему графические процессоры испытывают трудности с декодированием
42:17 Объяснение предварительного заполнения и декодирования
44:01 Проблема «100 HD-фильмов» в выводе ИИ
45:04 Как быстрый вывод меняет обучение с подкреплением и тренировку
48:08 Модели рассуждений и почему они требуют больших вычислительных ресурсов
50:08 Верификация, ограничения и проверка больших моделей небольшими моделями
52:37 Мультимодальный ИИ и путь к видео
53:51 Бизнес-модель Cerebras: оборудование, облако и API
55:14 Сделка OpenAI по инференции мощностью 750 МВт
55:36 Почему центры обработки данных измеряются в мегаваттах
58:01 AWS Trainium + декодирование Cerebras
59:29 Быстрые токены как облачный продукт
01:00:52 Остается ли CUDA защитным барьером?
01:03:53 Как TSMC помогла Cerebras создать гигантский чип
01:07:41 Почему в 2020 году никому не было дела
01:08:15 Почему сложно диверсифицировать цепочки поставок чипов
01:09:54 Почему современные модели ИИ будут худшими из всех, что вы когда-либо использовали
01:10:38 Что быстрый ИИ может сделать с SaaS