Перейти к содержимому

Биграмма Карпатого за 10 минут...

Caleb Writes Code

0:00 / 0:00

Биграмма Карпатого за 10 минут...

35 036 просмотров · 3 месяца назад
Caleb Writes Code
117 тыс. подписчиков
35 036 просмотров · 3 месяца назад
Ознакомьтесь с курсами BlueDot и узнайте, как помочь сформировать будущее ИИ: http://bluedot.org/calebwritescode Андрей Карпати объясняет биграммную языковую модель Биграммные языковые модели, несмотря на свою простоту, дают ценное представление о внутренней механике обработки токенов в языковых моделях. Это вступление к тому, что будет дальше: GPT, вторая часть серии. Здесь используется модель Bigram, включающая в себя: Токенизацию, словарь, отрицательную функцию потерь, кросс-энтропию, логиты, SoftMax, оптимизатор и AdamW. Это важные компоненты, которые необходимо понимать, чтобы расширить наши знания о том, как на самом деле работают LLM, по мере того, как мы будем строить наши аргументы в пользу внимания и GPT. Подписывайтесь на меня: X: https://x.com/calebfoundry LinkedIn:   / calebeom   TikTok:   / calebwritescode   Главы 00:00 Введение 00:41 Токенизация 01:45 Встраивание 02:47 Обучение 03:10 Спонсор: BlueDot 04:15 Пакетная обработка, блокировка, канал 05:35 Обновление 06:22 Потеря 08:40 Обратное распространение ошибки, оптимизатор 09:03 Результат 09:52 Заключение #karpathy #deeplearning #llm