Биграмма Карпатого за 10 минут...
Caleb Writes Code
0:00 / 0:00
Биграмма Карпатого за 10 минут...
35 036 просмотров · 3 месяца назад
Caleb Writes Code
117 тыс. подписчиков
35 036 просмотров · 3 месяца назад
Ознакомьтесь с курсами BlueDot и узнайте, как помочь сформировать будущее ИИ: http://bluedot.org/calebwritescode
Андрей Карпати объясняет биграммную языковую модель
Биграммные языковые модели, несмотря на свою простоту, дают ценное представление о внутренней механике обработки токенов в языковых моделях. Это вступление к тому, что будет дальше: GPT, вторая часть серии.
Здесь используется модель Bigram, включающая в себя:
Токенизацию, словарь, отрицательную функцию потерь, кросс-энтропию, логиты, SoftMax, оптимизатор и AdamW.
Это важные компоненты, которые необходимо понимать, чтобы расширить наши знания о том, как на самом деле работают LLM, по мере того, как мы будем строить наши аргументы в пользу внимания и GPT.
Подписывайтесь на меня:
X: https://x.com/calebfoundry
LinkedIn: / calebeom
TikTok: / calebwritescode
Главы
00:00 Введение
00:41 Токенизация
01:45 Встраивание
02:47 Обучение
03:10 Спонсор: BlueDot
04:15 Пакетная обработка, блокировка, канал
05:35 Обновление
06:22 Потеря
08:40 Обратное распространение ошибки, оптимизатор
09:03 Результат
09:52 Заключение
#karpathy #deeplearning #llm