О методах формирования политики: как крупные лаборатории искусственного интеллекта на самом деле ...
Neural Breakdown with AVB
0:00 / 0:00
О методах формирования политики: как крупные лаборатории искусственного интеллекта на самом деле ...
4 098 просмотров · 2 дня назад
Neural Breakdown with AVB
34,4 тыс. подписчиков
4 098 просмотров · 2 дня назад
Визуальный анализ алгоритмов On Policy Distillation (OPD) и On Policy Self Distillation (OPSD), а также того, как лаборатории ИИ используют эти методы для обучения больших языковых моделей!
Изучите научные статьи на сайте: paperbreakdown.com
Я работаю над этим проектом, пожалуйста, посмотрите и оставьте свой отзыв!
Подписывайтесь на меня в Twitter: https://x.com/neural_avb
Чтобы присоединиться к нашему Patreon, посетите: / neuralbreakdownwithavb
Участники получают доступ ко всему, что происходит за кулисами при создании моих видео, включая код и дополнительные материалы. Кроме того, это оказывает большую поддержку каналу и помогает оплачивать мои счета.
Ссылки:
Блог Thinking Machines: https://thinkingmachines.ai/blog/on-p...
Отличная статья на X: https://x.com/willcb/status/205003827...
Статья SDPO: https://x.com/neural_avb/status/20212...
Двойная дистилляция на основе политики: https://x.com/neural_avb/status/20756...
Отличный репозиторий Git: https://github.com/chrisliu298/awesom...
Временные метки:
0:00 - Вступление
2:06 - Дистилляция на основе политики
11:15 - Обратный KL против прямого KL
18:13 - На основе политики Самостоятельная дистилляция
23:20 - Привилегированная иллюзия
24:52 - Когда что использовать?