Перейти к содержимому

Обучение с подкреплением на основе обратной связи от человека: от нуля до chatGPT

Hugging Face

0:00 / 0:00

Обучение с подкреплением на основе обратной связи от человека: от нуля до chatGPT

190 326 просмотров · Трансляция закончилась 3 года назад
Hugging Face
145 тыс. подписчиков
190 326 просмотров · Трансляция закончилась 3 года назад
В этом докладе мы рассмотрим основы обучения с подкреплением на основе обратной связи от человека (RLHF) и то, как эта технология используется для создания передовых инструментов машинного обучения, таких как ChatGPT. Большая часть доклада будет посвящена обзору взаимосвязанных моделей машинного обучения и основам обработки естественного языка и обучения с подкреплением, необходимым для понимания того, как RLHF используется в больших языковых моделях. В заключение будет задан открытый вопрос по RLHF. Блог RLHF: https://huggingface.co/blog/rlhf Курс по глубокому обучению с подкреплением: https://hf.co/deep-rl-course Слайды из этого доклада: https://docs.google.com/presentation/... Твиттер Натана:   / natolambert   Твиттер Томаса:   / thomassimonini   Натан Ламберт — научный сотрудник HuggingFace. Он получил докторскую степень в Калифорнийском университете в Беркли, работая на стыке машинного обучения и робототехники. Его научными руководителями были профессор Кристофер Пистер из лаборатории автономных микросистем Беркли и Роберто Каландра из Meta AI Research. Во время обучения в аспирантуре ему посчастливилось пройти стажировку в Facebook AI и DeepMind. Натан был удостоен Мемориальной премии имени Деметри Ангелакоса за достижения в области альтруизма от факультета электротехники и информатики Калифорнийского университета в Беркли за свои усилия по улучшению общественных норм.