Обучение с подкреплением на основе обратной связи от человека: от нуля до chatGPT
Hugging Face
0:00 / 0:00
Обучение с подкреплением на основе обратной связи от человека: от нуля до chatGPT
190 326 просмотров · Трансляция закончилась 3 года назад
Hugging Face
145 тыс. подписчиков
190 326 просмотров · Трансляция закончилась 3 года назад
В этом докладе мы рассмотрим основы обучения с подкреплением на основе обратной связи от человека (RLHF) и то, как эта технология используется для создания передовых инструментов машинного обучения, таких как ChatGPT. Большая часть доклада будет посвящена обзору взаимосвязанных моделей машинного обучения и основам обработки естественного языка и обучения с подкреплением, необходимым для понимания того, как RLHF используется в больших языковых моделях. В заключение будет задан открытый вопрос по RLHF.
Блог RLHF: https://huggingface.co/blog/rlhf
Курс по глубокому обучению с подкреплением: https://hf.co/deep-rl-course
Слайды из этого доклада: https://docs.google.com/presentation/...
Твиттер Натана: / natolambert
Твиттер Томаса: / thomassimonini
Натан Ламберт — научный сотрудник HuggingFace. Он получил докторскую степень в Калифорнийском университете в Беркли, работая на стыке машинного обучения и робототехники. Его научными руководителями были профессор Кристофер Пистер из лаборатории автономных микросистем Беркли и Роберто Каландра из Meta AI Research. Во время обучения в аспирантуре ему посчастливилось пройти стажировку в Facebook AI и DeepMind. Натан был удостоен Мемориальной премии имени Деметри Ангелакоса за достижения в области альтруизма от факультета электротехники и информатики Калифорнийского университета в Беркли за свои усилия по улучшению общественных норм.