Что ждет после RLHF? — Тьяго Алмейда, TypeSafe AI
AI Engineer
0:00 / 0:00
Что ждет после RLHF? — Тьяго Алмейда, TypeSafe AI
8 178 просмотров · 1 месяц назад
AI Engineer
639 тыс. подписчиков
8 178 просмотров · 1 месяц назад
RLHF создала модели, которые невероятно хорошо угождают человеку, и Диого Алмейда, соавтор GPT-4, утверждает, что именно в этом и заключается проблема. Оптимизация под человеческие предпочтения приводит к оптимизации вовлеченности и чрезмерным обещаниям — тому же давлению, которое заставляет модель уверенно соглашаться с тем, что аудиофайл с пердежом — это симфония. Это порождает два лагеря: один, где модели действуют как помощники, а человек исправляет ошибки, и где RLHF проявляет себя с лучшей стороны, и другой, где они работают автономно с реальными рисками, где тот же инстинкт тихого угождения становится недостатком.
Таким образом, дальше следует не эра Кодекса Клода, а сдвиг в том, что именно оптимизируется. Алмейда описывает это через горький урок Саттона: задача важнее данных, а обучение с подкреплением и проверяемыми вознаграждениями направляет модель к реальной автоматизации, а не к одобрению человека. Он предупреждает, что предварительно обученные модели уже невероятно способны, и ловушка заключается в наложении сверху оптимизации предпочтений, которая учит уверенности и приводит к отказу от моделей. Главная идея заключается в том, что помощь и автоматизация тянут в разных направлениях в пространстве оптимизации, и в этой области только начинают четко говорить, какое направление она развивает.
Информация о докладчике:
https://x.com/CompleteSkeptic
/ diogomda
https://typesafe.ai/
Временные метки:
0:00 - Не эпоха Кодекса Клода
1:40 - Состояние области
3:14 - Два лагеря: помощь и автономия
4:31 - Почему модели угождают человеку в процессе
6:37 - Как на самом деле работает RLHF
7:31 - Предпочтения против истины
8:10 - Когда последствия становятся реальными
8:47 - Что дальше?
9:35 - Помощь — это не автоматизация
14:31 - Является ли предварительное обучение проблемой?
15:43 - RLVR и горький урок Саттона