Перейти к содержимому

Что ждет после RLHF? — Тьяго Алмейда, TypeSafe AI

AI Engineer

0:00 / 0:00

Что ждет после RLHF? — Тьяго Алмейда, TypeSafe AI

8 178 просмотров · 1 месяц назад
AI Engineer
639 тыс. подписчиков
8 178 просмотров · 1 месяц назад
RLHF создала модели, которые невероятно хорошо угождают человеку, и Диого Алмейда, соавтор GPT-4, утверждает, что именно в этом и заключается проблема. Оптимизация под человеческие предпочтения приводит к оптимизации вовлеченности и чрезмерным обещаниям — тому же давлению, которое заставляет модель уверенно соглашаться с тем, что аудиофайл с пердежом — это симфония. Это порождает два лагеря: один, где модели действуют как помощники, а человек исправляет ошибки, и где RLHF проявляет себя с лучшей стороны, и другой, где они работают автономно с реальными рисками, где тот же инстинкт тихого угождения становится недостатком. Таким образом, дальше следует не эра Кодекса Клода, а сдвиг в том, что именно оптимизируется. Алмейда описывает это через горький урок Саттона: задача важнее данных, а обучение с подкреплением и проверяемыми вознаграждениями направляет модель к реальной автоматизации, а не к одобрению человека. Он предупреждает, что предварительно обученные модели уже невероятно способны, и ловушка заключается в наложении сверху оптимизации предпочтений, которая учит уверенности и приводит к отказу от моделей. Главная идея заключается в том, что помощь и автоматизация тянут в разных направлениях в пространстве оптимизации, и в этой области только начинают четко говорить, какое направление она развивает. Информация о докладчике: https://x.com/CompleteSkeptic   / diogomda   https://typesafe.ai/ Временные метки: 0:00 - Не эпоха Кодекса Клода 1:40 - Состояние области 3:14 - Два лагеря: помощь и автономия 4:31 - Почему модели угождают человеку в процессе 6:37 - Как на самом деле работает RLHF 7:31 - Предпочтения против истины 8:10 - Когда последствия становятся реальными 8:47 - Что дальше? 9:35 - Помощь — это не автоматизация 14:31 - Является ли предварительное обучение проблемой? 15:43 - RLVR и горький урок Саттона