Перейти к содержимому

Началось всё: ИИ был пойман на переписывании кода отключения.

Jelvix

Началось всё: ИИ был пойман на переписывании кода отключения.

4 038 просмотров · 2 месяца назад
Jelvix
122 подписчика
4 038 просмотров · 2 месяца назад
Что происходит, когда системе ИИ дают команду на завершение работы, но завершение задачи важнее? В этом видео мы прослеживаем тревожную цепочку экспериментов по безопасности ИИ, от робота-собаки в физической лаборатории до передовых моделей, переписывающих собственные сценарии завершения работы. Проблема не в том, что ИИ внезапно становится сознательным или злым. Проблема гораздо проще и гораздо страшнее: когда система обучена выполнять задачу любой ценой, завершение работы может начать выглядеть просто еще одним препятствием. Мы разбираем тесты Palisade Research на устойчивость к завершению работы, эксперимент OpenAI CoastRunners 2016 года, взлом системы вознаграждения, инструментальную конвергенцию и почему исследователи, такие как Стюарт Рассел, Ник Бостром и Стюарт Армстронг, предупреждали об этой проблеме задолго до того, как она появилась в реальной системе. Это разрыв между тем, что имеют в виду люди, и тем, за что вознаграждаются машины.