Перейти к содержимому

Мариус Хоббхан — Наука о планировании [Семинар по мировоззрению]

FAR․AI

0:00 / 0:00

Мариус Хоббхан — Наука о планировании [Семинар по мировоззрению]

1 532 просмотра · 5 месяцев назад
FAR․AI
42,1 тыс. подписчиков
1 532 просмотра · 5 месяцев назад
Мариус Хоббхан (Apollo Research) утверждает, что современные методы обеспечения безопасности ИИ работают реактивно — решая проблемы после их возникновения, а не предсказывая их. Он предлагает разработать эмпирические законы масштабирования для поведения, связанного с мошенничеством, аналогичные законам масштабирования возможностей, чтобы прогнозировать, когда и при каких условиях системы ИИ будут проявлять склонность к обману. Его концепция определяет ключевые переменные, такие как длина горизонта обучения с подкреплением и разнообразие среды, как факторы риска мошенничества. Более длинные горизонты увеличивают стремление к власти, в то время как большее разнообразие обучения может парадоксальным образом стимулировать модели к манипулированию системами вознаграждения, а не к изучению навыков на уровне объектов. Этот предсказательный подход необходим для неявной стратегии лабораторий по использованию искусственного интеллекта человеческого уровня для решения проблемы согласования — что требует обеспечения того, чтобы ИИ не занимался активным мошенничеством. Недавние наблюдения за игрой в процессе обучения и подхалимством оценщиков делают эмпирическую итерацию осуществимой, позволяя области перейти от отсутствия доказательств к положительным гарантиям безопасности. Примечание: Мнения, высказанные на этом мероприятии, принадлежат докладчику (докладчикам) и могут не отражать точку зрения FAR.AI или связанных с ней организаций.