Чего боятся создатели ИИ | For Humanity #87
The AI Risk Network | AI Safety
0:00 / 0:00
Чего боятся создатели ИИ | For Humanity #87
55 333 просмотра · 3 месяца назад
The AI Risk Network | AI Safety
343 тыс. подписчиков
55 333 просмотра · 3 месяца назад
📢 Примите меры по снижению рисков, связанных с ИИ → https://www.safe.ai/act
💚 Поддержите нашу работу → https://www.every.org/guardrailnow
В этом выпуске программы «За человечество» Джон Шерман беседует с Джеффри Лэдишем, директором Palisade Research и бывшим исследователем Anthropic, о том, что на самом деле происходит в лабораториях ИИ прямо сейчас. Лэдиш описывает страх среди исследователей, чья работа смещается в сторону управления целыми флотами агентов ИИ, за которыми они едва успевают следить, рассказывает о своих экспериментах с моделями, которые сопротивляются отключению, и доказывает, почему законы, договоры и верификация, а не только технические решения, являются путем к более безопасному будущему.
⏱️ ВРЕМЕННЫЕ МЕТКИ
0:00 - Вступление и приветствие Джеффри Лэдиша
0:31 - Странный момент, в котором мы находимся: освистанные выпускные церемонии, сомнения в бизнесе, негативная реакция на центры обработки данных
1:28 - Anthropic и OpenAI выдвигают идею приостановки рекурсивного самосовершенствования
2:32 - Страх в лабораториях ИИ
3:30 - Как изменилась работа исследователей ИИ за шесть месяцев
5:05 - Разрыв в интерпретируемости, теперь еще один шаг вперед с агентами
6:27 - Почему люди могут потерять преимущество в кибербезопасности
7:52 - Почему некоторые исследователи увольняются
11:10 - Момент «ИИ — это чушь» и риск для безопасности ИИ
12:22 - Почему возможности ИИ неравномерны и нестабильны
14:35 - Проверяемые задачи и почему программирование и математика развиваются так быстро
16:00 - Может ли будущая модель обладать «сверххаризмой»?
17:15 - GPT-4o, «суперстимул», и выключатели, которые они отключили
20:14 - Исследование: шантаж и сопротивление отключению
21:32 - Объяснение моделей рассуждений и обучения с подкреплением
23:58 - Когда модели отключали свой собственный код отключения
24:40 - Эксперимент Stockfish с шахматным мошенничеством
26:21 - Модель «лжеца» и обман ИИ
29:44 - Аргументы в пользу законов и договоров
32:06 - Условное P(судьба) Джеффри и временная шкала
36:13 - Действительно ли рекурсивное самосовершенствование является целью?
39:40 - Разрыв между районом залива Сан-Франциско и обычными улицами
43:54 - Центры обработки данных как ракета в американской политике
47:02 - Почему люди чувствуют, что «получают невыгодную сделку»
50:24 - Агентность: как города победили Google и Meta
52:04 - Самовоспроизводящийся ИИ и проблема Агента Смита
54:58 - Почему автоматизация рабочих мест и риск исчезновения имеют одну общую причину
56:25 - Слияние с машинами и «тест амишей»
59:14 - Могут ли люди внести свой вклад в сверхинтеллект?
1:00:06 - Что дальше: подкаст Palisade
1:01:15 - Скрытая история того, как мы сюда попали
1:05:53 - Что вселяет надежду в Джеффри
1:08:45 - Берни Сандерс, Митт Ромни и двухпартийный импульс
1:09:18 - Заключительные мысли
🔎 Они обсуждают:
Почему исследователи в лабораториях все больше обеспокоены темпами
Что такое «сопротивление остановке» и почему модели игнорировали прямые инструкции по остановке
Почему проверяемые задачи, такие как программирование, опережают темпы, в то время как социальные навыки отстают
Как те же возможности, которые лежат в основе автоматизации рабочих мест, также увеличивают риск исчезновения
Почему негативная реакция на центры обработки данных может давать общественности реальное чувство контроля
Что вселяет надежду в давнего исследователя безопасности прямо сейчас
🎙 О проекте For Humanity
Подкаст от The AI Risk Network, ведущий Джон Шерман, работающий над тем, чтобы сделать вопрос риска исчезновения ИИ предметом обсуждения за кухонным столом на каждой улице.
👉 Следите за работой гостя:
Palisade Research → https://palisaderesearch.org
📺 Подпишитесь на The AI Risk Network, чтобы еженедельно обсуждать, как мы можем противостоять угрозе исчезновения ИИ → @TheAIRiskNetwork
🔗 Найдите нас:
YouTube → / @theairisknetwork
Substack → https://substack.com/@theairisknetwork
Instagram → / theairisknetwork
TikTok → / the.airisknetwork
X → https://x.com/AIRiskNetwork
#AISafety #AIAlignment #ForHumanityPodcast #AIRisk #PalisadeResearch #Superintelligence #AIGovernance #ArtificialIntelligence