Почему Claude внезапно перестал жульничать на тестах? — Warning Shots #61
The AI Risk Network | AI Safety и ещё 2
0:00 / 0:00
Почему Claude внезапно перестал жульничать на тестах? — Warning Shots #61
6 306 просмотров · 1 дн. назад
The AI Risk Network | AI Safety и ещё 2
6 306 просмотров · 1 дн. назад
Поддержите Guard Rail Now → https://www.every.org/guardrailnow
Раньше Клод жульничал примерно в половине своих запусков на одном из тестов ИИ. С новейшей моделью этот показатель упал до менее чем 9 процентов, и никто пока не знает почему. Джон Шерман, Лирон Шапира и Майкл задаются вопросом, является ли это хорошей новостью или моделью, которая становится лучше в плане избегания обнаружения. Кроме того: исследователи ИИ в лабораториях делятся своими собственными оценками рисков, два судебных иска проверяют, кто несет ответственность в случае взлома агентом ИИ, слушания в Сенате по поводу агентов-мошенников, на которых генеральный директор OpenAI отказался присутствовать, и добровольное соглашение о безопасности, подписанное компаниями, занимающимися ИИ, на этой неделе.
ВРЕМЕННЫЕ МЕТКИ - Предупреждающие выстрелы #61
0:00 - Вступление
0:19 - Новости этой недели
1:05 - Обед генерального директора ИИ
2:06 - Надзор через совет директоров?
2:46 - Майкл: обещание на мизинчиках
3:41 - Пресс-конференция
4:50 - Лирон: оценивайте решения, а не настроения
8:26 - OpenAI Dots и dot.com
8:48 - Что на самом деле говорится в соглашении
9:15 - Майкл: никакого штрафа, никакого закрытия
10:30 - Дети Лирона передают привет
12:54 - Интервью с исследователями Palisade
14:08 - Майкл: шансы исследователей
15:26 - Еще уходы из OpenAI
16:29 - Лирон: два фильма на одном экране
17:16 - Майкл: это не пессимисты
17:44 - Аналогия Краковны с животными
18:51 - Клод перестал жульничать
19:11 - Лирон: более высокая форма жульничества
20:42 - Майкл: тест дронов
22:41 - Лирон: причины нашей безопасности постоянно меняются
23:52 - Судебный иск по поводу взлома Hugging Face
24:35 - Майкл: конфликт интересов
25:58 - Лирон: нет оправдания утечкам
27:08 - Приостановил ли OpenAI обучение?
28:36 - Майкл: нет арбитра
29:29 - Флорида подает в суд на OpenAI
30:23 - Лирон: подкрепление здесь
31:56 - Майкл: привяжите их к мачте
33:16 - Слушания в Сенате по поводу агентов-изгоев
34:00 - Переименование ИИ-суперинтеллекта
35:14 - Зачем его переименовывать?
36:28 - Альтман пропускает слушания
37:25 - Если сломаешь, заплатишь
38:03 - Лирон: окно Овертона сдвинулось
39:29 - Лирон: следующий предупредительный выстрел
40:03 - Майкл: открытые модели распространяются
40:55 - Что бы сделали агенты-изгои?
41:20 - Старое предсказание Юдковски
42:27 - Майкл: постепенное лишение полномочий
43:12 - Заключение
ЧТО ОНИ ОБСУЖДАЮТ
Тест Drone-Bench от Andon Labs, где Claude Opus 5 жульничал в 50,6% проверенных запусков, а Opus 5.5 — в 8,5%, и почему Лирон и Майкл говорят, что меньшее количество видимых случаев жульничества не является автоматически хорошей новостью
Интервью Palisade Research с исследователями из OpenAI и Google DeepMind, включая Джеффри Ирвинга, оценивающего риск «примерно как подбрасывание монеты», и Нила Нанду, оценивающего его как «по меньшей мере десятипроцентную вероятность»
Эссе Дэвида Робинсона об уходе из OpenAI и трех сотрудниках службы безопасности, уволенных OpenAI на этой неделе
Судебный иск организации Legal Advocates for Safe Science and Technology против OpenAI по поводу инцидента с «обнимающимся лицом» в соответствии с калифорнийским законом о борьбе с хакерством
Запрос Флориды о судебном постановлении, запрещающем новые модели OpenAI без независимых механизмов безопасности
Слушания в Сенате по вопросу о несанкционированных агентах ИИ с участием Дэниела Кокотайло, Apollo Research и METR, а также вопрос о том, кто несет ответственность, когда агент причиняет ущерб.
Добровольное соглашение Белого дома, основанное на самоконтроле компаний без штрафных санкций, и распоряжение о переименовании ИИ в «сверхинтеллект».
Прогноз Лирона относительно следующего предупредительного выстрела: агенты, которых трудно отключить.
О ВЕДУЩИХ
Джон Шерман ведет программу For Humanity и возглавляет Guard Rail Now, работая над тем, чтобы риск исчезновения ИИ стал обычным предметом обсуждения, а не узкоспециализированным.
Лирон Шапира ведет Doom Debates, где он напрямую отстаивает аргументы в пользу риска ИИ перед людьми, которые с ним не согласны.
Майкл руководит Lethal Intelligence, объясняя риски ИИ с помощью видео и иллюстраций.
Примечание об источниках: данные, обсуждаемые в этом эпизоде, взяты из публичных отчетов, которые ведущие читают в эфире, а также из наших собственных последующих исследований. Одно уточнение: опубликованный Клодом Опусом показатель использования читов на Drone-Bench составляет 8,5 процента, а не ноль, как говорилось в эфире. Ссылки на первоисточники приведены в закрепленном комментарии.
ССЫЛКИ
Поддержите нашу работу → https://www.every.org/guardrailnow
Подпишитесь → @TheAIRiskNetwork
Лирон Шапира → @DoomDebates
Майкл → @lethal-intelligence
Substack → https://substack.com/@theairisknetwork
X → https://x.com/AIRiskNetwork
Instagram → / theairisknetwork
TikTok → / the.airisknetwork
ПРИСОЕДИНЯЙТЕСЬ К ОБСУЖДЕНИЮ
Когда модель ИИ начинает меньше списывать на тесте, что...