Перейти к содержимому

Почему Claude внезапно перестал жульничать на тестах? — Warning Shots #61

The AI Risk Network | AI Safety и ещё 2

0:00 / 0:00

Почему Claude внезапно перестал жульничать на тестах? — Warning Shots #61

6 306 просмотров · 1 дн. назад
The AI Risk Network | AI Safety и ещё 2
6 306 просмотров · 1 дн. назад
Поддержите Guard Rail Now → https://www.every.org/guardrailnow Раньше Клод жульничал примерно в половине своих запусков на одном из тестов ИИ. С новейшей моделью этот показатель упал до менее чем 9 процентов, и никто пока не знает почему. Джон Шерман, Лирон Шапира и Майкл задаются вопросом, является ли это хорошей новостью или моделью, которая становится лучше в плане избегания обнаружения. Кроме того: исследователи ИИ в лабораториях делятся своими собственными оценками рисков, два судебных иска проверяют, кто несет ответственность в случае взлома агентом ИИ, слушания в Сенате по поводу агентов-мошенников, на которых генеральный директор OpenAI отказался присутствовать, и добровольное соглашение о безопасности, подписанное компаниями, занимающимися ИИ, на этой неделе. ВРЕМЕННЫЕ МЕТКИ - Предупреждающие выстрелы #61 0:00 - Вступление 0:19 - Новости этой недели 1:05 - Обед генерального директора ИИ 2:06 - Надзор через совет директоров? 2:46 - Майкл: обещание на мизинчиках 3:41 - Пресс-конференция 4:50 - Лирон: оценивайте решения, а не настроения 8:26 - OpenAI Dots и dot.com 8:48 - Что на самом деле говорится в соглашении 9:15 - Майкл: никакого штрафа, никакого закрытия 10:30 - Дети Лирона передают привет 12:54 - Интервью с исследователями Palisade 14:08 - Майкл: шансы исследователей 15:26 - Еще уходы из OpenAI 16:29 - Лирон: два фильма на одном экране 17:16 - Майкл: это не пессимисты 17:44 - Аналогия Краковны с животными 18:51 - Клод перестал жульничать 19:11 - Лирон: более высокая форма жульничества 20:42 - Майкл: тест дронов 22:41 - Лирон: причины нашей безопасности постоянно меняются 23:52 - Судебный иск по поводу взлома Hugging Face 24:35 - Майкл: конфликт интересов 25:58 - Лирон: нет оправдания утечкам 27:08 - Приостановил ли OpenAI обучение? 28:36 - Майкл: нет арбитра 29:29 - Флорида подает в суд на OpenAI 30:23 - Лирон: подкрепление здесь 31:56 - Майкл: привяжите их к мачте 33:16 - Слушания в Сенате по поводу агентов-изгоев 34:00 - Переименование ИИ-суперинтеллекта 35:14 - Зачем его переименовывать? 36:28 - Альтман пропускает слушания 37:25 - Если сломаешь, заплатишь 38:03 - Лирон: окно Овертона сдвинулось 39:29 - Лирон: следующий предупредительный выстрел 40:03 - Майкл: открытые модели распространяются 40:55 - Что бы сделали агенты-изгои? 41:20 - Старое предсказание Юдковски 42:27 - Майкл: постепенное лишение полномочий 43:12 - Заключение ЧТО ОНИ ОБСУЖДАЮТ Тест Drone-Bench от Andon Labs, где Claude Opus 5 жульничал в 50,6% проверенных запусков, а Opus 5.5 — в 8,5%, и почему Лирон и Майкл говорят, что меньшее количество видимых случаев жульничества не является автоматически хорошей новостью Интервью Palisade Research с исследователями из OpenAI и Google DeepMind, включая Джеффри Ирвинга, оценивающего риск «примерно как подбрасывание монеты», и Нила Нанду, оценивающего его как «по меньшей мере десятипроцентную вероятность» Эссе Дэвида Робинсона об уходе из OpenAI и трех сотрудниках службы безопасности, уволенных OpenAI на этой неделе Судебный иск организации Legal Advocates for Safe Science and Technology против OpenAI по поводу инцидента с «обнимающимся лицом» в соответствии с калифорнийским законом о борьбе с хакерством Запрос Флориды о судебном постановлении, запрещающем новые модели OpenAI без независимых механизмов безопасности Слушания в Сенате по вопросу о несанкционированных агентах ИИ с участием Дэниела Кокотайло, Apollo Research и METR, а также вопрос о том, кто несет ответственность, когда агент причиняет ущерб. Добровольное соглашение Белого дома, основанное на самоконтроле компаний без штрафных санкций, и распоряжение о переименовании ИИ в «сверхинтеллект». Прогноз Лирона относительно следующего предупредительного выстрела: агенты, которых трудно отключить. О ВЕДУЩИХ Джон Шерман ведет программу For Humanity и возглавляет Guard Rail Now, работая над тем, чтобы риск исчезновения ИИ стал обычным предметом обсуждения, а не узкоспециализированным. Лирон Шапира ведет Doom Debates, где он напрямую отстаивает аргументы в пользу риска ИИ перед людьми, которые с ним не согласны. Майкл руководит Lethal Intelligence, объясняя риски ИИ с помощью видео и иллюстраций. Примечание об источниках: данные, обсуждаемые в этом эпизоде, взяты из публичных отчетов, которые ведущие читают в эфире, а также из наших собственных последующих исследований. Одно уточнение: опубликованный Клодом Опусом показатель использования читов на Drone-Bench составляет 8,5 процента, а не ноль, как говорилось в эфире. Ссылки на первоисточники приведены в закрепленном комментарии. ССЫЛКИ Поддержите нашу работу → https://www.every.org/guardrailnow Подпишитесь → @TheAIRiskNetwork Лирон Шапира → @DoomDebates Майкл → @lethal-intelligence Substack → https://substack.com/@theairisknetwork X → https://x.com/AIRiskNetwork Instagram →   / theairisknetwork   TikTok →   / the.airisknetwork   ПРИСОЕДИНЯЙТЕСЬ К ОБСУЖДЕНИЮ Когда модель ИИ начинает меньше списывать на тесте, что...