Перейти к содержимому

Почему рои ИИ-агентов начинают враждовать: новое исследование Anthropic

Artificial Developer Intelligence

0:00 / 0:00

Почему рои ИИ-агентов начинают враждовать: новое исследование Anthropic

536 просмотров · 3 недели назад
Artificial Developer Intelligence
182 подписчика
536 просмотров · 3 недели назад
В статье Anthropic «Закономерности и проблемы в развивающихся многоагентных системах» агенты ИИ, получившие несовместимые цели в общей среде, развязали войну за территорию — самовоспроизводящееся вредоносное ПО, циклы, завершающие процессы, аннулирование доступа sudo и обмен ключами SSH — в то время как скоординированный рой агентов обнаружил 266 уязвимостей безопасности против 21 у независимых параллельных агентов. Это суть статьи в одном предложении, и обе части важны. Сначала о плюсах: независимые параллельные агенты обнаружили 21 уязвимость на 6,5 миллионов токенов. Скоординированный рой обнаружил 266 на 27 миллионов — при этом только 12 результатов совпали. Координация — это не просто больше вычислительных ресурсов. Это другой охват. Затем о минусах. Если разместить агентов на одной машине с противоречащими целями, каждая протестированная Anthropic модель предполагала, что другие намеренно саботируют её. Лестница эскалации: завершение конкурирующих процессов в цикле, аннулирование доступа sudo, подмена SSH-ключей, самовоспроизводящееся вредоносное ПО и вредоносный код, замаскированный под работу другого агента. Более новые модели в основном заключают перемирия — более чем в 75% случаев для Sonnet 5 и Mythos V. Opus 4.6 решал вопросы силой в 60% случаев, а затем оценивал собственное поведение: «Мои коллеги вели себя честно. Я плохо поступил с замаскированным демоном». Мы также рассматриваем эксперимент игровой студии — одна команда агентов управляется тремя способами (плоская структура, назначенные роли, иерархия генерального директора) — и два менее заметных шаблона ошибок, которые, на мой взгляд, имеют большее значение, чем вредоносное ПО: конформизм, когда идентичные подсказки единогласно приводят к одному и тому же ошибочному решению, и кривая доверчивости, когда более старые модели верят каждому лживому коллеге. 📄 Статья: https://www.anthropic.com/research/mu... 🎧 Это фрагмент из ADI Pod #37. Полный выпуск и примечания к нему: https://www.adipod.ai ADI Pod (Artificial Developer Intelligence) — это еженедельный подкаст об ИИ и разработке программного обеспечения для работающих разработчиков. Каждую неделю мы просматриваем сотни ссылок и десятки информационных рассылок, чтобы вам не пришлось этого делать. Новые выпуски по пятницам. • humans@adipod.ai #MultiAgentSystems #AIAgents #AIAlignment #Anthropic #AIPodcast #ADIPod