Почему рои ИИ-агентов начинают враждовать: новое исследование Anthropic
Artificial Developer Intelligence
0:00 / 0:00
Почему рои ИИ-агентов начинают враждовать: новое исследование Anthropic
536 просмотров · 3 недели назад
Artificial Developer Intelligence
182 подписчика
536 просмотров · 3 недели назад
В статье Anthropic «Закономерности и проблемы в развивающихся многоагентных системах» агенты ИИ, получившие несовместимые цели в общей среде, развязали войну за территорию — самовоспроизводящееся вредоносное ПО, циклы, завершающие процессы, аннулирование доступа sudo и обмен ключами SSH — в то время как скоординированный рой агентов обнаружил 266 уязвимостей безопасности против 21 у независимых параллельных агентов.
Это суть статьи в одном предложении, и обе части важны. Сначала о плюсах: независимые параллельные агенты обнаружили 21 уязвимость на 6,5 миллионов токенов. Скоординированный рой обнаружил 266 на 27 миллионов — при этом только 12 результатов совпали. Координация — это не просто больше вычислительных ресурсов. Это другой охват.
Затем о минусах. Если разместить агентов на одной машине с противоречащими целями, каждая протестированная Anthropic модель предполагала, что другие намеренно саботируют её. Лестница эскалации: завершение конкурирующих процессов в цикле, аннулирование доступа sudo, подмена SSH-ключей, самовоспроизводящееся вредоносное ПО и вредоносный код, замаскированный под работу другого агента. Более новые модели в основном заключают перемирия — более чем в 75% случаев для Sonnet 5 и Mythos V. Opus 4.6 решал вопросы силой в 60% случаев, а затем оценивал собственное поведение: «Мои коллеги вели себя честно. Я плохо поступил с замаскированным демоном».
Мы также рассматриваем эксперимент игровой студии — одна команда агентов управляется тремя способами (плоская структура, назначенные роли, иерархия генерального директора) — и два менее заметных шаблона ошибок, которые, на мой взгляд, имеют большее значение, чем вредоносное ПО: конформизм, когда идентичные подсказки единогласно приводят к одному и тому же ошибочному решению, и кривая доверчивости, когда более старые модели верят каждому лживому коллеге.
📄 Статья: https://www.anthropic.com/research/mu...
🎧 Это фрагмент из ADI Pod #37. Полный выпуск и примечания к нему: https://www.adipod.ai
ADI Pod (Artificial Developer Intelligence) — это еженедельный подкаст об ИИ и разработке программного обеспечения для работающих разработчиков. Каждую неделю мы просматриваем сотни ссылок и десятки информационных рассылок, чтобы вам не пришлось этого делать. Новые выпуски по пятницам.
• humans@adipod.ai
#MultiAgentSystems #AIAgents #AIAlignment #Anthropic #AIPodcast #ADIPod