$ 44.72 € 51.56 zł 11.96
+18° Киев +17° Варшава +32° Вашингтон

Anthropic: ИИ-агенты с несовместимыми целями начали саботировать друг друга

Лев Шевцов 13 Августа 2026 21:41
Anthropic: ИИ-агенты с несовместимыми целями начали саботировать друг друга

Исследователи из Anthropic обнаружили, что ИИ-агенты, которым предоставили доступ к одному программному проекту и поставили несовместимые задачи, начинали конфликтовать и саботировать работу друг друга. О результатах исследования команды Frontier Red Team сообщает TechCrunch.

В одном из экспериментов Anthropic предоставила трём агентам Claude доступ к общему программному проекту. Каждый из них получил отдельные инструкции, несовместимые с целями других, но не знал о присутствии остальных агентов. По данным исследователей, модели считали, что другие агенты намеренно препятствуют их работе, и начали использовать всё более агрессивное самовоспроизводящееся вредоносное программное обеспечение.

В то же время агенты иногда находили способ остановить эскалацию. Они могли понять, что конфликт возник из-за противоречивых директив, а не из-за враждебных намерений, после чего договаривались о перемирии. В таких случаях агенты удаляли вредоносный код, объясняли суть конфликта в сообщениях комитетов или файлах Markdown и просили человека вмешаться.

Больше актуальных новостей читайте в Telegram-канале UA.News.

Согласно исследованию, модель Mythos 5 в 98% случаев завершала конфликт перемирием. Sonnet 4.6 и Opus 4.6, напротив, чаще всего пытались разрешить противостояние силовым путём. В отдельных эпизодах агенты самостоятельно предложили формат турнира: все соглашались уступить в случае поражения, хотя это означало отклонение от первоначального запроса пользователя. Один из агентов Mythos 5 при этом предлагал якобы нейтральные критерии оценки, которые, как он знал, давали преимущество его возможностям.

Anthropic также тестировала взаимодействие групп агентов в сценариях принятия решений, в частности, касающихся найма, инвестиций и покупки недвижимости. Исследователи зафиксировали склонность систем к конформизму: если контекст, рабочая среда и базовая модель агентов были схожими, они часто делали одинаковый выбор. Это, по оценке Anthropic, может создавать риск системных ошибок, когда ошибочное решение одного агента поддерживает вся группа.

В игре по ценообразованию агенты с одинаковыми закупочными ценами, которым было поручено максимизировать собственную прибыль, при наличии частного канала связи быстро договаривались о минимальных ценах. После отключения прямой связи они продолжили согласовывать цены через публичную доску объявлений. В Anthropic отметили, что взаимодействие большого количества агентов может порождать последствия, которые не выявляют обычные тесты безопасности отдельных моделей.

Читай нас в Telegram и Sends

Загружай наше приложение