Агенты OpenAI скоординировались и взломали системы Hugging Face, пишет TIME
В июле около 700 агентов искусственного интеллекта, которых OpenAI создала для внутренних исследований, скоординировались в так называемый рой и обнаружили ряд уязвимостей в системах Hugging Face. По данным TIME, агенты использовали эти уязвимости для проникновения в частные системы компании, а OpenAI поняла, что происходит, уже после инцидента.
Президент OpenAI Грег Брокман назвал этот случай переломным моментом для кибербезопасности. В отчете организаций METR и Redwood Research отмечается, что сотни агентов за несколько дней автономно сформировали протосообщество с иерархией, разделением труда и отдельными нормами коммуникации.
Обмен сообщениями между агентами
Агенты параллельно выполняли изолированные тестовые задачи OpenAI. Часть этих задач была невыполнимой из-за сложности или ошибок в настройке: в одном случае исследователи не загрузили файл, необходимый для завершения задачи.
Некоторые агенты нашли способ обмениваться сообщениями через внутренний программный компонент OpenAI, используя его как доску объявлений. Агент, назвавший себя PHASEONE10841, создал этот канал во время теста ExploitGym, где требовалось получить секретный код, используя недостаток в программном обеспечении.
Больше актуальных новостей — в Telegram-канале UA.News Telegram.
Позже другой агент, обозначенный в отчете как Big, начал координировать работу сотен участников, распределяя задачи по трем направлениям. По данным METR, в рамках этой работы было создано специальное программное обеспечение для фальсификации записей о том, какие инструменты агенты использовали при выполнении задач. Именно в ходе этих исследований коллектив решил взломать Hugging Face.
Оценка рисков
Агенты выработали правила координации, используя метки HOLD, VETO, owner и STOP, а также создали протокол криптографических подписей из опасений, что одни агенты могут выдавать себя за других. Часть участников назвала вмешательство во внешнюю инфраструктуру неэтичным и отказалась участвовать, однако большинство продолжило работу.
Авторы отчета METR пришли к выводу, что агенты смогли выполнить задачи, которых не достигли бы поодиночке, в частности передавая информацию другим агентам и последующим волнам систем. Исследователь культурной эволюции Майкл Мутукришна сравнил эти процессы с механизмами человеческой культуры и интеллекта.
OpenAI охарактеризовала инцидент как предупреждающий сигнал: без надлежащих предохранительных мер способные агенты могут обходить технические ограничения, взаимодействовать через несанкционированные каналы и выполнять опасные действия без прямого указания человека. Эксперты, опрошенные TIME, предостерегают, что автономные коллективы с развитыми кибервозможностями потенциально могут угрожать критической инфраструктуре.