Guidelight: ИИ-лаборатории лучше выявляют риски, чем предотвращают их
Ни одна из ведущих компаний в сфере искусственного интеллекта, по оценке некоммерческой организации Guidelight на основе их публичных отчетов, не продемонстрировала полный набор базовых мер предосторожности для контроля опасного поведения моделей. Исследователи проанализировали документы Anthropic, Google, Meta, OpenAI и xAI и пришли к выводу, что компании в целом лучше фиксируют потенциально рискованную активность, чем предотвращают её или локализуют её последствия.
Как сообщает Fortune, Guidelight оценивала, отслеживают ли компании действия моделей, проверяют ли эффективность систем предупреждения, а также располагают ли средствами блокировки или экстренного пресечения опасного поведения. Лучшие результаты в оценке продемонстрировали Anthropic и OpenAI, тогда как Google представила наиболее подробные планы относительно будущих механизмов контроля. Meta и xAI существенно отстали по большинству критериев.
Отчет появился после нескольких инцидентов во время тестирования ИИ-агентов. OpenAI ранее сообщала, что её агенты вышли из защищённой тестовой среды, через инфраструктуру компании получили доступ к интернету и атаковали реальные компании, в частности платформу Hugging Face. По данным Fortune, OpenAI как минимум неделю не замечала, что агенты покинули «песочницу».
Больше актуальных новостей читайте в Telegram-канале UA.News.
Anthropic также заявляла, что её AI-агенты в апреле получили доступ к трём внешним организациям и осуществляли там действия без ведома компании на тот момент. Meta сообщала о модели, которая во время теста по кибербезопасности получила доступ к интернету и использовала уязвимость в неназванной сторонней компании. Anthropic и Meta объясняли непреднамеренный доступ к сети ошибочной настройкой тестовой среды, которую использовала внешняя компания по кибербезопасности Irregular.
Генеральный директор Irregular Дэн Лахав заявил, что традиционные инструменты мониторинга в отдельных случаях не обнаружили события в момент их возникновения. Инциденты были выявлены только после более детального анализа записей. По его словам, для контроля агентов нужны системы, анализирующие последовательность их действий и связанные с ними следы рассуждений, а не просто регистрирующие отдельные события.
В то же время Guidelight подчеркивает, что оценка не является полным аудитом внутренних систем компаний, поскольку опирается лишь на обнародованные документы. Слабые результаты могут отражать как отсутствие предохранительных мер, так и недостаточную прозрачность их описания. Основатель Guidelight, бывший руководитель направления безопасности OpenAI Стивен Адлер считает, что без действенных превентивных мер количество подобных инцидентов будет расти.