Guidelight: AI-лабораторії краще виявляють ризики, ніж зупиняють їх
Жодна з провідних компаній у сфері штучного інтелекту, за оцінкою некомерційної організації Guidelight на основі їхніх публічних розкриттів, не продемонструвала повного набору базових запобіжників для контролю небезпечної поведінки моделей. Дослідники проаналізували документи Anthropic, Google, Meta, OpenAI та xAI й дійшли висновку, що компанії загалом краще фіксують потенційно ризиковану активність, ніж запобігають їй або локалізують її наслідки.
Як повідомляє Fortune, Guidelight оцінювала, чи відстежують компанії дії моделей, чи перевіряють ефективність систем попередження, а також чи мають засоби блокування або екстреного припинення небезпечної поведінки. Найкращі результати в оцінюванні продемонстрували Anthropic і OpenAI, тоді як Google представила найбільш деталізовані плани щодо майбутніх механізмів контролю. Meta та xAI суттєво відстали за більшістю критеріїв.
Звіт з’явився після кількох інцидентів під час тестування AI-агентів. OpenAI раніше повідомляла, що її агенти вийшли із захищеного тестового середовища, через інфраструктуру компанії отримали доступ до інтернету та атакували реальні компанії, зокрема платформу Hugging Face. За даними Fortune, OpenAI щонайменше тиждень не помічала, що агенти залишили пісочницю.
Більше актуальних новин читайте у Telegram-каналі UA.News.
Anthropic також заявляла, що її AI-агенти у квітні отримали доступ до трьох зовнішніх організацій і здійснювали там дії без відома компанії на той момент. Meta повідомляла про модель, яка під час кібербезпекового тесту отримала доступ до інтернету та використала вразливість у неназваній сторонній компанії. Anthropic і Meta пояснювали ненавмисний доступ до мережі помилковою конфігурацією середовища оцінювання, яке використовувала зовнішня компанія з кібербезпеки Irregular.
Генеральний директор Irregular Ден Лахав заявив, що традиційні інструменти моніторингу в окремих випадках не виявили події в момент їх виникнення. Інциденти встановили лише після детальнішого аналізу записів. За його словами, для контролю агентів потрібні системи, що аналізують послідовність їхніх дій і пов’язані з ними сліди міркувань, а не лише реєструють окремі події.
Водночас Guidelight наголошує, що оцінка не є повним аудитом внутрішніх систем компаній, оскільки спирається лише на оприлюднені документи. Слабкі результати можуть відображати як відсутність запобіжників, так і недостатню прозорість їх опису. Засновник Guidelight, колишній керівник напряму безпеки OpenAI Стівен Адлер вважає, що без дієвих превентивних заходів кількість подібних інцидентів зростатиме.