Дослідження виявило нестачу публічних планів стримування ШІ
Провідні розробники систем штучного інтелекту мають небагато публічно задокументованих планів дій на випадок, якщо модель намагатиметься обійти людський контроль. Про це повідомляє TechCrunch з посиланням на оцінювання організації Guidelight AI Standards.
Guidelight проаналізувала відкриті матеріали Anthropic, Google, OpenAI, Meta та xAI за шістьма пріоритетними практиками свого стандарту Control. Серед іншого організація оцінювала внутрішнє журналювання й моніторинг дій ШІ, зупинення систем після серії сигналів про неналежну поведінку, незалежний аудит засобів контролю та наявність конкретного плану стримування моделі.
Оцінка публічної готовності
План стримування передбачає заздалегідь визначені дії після виявлення спроби ШІ обійти контроль. Він має визначати, які дозволи необхідно відкликати в моделі, для кого вона може продовжувати працювати та за яких обмежень, а також коли її слід повністю вимкнути.
Найвищий результат отримала OpenAI — три бали з п’яти. За даними Guidelight, компанія вже неодноразово призупиняла або припиняла робочі процеси, зокрема внутрішнє розгортання й навчання моделей, після інцидентів із безпекою. Компанія також описувала кроки, необхідні для відновлення цих процесів.
Водночас у звіті Guidelight зазначено, що немає публічних доказів існування в OpenAI формалізованого плану реагування на майбутні інциденти, пов’язані з неузгодженістю моделей із людським контролем.
Більше актуальних новин читайте у Telegram-каналі UA.News.
Найнижчі оцінки саме за оприлюднення планів стримування отримали Meta та Anthropic. Guidelight не знайшла підтверджень, що Meta має план реагування на втрату контролю над моделлю або планує його запровадити. У серпневому звіті Anthropic про ризики, за оцінкою організації, не йдеться про обмеження розгортання моделі як можливий результат розслідування інцидентів із неузгодженістю чи контролем.
Позиції компаній і вимоги регуляторів
Представник OpenAI заявив, що оцінювання не охоплює всіх внутрішніх практик компанії. За його словами, OpenAI має процеси для обмеження дозволів, призупинення робочих навантажень, звуження розгортання або повного вимкнення моделі та вже застосовувала їх. Google також заявила, що звіт не відображає всього комплексу її заходів із безпеки. Meta відмовилася повідомити, чи має внутрішній план стримування, пославшись на наявну рамку оцінювання ризиків.
Головний науковець Guidelight і колишній дослідник безпеки OpenAI Стівен Адлер сказав, що його здивувало, як мало компанії розповідають про реагування на серйозний інцидент втрати контролю. На його думку, без заздалегідь підготовленого плану розробникам доведеться визначати дії вже під час надзвичайної ситуації.
Каліфорнійський закон SB 53, який набув чинності цього року, зобов’язує великих розробників передових моделей публікувати рамки виявлення та реагування на критичні інциденти безпеки. У Нью-Йорку в січні має набути чинності RAISE Act зі схожими вимогами. Минулого місяця у США також представили двопартійний законопроєкт AI Kill Switch Act, який передбачає обов’язок великих розробників створювати й підтримувати технічні механізми для вимкнення неконтрольованих моделей.