Anthropic і OpenAI пропонують оцінювачів без права зупиняти розробку моделей ШІ
Компанії Anthropic та OpenAI підтримали залучення зовнішніх оцінювачів безпеки до роботи з передовими моделями штучного інтелекту, однак такі фахівці не матимуть незалежних повноважень зупиняти навчання або розгортання моделей. Про це повідомляє CNBC Top News.
Генеральний директор Anthropic Даріо Амодеї запропонував надати стороннім оцінювачам постійний доступ, зіставний із доступом внутрішніх команд з управління ризиками. За його планом, вони також зможуть публікувати висновки без редакційного контролю компанії, хоча з обмеженими вилученнями інформації.
Доступ без права вето
Амодеї порівняв цей підхід із практикою банківського нагляду, коли регулятори працюють усередині великих банків. Деканка юридичного коледжу Університету Вайомінгу та експертка з банківського регулювання Джулі Андерсен Гілл вважає таке порівняння неточним. За її словами, банківські наглядачі можуть вимагати припинення певної практики, обмежувати зростання установи, домагатися змін у керівництві, а в крайніх випадках — закрити банк.
Запропоновані Anthropic оцінювачі зможуть вивчати системи та повідомляти про ризики, але не матимуть юридичних інструментів, щоб заборонити розробку чи випуск моделі. OpenAI також зобов’язалася запровадити подібний механізм, проте деталей роботи постійно залучених оцінювачів ще не оприлюднила.
Більше актуальних новин читайте у Telegram-каналі UA.News.
Питання незалежності
Керівник напряму ШІ в компанії з кібербезпеки XBOW Альберт Ціглер, команда якого отримувала ранній доступ до моделей Anthropic, OpenAI та інших розробників, підтвердив, що оцінювачі не мають права вето. Він зазначив, що тестування може виявити, чи здатна модель виконати небезпечне завдання, але для оцінки ризику всієї системи потрібен доступ до інструкцій, інструментів, дозволів, механізмів захисту та журналів спроб виконати дії.
Дослідниця Каліфорнійського університету в Берклі Дебора Раджі наголосила, що сам доступ до системи не робить оцінювача незалежним. На її думку, поза компанією має існувати орган, який визначатиме кваліфікацію аудиторів, межі їхньої перевірки та те, куди мають подаватися висновки. Anthropic називала потенційним оцінювачем некомерційну організацію Model Evaluation and Threat Research, або METR, з якою вже співпрацювала.
METR заявляє, що не приймає грошових виплат чи пожертв від ШІ-компаній або їхніх керівників. Водночас у власному звіті організація визнала, що деякі її працівники мають тісні соціальні зв’язки зі співробітниками ШІ-компаній, а також що вона ділить дослідницький центр із працівниками деяких лабораторій.
Експерти також звернули увагу на відсутність для передового ШІ системи правил, подібної до банківського регулювання: вона мала б визначати заборонені дії, межі розсуду оцінювачів і наслідки серйозних висновків. На думку Гілл, доступ та право публікувати результати не надають довіри, властивої державному нагляду, якщо розробник зберігає контроль над остаточними рішеннями.