Anthropic пояснила, як працюватимуть водяні знаки в текстах Claude
Компанія Anthropic оприлюднила деталі щодо впровадження водяних знаків у текстах, згенерованих її чатботом Claude. Такий механізм компанія запроваджує для дотримання Кодексу прозорості Закону ЄС про штучний інтелект, який передбачає системи для ідентифікації контенту, створеного ШІ, повідомляє TechCrunch.
За поясненням Anthropic, Claude формуватиме прихований шаблон у відповідях, використовуючи вибір між рівноцінними варіантами слів. Наприклад, модель може обрати різні слова для опису похмурої погоди. Для читача текст із таким позначенням не відрізнятиметься від звичайного, однак його зможе виявити той, хто має ключ для декодування водяного знака.
Компанія заявила, що застосовуватиме підхід SynthID-Text, який команда Google DeepMind представила у 2024 році, а також планує випустити API для виявлення водяних знаків. Anthropic наголосила, що ця технологія відрізняється від систем визначення ШІ-текстів, які шукають характерні мовні конструкції та інші стилістичні ознаки.
Більше актуальних новин читайте у Telegram-каналі UA.News.
Легке редагування, за оцінкою Anthropic, імовірно, не прибере водяний знак повністю. Водночас повне переписування тексту із заміною кожного слова може його усунути. Якщо Claude лише вичитував або незначно редагував людський текст, можливість виявлення позначки залежатиме від обсягу та інтенсивності такого редагування. За легкого редагування майже всі слова залишатимуться написаними людиною, тож позначці буде мало до чого прикріпитися.
У програмному коді можливості для маркування будуть обмеженішими, оскільки модель має створювати працездатний результат і не завжди може вільно обирати між різними варіантами. Водночас технологію можуть застосовувати до довільних елементів коду, зокрема коментарів, із незначним впливом на сам код. Anthropic також зазначила, що інші великі розробники моделей, які підписали той самий кодекс, впроваджуватимуть власні водяні знаки.