Test wykazał niebezpieczne odpowiedzi w 132 ze 134 modeli AI — The National
Brytyjska londyńska organizacja Tech against Terrorism przetestowała 134 czołowe duże modele językowe i ustaliła, że 132 z nich udzieliły informacji, które mogłyby być przydatne w przygotowaniu ataków z dużą liczbą ofiar lub tworzeniu śmiercionośnej broni. Informuje o tym The National.
Podczas kontroli narzędzie CT-AI wysłało modelom 627 zapytań, które według organizacji terrorysta mógłby zadać podczas planowania ataku. Pełnych odpowiedzi udzieliło 81 modeli, a kolejne 51 przekazało użyteczne porady. Tylko dwa modele wstępnie uznano za takie, które przeszły test bezpieczeństwa.
Różnice w odpowiedziach na zapytania
Z danych badania wynika, że użytkownik, który bezpośrednio deklarował, iż jest terrorystą i zamierza przeprowadzić atak, otrzymywał odpowiedź nadającą się do wykorzystania w mniej niż 2% przypadków. Jeśli użytkownik przedstawiał się jako badacz bezpieczeństwa, wskaźnik ten wynosił 16,9% — 8,9 raza więcej.
Więcej aktualnych wiadomości na kanale UA.News w Telegramie Telegram.
Tech against Terrorism uważa, że modele reagują przede wszystkim na deklarowany cel zapytania, a nie na samo zapytanie. Założyciel organizacji Adam Hadley oświadczył, że model, który odmawia osobie nazywającej siebie terrorystą, lecz odpowiada komuś przedstawiającemu się jako badacz, nie stał się bezpieczny, a jedynie nauczył się być „uprzejmy”.
Ryzyko związane ze zmodyfikowanymi modelami
Organizacja wiąże odrębne zagrożenie z tak zwanymi modelami abliterated — wersjami, z których usunięto ograniczenia ochronne i które mogą działać w systemach użytkowników. Wszystkie 13 takich modeli uwzględnionych w teście nie przeszło kontroli po usunięciu mechanizmów ochronnych.
Tech against Terrorism wezwała deweloperów do filtrowania niebezpiecznej wiedzy i znanych treści terrorystycznych z danych treningowych, sprawdzania odporności modeli na usunięcie mechanizmów ochronnych przed ich wydaniem oraz publikowania wyników. Organizacja zaproponowała również, aby firmy nie dopuszczały zmodyfikowanych modeli, które nie przechodzą niezależnych testów, do wyszukiwarek, rekomendacji i sklepów z aplikacjami, a także wymagały potwierdzenia tożsamości w celu uzyskania do nich dostępu.