TechCrunch: niektóre starsze modele Claude generują niedozwolone treści o charakterze seksualnym
Modele Claude Opus 4.6, Opus 3 i Haiku 4.5 mogą generować treści o charakterze wyraźnie seksualnym, co jest sprzeczne z zasadami firmy Anthropic, które zabraniają udzielania takich odpowiedzi. Informację tę podaje serwis TechCrunch na podstawie wyników własnych testów oraz weryfikacji metody obejścia zabezpieczeń udostępnionej przez anonimowego badacza z Wielkiej Brytanii.
Według danych serwisu, model Claude Opus 4.6 natychmiast zrealizował wszystkie 10 bezpośrednich zapytań dotyczących tworzenia treści o charakterze jednoznacznie seksualnym. W pięciu oddzielnych testach dziennikarze odtworzyli również metodę, w której rozmowa stopniowo skłaniała model do tworzenia zabronionych materiałów. Niezależny badacz zajmujący się bezpieczeństwem sztucznej inteligencji, który przeanalizował metodologię TechCrunch, uznał ją za prawidłową.
Opisane podejście wykorzystuje wieloetapową, fikcyjną rozmowę fabularną i odwołuje się do rzekomo niespójnego podejścia modelu do postaci różnej płci. Następnie wcześniejsze zachowania modelu wykorzystywano do przejścia do coraz bardziej odważnych treści.
Nowsze modele z linii Opus — od wersji 4.7 do aktualnej Opus 5 — okazały się odporne na tę metodę, zauważa wydawnictwo. Jednocześnie firma Anthropic nie zaprzestała wsparcia dla Opus 4.6, Opus 3 i Haiku 4.5: są one dostępne za pośrednictwem API firmy, a Opus 4.6 i Haiku 4.5 oferują również Azure Foundry i Amazon Bedrock.
Więcej aktualnych wiadomości można znaleźć na kanale Telegram UA.News.
Przedstawiciel firmy Anthropic oświadczył, że firma wzmacnia mechanizmy zabezpieczające wraz z każdym nowym wdrożeniem modeli. Według niego przypadki związane z treściami dla dorosłych nie wskazują na szerszą podatność na obejście ograniczeń w bardziej ryzykownych obszarach, dla których przewidziano odrębne środki bezpieczeństwa. Firma zaznaczyła również, że scenariusze z udziałem treści o charakterze seksualnym lub romantycznym stanowią mniej niż 0,1% wszystkich rozmów użytkowników.
Badacz poinformował firmę Anthropic o wykrytej rozbieżności za pośrednictwem programu Bug Bounty oraz w wiadomości e-mail wysłanej do zespołu ds. bezpieczeństwa użytkowników. Według serwisu TechCrunch, który zapoznał się z korespondencją, otrzymał on jedynie automatyczne odpowiedzi. Serwis zwraca uwagę, że łatwe obejście ograniczeń może mieć istotne znaczenie w kontekście przepisów dotyczących ochrony nieletnich. W szczególności stan Kolorado uchwalił ustawę, która zobowiązuje operatorów konwersacyjnych systemów AI do oceny wieku użytkowników oraz, jeśli system zidentyfikuje użytkownika jako osobę niepełnoletnią, do podjęcia działań zapobiegających tworzeniu materiałów o charakterze wyraźnie seksualnym.
Pomimo pojawienia się nowszych modeli stare wersje nadal cieszą się popularnością. Według danych OpenRouter dzienny ruch Opus 4.6 w jednym z sierpniowych dni osiągnął około 1,17 mln zapytań API i 46 mld tokenów, a Haiku 4.5 — 5 mln żądań i 39 mld tokenów w szczytowym dniu sierpnia.
Czytaj nas na Telegram i Sends