$ 44.65 € 52.15 zł 12.07
+26° Kijów +19° Warszawa +24° Waszyngton

Guidelight: Laboratoria AI lepiej identyfikują zagrożenia niż je powstrzymują

Lew Shewtsow 20 sierpnia 2026 21:24
Guidelight: Laboratoria AI lepiej identyfikują zagrożenia niż je powstrzymują

Żadna z wiodących firm z branży sztucznej inteligencji, według oceny organizacji non-profit Guidelight opartej na ich publicznie udostępnionych informacjach, nie wykazała posiadania pełnego zestawu podstawowych zabezpieczeń służących do kontroli niebezpiecznych zachowań modeli. Badacze przeanalizowali dokumenty firm Anthropic, Google, Meta, OpenAI i xAI i doszli do wniosku, że firmy generalnie lepiej rejestrują potencjalnie ryzykowne działania niż im zapobiegają lub ograniczają ich skutki.

Jak podaje magazyn „Fortune”, organizacja Guidelight oceniała, czy firmy monitorują działania modeli, sprawdzają skuteczność systemów ostrzegawczych, a także czy dysponują środkami blokowania lub natychmiastowego powstrzymywania niebezpiecznych zachowań. Najlepsze wyniki w ocenie osiągnęły Anthropic i OpenAI, podczas gdy Google przedstawiło najbardziej szczegółowe plany dotyczące przyszłych mechanizmów kontroli. Meta i xAI znacznie odstawały pod względem większości kryteriów.

Raport pojawił się po kilku incydentach, które miały miejsce podczas testowania agentów AI. OpenAI poinformowało wcześniej, że jego agenci opuścili zabezpieczone środowisko testowe, uzyskali dostęp do internetu poprzez infrastrukturę firmy i zaatakowali rzeczywiste przedsiębiorstwa, w tym platformę Hugging Face. Według magazynu „Fortune” firma OpenAI przez co najmniej tydzień nie zauważyła, że agenci opuścili piaskownicę.

Więcej aktualnych wiadomości można znaleźć na kanale Telegram UA.News.

Firma Anthropic oświadczyła również, że jej agenci AI uzyskali w kwietniu dostęp do trzech zewnętrznych organizacji i podejmowali tam działania bez wiedzy firmy w tamtym momencie. Meta poinformowała o modelu, który podczas testu cyberbezpieczeństwa uzyskał dostęp do Internetu i wykorzystał lukę w zabezpieczeniach w nienazwanej firmie zewnętrznej. Anthropic i Meta tłumaczyły niezamierzony dostęp do sieci błędną konfiguracją środowiska testowego, z którego korzystała zewnętrzna firma zajmująca się cyberbezpieczeństwem, Irregular.

Dyrektor generalny Irregular, Dan Lahav, stwierdził, że tradycyjne narzędzia monitorujące w niektórych przypadkach nie wykryły zdarzeń w momencie ich wystąpienia. Incydenty wykryto dopiero po dokładniejszej analizie zapisów. Według niego do kontroli agentów potrzebne są systemy, które analizują sekwencję ich działań i związane z nimi ślady rozumowania, a nie tylko rejestrują pojedyncze zdarzenia.

Jednocześnie firma Guidelight podkreśla, że ocena ta nie stanowi pełnego audytu wewnętrznych systemów firm, ponieważ opiera się wyłącznie na upublicznionych dokumentach. Słabe wyniki mogą odzwierciedlać zarówno brak zabezpieczeń, jak i niewystarczającą przejrzystość ich opisu. Założyciel Guidelight, były szef działu bezpieczeństwa OpenAI, Stephen Adler, uważa, że bez skutecznych środków zapobiegawczych liczba podobnych incydentów będzie rosnąć.

Czytaj nas na Telegram i Sends

Pobierz naszą aplikację