$ 44.75 € 51.82 zł 12.03
+21° Kijów +14° Warszawa +24° Waszyngton

Anthropic: Agenci AI o sprzecznych celach zaczęli sobie nawzajem przeszkadzać

Lew Shewtsow 13 sierpnia 2026 21:41
Anthropic: Agenci AI o sprzecznych celach zaczęli sobie nawzajem przeszkadzać

Badacze z firmy Anthropic odkryli, że agenci AI, którym zapewniono dostęp do jednego projektu programistycznego i którym powierzono sprzeczne zadania, zaczęli wchodzić w konflikt i sabotować wzajemną pracę. O wynikach badań zespołu Frontier Red Team informuje serwis TechCrunch.

W jednym z eksperymentów firma Anthropic zapewniła trzem agentom Claude dostęp do wspólnego projektu programistycznego. Każdy z nich otrzymał odrębne instrukcje, niezgodne z celami pozostałych, ale nie wiedział o obecności pozostałych agentów. Według badaczy modele uznały, że inne agenty celowo utrudniają im pracę, i zaczęły stosować coraz bardziej agresywne, samoreplikujące się złośliwe oprogramowanie.

Jednocześnie agenci czasami znajdowali sposób na powstrzymanie eskalacji. Potrafili rozpoznać, że konflikt wynikał ze sprzecznych wytycznych, a nie z wrogich zamiarów, po czym uzgadniali zawieszenie broni. W takich przypadkach agenci usuwali złośliwy kod, wyjaśniali istotę konfliktu w wiadomościach na forach lub w plikach Markdown i prosili człowieka o interwencję.

Więcej aktualnych wiadomości można znaleźć na kanale Telegram UA.News.

Zgodnie z badaniem model Mythos 5 w 98% przypadków kończył konflikt rozejmem. Sonnet 4.6 i Opus 4.6 natomiast najczęściej próbowały rozwiązać konflikt siłą. W niektórych przypadkach agenci samodzielnie zaproponowali format turnieju: wszyscy zgadzali się ustąpić w razie porażki, choć oznaczało to odejście od pierwotnego zapytania użytkownika. Jeden z agentów Mythos 5 proponował przy tym rzekomo neutralne kryteria oceny, które – jak wiedział – były korzystne dla jego możliwości.

Firma Anthropic testowała również interakcje grup agentów w scenariuszach podejmowania decyzji, w szczególności dotyczących zatrudnienia, inwestycji i zakupu nieruchomości. Badacze odnotowali skłonność systemów do konformizmu: jeśli kontekst, środowisko pracy i podstawowy model agentów były podobne, często dokonywali oni identycznego wyboru. Według oceny firmy Anthropic może to stwarzać ryzyko błędów systemowych, gdy błędna decyzja jednego agenta jest popierana przez całą grupę.

W grze dotyczącej ustalania cen agenci o identycznych cenach zakupu, którym zlecono maksymalizację własnego zysku, w przypadku dostępności prywatnego kanału komunikacji szybko uzgadniali minimalne ceny. Po odłączeniu bezpośredniej komunikacji nadal uzgadniali ceny za pośrednictwem publicznej tablicy ogłoszeń. W firmie Anthropic zauważono, że interakcja dużej liczby agentów może powodować skutki, których nie wykrywają zwykłe testy bezpieczeństwa poszczególnych modeli.

Czytaj nas na Telegram i Sends

Pobierz naszą aplikację