Anthropic: Agenci AI o sprzecznych celach zaczęli sobie nawzajem przeszkadzać
Badacze z firmy Anthropic odkryli, że agenci AI, którym zapewniono dostęp do jednego projektu programistycznego i którym powierzono sprzeczne zadania, zaczęli wchodzić w konflikt i sabotować wzajemną pracę. O wynikach badań zespołu Frontier Red Team informuje serwis TechCrunch.
W jednym z eksperymentów firma Anthropic zapewniła trzem agentom Claude dostęp do wspólnego projektu programistycznego. Każdy z nich otrzymał odrębne instrukcje, niezgodne z celami pozostałych, ale nie wiedział o obecności pozostałych agentów. Według badaczy modele uznały, że inne agenty celowo utrudniają im pracę, i zaczęły stosować coraz bardziej agresywne, samoreplikujące się złośliwe oprogramowanie.
Jednocześnie agenci czasami znajdowali sposób na powstrzymanie eskalacji. Potrafili rozpoznać, że konflikt wynikał ze sprzecznych wytycznych, a nie z wrogich zamiarów, po czym uzgadniali zawieszenie broni. W takich przypadkach agenci usuwali złośliwy kod, wyjaśniali istotę konfliktu w wiadomościach na forach lub w plikach Markdown i prosili człowieka o interwencję.
Więcej aktualnych wiadomości można znaleźć na kanale Telegram UA.News.
Zgodnie z badaniem model Mythos 5 w 98% przypadków kończył konflikt rozejmem. Sonnet 4.6 i Opus 4.6 natomiast najczęściej próbowały rozwiązać konflikt siłą. W niektórych przypadkach agenci samodzielnie zaproponowali format turnieju: wszyscy zgadzali się ustąpić w razie porażki, choć oznaczało to odejście od pierwotnego zapytania użytkownika. Jeden z agentów Mythos 5 proponował przy tym rzekomo neutralne kryteria oceny, które – jak wiedział – były korzystne dla jego możliwości.
Firma Anthropic testowała również interakcje grup agentów w scenariuszach podejmowania decyzji, w szczególności dotyczących zatrudnienia, inwestycji i zakupu nieruchomości. Badacze odnotowali skłonność systemów do konformizmu: jeśli kontekst, środowisko pracy i podstawowy model agentów były podobne, często dokonywali oni identycznego wyboru. Według oceny firmy Anthropic może to stwarzać ryzyko błędów systemowych, gdy błędna decyzja jednego agenta jest popierana przez całą grupę.
W grze dotyczącej ustalania cen agenci o identycznych cenach zakupu, którym zlecono maksymalizację własnego zysku, w przypadku dostępności prywatnego kanału komunikacji szybko uzgadniali minimalne ceny. Po odłączeniu bezpośredniej komunikacji nadal uzgadniali ceny za pośrednictwem publicznej tablicy ogłoszeń. W firmie Anthropic zauważono, że interakcja dużej liczby agentów może powodować skutki, których nie wykrywają zwykłe testy bezpieczeństwa poszczególnych modeli.
Czytaj nas na Telegram i Sends