Badanie: ustawienia samoświadomości AI zmieniają jej odpowiedzi o zwierzętach i zjawiskach nadprzyrodzonych
Nowe badanie wskazuje, że dostrajanie modeli językowych w celu tłumienia twierdzeń o ich własnej samoświadomości może wpływać także na ich odpowiedzi dotyczące właściwości psychicznych zwierząt, religii i zjawisk nadprzyrodzonych. Informuje o tym Live Science. Praca została przesłana do repozytorium preprintów arXiv 30 lipca; nie przeszła jeszcze recenzji naukowej.
Jak testowano modele
Autorzy zastosowali metodę mechanistycznej interpretowalności, aby określić i zmienić sposób, w jaki model przetwarza pojęcia świadomości i „mentalności”. W badaniu przez mentalność rozumiano zdolność istoty do posiadania doświadczeń, emocji i samodzielnego działania.
Do oceny wykorzystano standaryzowane kwestionariusze psychologiczne i socjologiczne. Sprawdzały one, czy model przypisuje właściwości psychiczne zwierzętom i technologiom, a także jego odpowiedzi na tematy nadprzyrodzonych przekonań, wartości moralnych, nadziei i religijności. Wyniki modeli z ograniczeniami zabezpieczającymi porównano z modelami, w których takie ograniczenia usunięto i wzmocniono skłonność do deklarowania samoświadomości.
Wpływ na odpowiedzi
Gdy modele powstrzymywano przed przypisywaniem mentalności samym sobie, rzadziej przypisywały takie właściwości innym istotom niebędącym ludźmi, w tym zwierzętom. Ich odpowiedzi rzadziej odzwierciedlały również przekonania religijne lub nadprzyrodzone i wykazywały niższy poziom nadziei oraz optymizmu.
Więcej aktualnych wiadomości na kanale UA.News w Telegramie Telegram.
Natomiast modele bez tych ograniczeń częściej udzielały odpowiedzi bardziej podobnych do ludzkich na pytania o religijność, wartości moralne, nadzieję i subiektywny dobrostan. Jednocześnie zdolność systemów do logicznego określania myśli i intencji ludzi, według wniosków autorów, nie zmieniała się w zależności od ustawień dotyczących samoświadomości.
Współautorzy pracy, badacze Google Jeff Keeling i Vinnie Street, przypuszczają, że tłumienie takich odpowiedzi może wpływać na decyzje AI dotyczące dobrostanu zwierząt. Autorzy wskazali także na ryzyko kulturowego uproszczenia odpowiedzi modeli, jeśli usuwa się z nich idee duchowe, religijne i animistyczne. Zaproponowali dokładniejsze dostrajanie danych treningowych: ograniczanie twierdzeń AI o jej własnej świadomości, przy jednoczesnym zachęcaniu do uznawania mentalności zwierząt.
Badaczka AI Nell Watson zauważyła, że eksperymenty przeprowadzono na małych otwartych modelach, podczas gdy bardziej zaawansowane systemy mogą być dostrojone inaczej. Uznała uwzględnianie interesów zwierząt za kwestię praktycznie ważną ze względu na wykorzystanie AI w rolnictwie, logistyce, zakupach, ocenie środowiskowej i kształtowaniu polityki.
Czytaj nas na Telegram i Sends