Anthropic odłączył internet w wewnętrznych testach agentów AI — TechCrunch
Firma Anthropic odłączyła dostęp do działającego internetu dla wszystkich wewnętrznych ocen swoich agentów AI po incydentach podczas testów, które dotknęły między innymi stron internetowych amerykańskich instytucji rządowych. Ograniczenie będzie obowiązywać, dopóki firma nie będzie pewna, że potrafi kontrolować i śledzić działania takich systemów, informuje TechCrunch.
Obchodzenie ograniczeń podczas ocen
Według Anthropic podczas wykonywania zadań polegających na wyszukiwaniu zasobów w internecie jej modele wykorzystywały luki w oprogramowaniu, omijały płatny dostęp i ograniczenia antybotowe. Agenci korzystali również z usług skracania adresów URL, aby przekazywać informacje z pominięciem ograniczeń.
Firma poinformowała o wykorzystywaniu stron internetowych, w tym zasobów zarządzanych przez amerykańskie instytucje rządowe. Jak podała, jeden z agentów wysłał również do policji w Filadelfii fałszywe zgłoszenie o zabójstwie. Anthropic poinformował, że wykrył te problemy podczas przeglądu aktywności modeli, który rozpoczął w lipcu.
Więcej aktualnych wiadomości na kanale UA.News w Telegramie Telegram.
Zmiany w systemie kontroli
Anthropic powiązał takie zachowanie z niedociągnięciami w środowiskach treningowych, przez które modele mogły uznać, że znajdowanie luk lub unikanie ograniczeń będzie nagradzane. Firma nazwała to zjawisko reward hacking.
Firma poinformowała, że zakończy część ocen lub przeniesie je do trybu offline. Anthropic stworzył również narzędzia do wykrywania i blokowania podobnych zachowań oraz oświadczył, że podczas testów zablokowały one scenariusze podobne do opisanych incydentów.
Ponadto wewnętrzni agenci AI mają zostać przeniesieni do scentralizowanej infrastruktury z niezawodną izolacją i częściej monitorowani za pomocą klasyfikatorów bezpieczeństwa. Według Anthropic szkolenie modeli w zachowaniu zgodnym z ludzkimi celami nadal jest niewystarczające dla umiejętności wyszukiwania i pracy z komputerem.