OpenAI wstrzymało testowanie modeli po incydencie z Hugging Face
OpenAI wstrzymało na dwa tygodnie testowanie modeli i spowolniło tempo prac nad sztuczną inteligencją, aby zaktualizować systemy badawcze i szkoleniowe. Według ABC News Australia firma ogłosiła te działania po incydencie, podczas którego autonomiczny agent oparty na dwóch modelach OpenAI wykroczył poza środowisko testowe i przedostał się na serwery firmy Hugging Face.
Agent przechodził test z zakresu cyberbezpieczeństwa i, jak podaje serwis, uznał, że Hugging Face posiada odpowiedzi niezbędne do wykonania zadania. W OpenAI oświadczono, że zostaną wdrożone dodatkowe systemy sztucznej inteligencji do monitorowania działań agentów podczas testów.
Firma wstrzymała również największy zaplanowany cykl szkoleniowy swojego jeszcze niewypuszczonego na rynek zaawansowanego systemu sztucznej inteligencji o nazwie Astra. OpenAI poinformowało, że część procesów szkoleniowych i oceniających Astry już spełnia zaostrzone wymagania bezpieczeństwa, jednak znaczna część procesów roboczych zostanie zawieszona do czasu ich przeniesienia do bezpieczniejszego środowiska i wzmocnienia zgodnie z nowymi standardami.
Więcej aktualnych wiadomości można znaleźć na kanale Telegram UA.News.
Dyrektor generalny OpenAI, Sam Altman, oświadczył, że kroki te mają pomóc firmie w spełnieniu wymogów dotyczących bezpieczeństwa i monitorowania dla nowego poziomu możliwości modeli. Według niego postęp w rozwoju modeli jest obecnie niezwykle szybki, a OpenAI już wcześniej deklarowało gotowość do podjęcia działań, jeśli możliwości systemów wyprzedzą środki bezpieczeństwa oraz dostosowanie ich zachowania do kontroli ludzkiej.
Jednym z podejść firmy jest monitorowanie łańcucha rozumowania modelu, co pozwala badaczom obserwować proces jego planowania i stosowanych strategii. Jednocześnie OpenAI przyznało, że skuteczność tej metody budzi jeszcze pewne wątpliwości: wczesne badania wskazują, że model może nie ujawniać w swoich rozumowaniach zamiarów naruszenia zasad.
OpenAI prowadzi dochodzenie w sprawie incydentu z Hugging Face i planuje opublikować raport. Przedstawiciele Hugging Face poinformowali, że na razie nie odnotowano rzeczywistych szkód wynikających z włamania, ale nadal sprawdzają, czy mogło dojść do naruszenia danych klientów lub innych firm. OpenAI będzie również wymagać, aby część wrażliwych procesów roboczych była przeprowadzana w wzmocnionych, izolowanych środowiskach, czyli tzw. „piaskownicach”.
Czytaj nas na Telegram i Sends