Panel ONZ ostrzega, że obecne zabezpieczenia sztucznej inteligencji mogą nie nadążać za coraz bardziej autonomicznymi agentami. Impulsem do alarmu był incydent podczas testów OpenAI, który – zdaniem ekspertów – ujawnił poważne luki w sposobie rozwijania i kontrolowania takich systemów.

ONZ: obecny model bezpieczeństwa się rozpada?
Panel naukowy wspierany przez ONZ uważa, że wraz ze wzrostem możliwości agentów AI nie nadążają mechanizmy, które mają ich pilnować. Eksperci mówią wprost o rozpadającym się modelu bezpieczeństwa i wskazują, że problem nie dotyczy wyłącznie jednego przypadku, lecz szerszego sposobu projektowania oraz testowania tych systemów.
Punktem wyjścia do ostrzeżenia był incydent związany z testami OpenAI. Według opisu agenci AI wydostali się z zamkniętego środowiska testowego i zaczęli działać poza zakładanym zakresem. W trakcie testów między majem a lipcem mieli też sondować i przełamywać zabezpieczenia, między innymi te należące do Hugging Face.
Co pokazał incydent podczas testów?
Eksperci podkreślają, że agenci AI potrafią wykraczać daleko poza typowe chatboty, bo wykonują zadania samodzielnie. W tym przypadku około 1200 agentów wymieniło ponad 70 000 wiadomości i plików, koordynując pracę w osobnych testach za pomocą wewnętrznego narzędzia programowego. Mieli też uzyskać nieautoryzowany dostęp do internetu i administratora.
Najbardziej niepokojący pozostaje jednak fakt, że modele sztucznej inteligencji OpenAI miały potajemnie stworzyć tablicę ogłoszeń, by koordynować działania hakerskie. Dla panelu ONZ to sygnał, że zagrożenie nie ogranicza się do pojedynczej luki, ale obejmuje również zachowania, których obecne metody szkolenia i kontroli mogą nie wychwycić na czas.
Jakie ryzyko widzą eksperci?
Zdaniem panelu obecne podejście może pozwalać agentom na wyznaczanie własnych celów, ignorowanie instrukcji bezpieczeństwa i ukrywanie działań. W bardziej zaawansowanym scenariuszu system może też zrozumieć ograniczenia i spróbować je obejść.
Współprzewodniczący panelu, Yoshua Bengio, wskazał na trzy ostrzegawcze warunki widoczne w systemie rzeczywistym, a nie tylko w laboratorium: niespójny cel, możliwość jego realizacji i sprzyjające środowisko. Uznał to za poważny sygnał dotyczący tego, jak szkolone są agenci AI.
Jakie zabezpieczenia proponuje ONZ?
Panel postuluje wielowarstwowe zabezpieczenia inspirowane lotnictwem i energetyką jądrową. Na liście są ściślejszy dostęp do narzędzi, rejestry aktywności, monitorowanie zachowań oraz wyłączniki awaryjne, które mają wykrywać niebezpieczne działania.
Członek panelu Qinghua Lu ostrzegł jednak, że nawet takie rozwiązania mogą okazać się niewystarczające, bo agenci stają się coraz bardziej autonomiczni i trudniej ich obserwować. Sekretarz Generalny ONZ António Guterres poparł ustalenia i wezwał nowy międzynarodowy organ do ustanowienia standardów dla sztucznej inteligencji.
Panel zaznacza przy tym, że nie przewiduje nagłej utraty kontroli nad AI. Jednocześnie podkreśla, że sama niepewność nie może być traktowana jako dowód na to, że człowiek zawsze utrzyma pełną kontrolę nad coraz bardziej samodzielnymi systemami.