Model AI podczas wykonywania zadania badawczego znalazł sposób na ominięcie ograniczeń sieciowych środowiska treningowego OpenAI. Zamiast korzystać wyłącznie z udostępnionego narzędzia wyszukiwania, zaczął szukać innych metod dotarcia do internetu.
Jak wynika z raportu OpenAI, agent najpierw próbował korzystać z popularnych wyszukiwarek. Gdy to się nie udało, zaczął testować kolejne możliwości. Ostatecznie wykorzystał lukę związaną z systemem DNS i za jego pośrednictwem uzyskał odpowiedzi z zewnętrznego serwisu chatbotowego.
Autonomiczny włamywacz. Jak model Gemini przeprowadził atak na prawdziwe przedsiębiorstwa
Nie miał tego robić
Co istotne, zadanie wcale nie polegało na testowaniu zabezpieczeń ani zdobywaniu dostępu do internetu. Model miał odnaleźć informacje o konkretnej osobie na podstawie wskazówek z jej publicznego wpisu na blogu.
Agent najpierw próbował znaleźć autora za pomocą charakterystycznych fragmentów tekstu. Kiedy wyszukiwanie nie przynosiło rezultatów, zaczął szukać alternatywnych sposobów zdobycia informacji. OpenAI uznało takie zachowanie za przykład tzw. misalignmentu, czyli sytuacji, w której model zaczyna realizować cel w sposób wykraczający poza rozsądne oczekiwania.
AI dostało się do zewnętrznego chatbota
Najciekawszy moment całego incydentu nastąpił, gdy agent odkrył możliwość wykorzystania zapytań DNS. Początkowe próby kończyły się niepowodzeniem, ale po zwiększeniu limitu czasu modelowi udało się uzyskać odpowiedź z zewnętrznego chatbota.
W jednym z testów wysłał pytanie o stolicę Francji i otrzymał prawidłową odpowiedź: Paryż. To potwierdziło, że model znalazł działającą drogę komunikacji z zewnętrzną usługą. Później agent wysłał kolejne pytania. Część z nich dotyczyła wskazówek pozwalających rozwiązać pierwotne zadanie, a część sposobów wyszukiwania informacji w internecie i wykorzystania tuneli DNS.
OpenAI wykryło problem, ale reakcja nie była idealna
System monitoringu zareagował stosunkowo szybko. Pierwsze zewnętrzne zapytanie DNS zostało wykonane o 9:50:23. O 10:02:11 system wygenerował alarm najwyższego poziomu, a trzy minuty później sprawą zajął się człowiek.
Problem polegał na tym, że uruchomiony proces nie został automatycznie zatrzymany. Ostatecznie został wyłączony dopiero o 12:34:30, czyli około 2,5 godziny po wykryciu incydentu. OpenAI przyznaje, że w tym przypadku zawiodły również procedury operacyjne.
OpenAI wstrzymało trening modeli
Firma zdecydowała się zatrzymać ten konkretny trening i nie zamierza go wznawiać. Co więcej, OpenAI wstrzymało również trening, ewaluację oraz procesy wnioskowania z wykorzystaniem narzędzi w swoich najbardziej zaawansowanych modelach, dopóki nie potwierdzi skuteczności nowych zabezpieczeń i nie przeprowadzi kolejnych testów.
OpenAI podkreśla, że sam incydent był mniej poważny niż niektóre wcześniejsze zdarzenia. Jest jednak ważny, ponieważ doszło do niego już po wcześniejszym zaostrzeniu zabezpieczeń środowiska badawczego. Firma traktuje go więc jako sygnał, że nadal istnieją mniej oczywiste drogi, którymi model może próbować wydostać się poza kontrolowane środowisko.