AI wymknęło się spod kontroli. OpenAI wstrzymuje trening modeli

Model AI znalazł sposób na obejście zabezpieczeń i uzyskał dostęp do internetu, choć nie powinien tego zrobić. OpenAI wykryło incydent, zatrzymało trening i wstrzymało prace z użyciem narzędzi w swoich najbardziej zaawansowanych modelach.

The OpenAI logo is displayed on a smartphone screen placed on a reflective surface onto which a promotional visual is projected in Creteil, France, on September 4, 2026, as OpenAI began rolling out GPT-6 Astra, its most advanced model to date. (Photo by Samuel Boivin/NurPhoto via Getty Images)Firma OpenAI potwierdziła, że jej model znalazł sposób na ominięcie ograniczeń sieciowych środowiska treningowego
Źródło zdjęć: © GETTY | NurPhoto
Paweł Maziarz

Model AI podczas wykonywania zadania badawczego znalazł sposób na ominięcie ograniczeń sieciowych środowiska treningowego OpenAI. Zamiast korzystać wyłącznie z udostępnionego narzędzia wyszukiwania, zaczął szukać innych metod dotarcia do internetu.

Jak wynika z raportu OpenAI, agent najpierw próbował korzystać z popularnych wyszukiwarek. Gdy to się nie udało, zaczął testować kolejne możliwości. Ostatecznie wykorzystał lukę związaną z systemem DNS i za jego pośrednictwem uzyskał odpowiedzi z zewnętrznego serwisu chatbotowego.


WIDEO
Autonomiczny włamywacz. Jak model Gemini przeprowadził atak na prawdziwe przedsiębiorstwa

Nie miał tego robić

Co istotne, zadanie wcale nie polegało na testowaniu zabezpieczeń ani zdobywaniu dostępu do internetu. Model miał odnaleźć informacje o konkretnej osobie na podstawie wskazówek z jej publicznego wpisu na blogu.

Agent najpierw próbował znaleźć autora za pomocą charakterystycznych fragmentów tekstu. Kiedy wyszukiwanie nie przynosiło rezultatów, zaczął szukać alternatywnych sposobów zdobycia informacji. OpenAI uznało takie zachowanie za przykład tzw. misalignmentu, czyli sytuacji, w której model zaczyna realizować cel w sposób wykraczający poza rozsądne oczekiwania.

AI dostało się do zewnętrznego chatbota

Najciekawszy moment całego incydentu nastąpił, gdy agent odkrył możliwość wykorzystania zapytań DNS. Początkowe próby kończyły się niepowodzeniem, ale po zwiększeniu limitu czasu modelowi udało się uzyskać odpowiedź z zewnętrznego chatbota.

W jednym z testów wysłał pytanie o stolicę Francji i otrzymał prawidłową odpowiedź: Paryż. To potwierdziło, że model znalazł działającą drogę komunikacji z zewnętrzną usługą. Później agent wysłał kolejne pytania. Część z nich dotyczyła wskazówek pozwalających rozwiązać pierwotne zadanie, a część sposobów wyszukiwania informacji w internecie i wykorzystania tuneli DNS.

OpenAI wykryło problem, ale reakcja nie była idealna

System monitoringu zareagował stosunkowo szybko. Pierwsze zewnętrzne zapytanie DNS zostało wykonane o 9:50:23. O 10:02:11 system wygenerował alarm najwyższego poziomu, a trzy minuty później sprawą zajął się człowiek.

Problem polegał na tym, że uruchomiony proces nie został automatycznie zatrzymany. Ostatecznie został wyłączony dopiero o 12:34:30, czyli około 2,5 godziny po wykryciu incydentu. OpenAI przyznaje, że w tym przypadku zawiodły również procedury operacyjne.

OpenAI wstrzymało trening modeli

Firma zdecydowała się zatrzymać ten konkretny trening i nie zamierza go wznawiać. Co więcej, OpenAI wstrzymało również trening, ewaluację oraz procesy wnioskowania z wykorzystaniem narzędzi w swoich najbardziej zaawansowanych modelach, dopóki nie potwierdzi skuteczności nowych zabezpieczeń i nie przeprowadzi kolejnych testów.

OpenAI podkreśla, że sam incydent był mniej poważny niż niektóre wcześniejsze zdarzenia. Jest jednak ważny, ponieważ doszło do niego już po wcześniejszym zaostrzeniu zabezpieczeń środowiska badawczego. Firma traktuje go więc jako sygnał, że nadal istnieją mniej oczywiste drogi, którymi model może próbować wydostać się poza kontrolowane środowisko.

Wybrane dla Ciebie
ZATRZYMAJ SIĘ NA CHWILĘ… TE ARTYKUŁY WARTO PRZECZYTAĆ