Jemeńska grupa projektowała broń z pomocą Claude'a. Potem ją przetestowała

Sztuczna inteligencja coraz częściej wspiera programistów i badaczy, ale bywa też wykorzystywana w groźnych celach. Anthropic alarmuje, że model Claude miał posłużyć grupie działającej w północnym Jemenie do prac nad oprogramowaniem dla broni, w tym nad elementami sterowania rakietą kierowaną.
Jemeńscy bojownicy Huti atakują statki na Morzu CzerwonymAnthropic opisuje przypadek, w którym jedna z jemeńskich grup wykorzystała Claude'a do prac nad bronią
Źródło zdjęć: © Getty Images | 2023 Mohammed Hamoud
Paweł Maziarz

Anthropic przedstawiło raport dotyczący wykrytych przypadków nadużyć związanych z użyciem Claude’a oraz działań, które miały je ograniczać. Wśród analizowanych sytuacji znalazły się m.in. próby zastosowania modelu do działań cybernetycznych, jednak szczególną uwagę zwraca wątek powiązany z rozwojem uzbrojenia – chodzi o projektowanie i rozwijanie rozwiązań, które mogą mieć zastosowanie bojowe.

Według ustaleń firmy, grupa operująca w północnej części Jemenu (w raporcie nie wskazano jej wprost jako Huti) równolegle prowadziła trzy inicjatywy związane z pracami nad bronią. Jedna z nich dotyczyła rakiety kierowanej, w której wykorzystano komputer pokładowy klasy smartfona oraz system naprowadzania działający w końcowym etapie lotu. To właśnie przy tym przedsięwzięciu pojawia się rola Claude’a.


WIDEO
Kolejna sztuczna inteligencja wymknęła się z klatki?


AI pisało oprogramowanie sterujące

W tym przypadku nie ograniczono się do ogólnych konsultacji czy pozyskiwania informacji. Claude miał zostać użyty do przygotowywania fragmentów oprogramowania odpowiadającego za kluczowe funkcje lotu: nawigację, sterowanie i stabilizację platformy.

Model wspierał m.in. łączenie otwartoźródłowego autopilota z komputerem pokładowym, generowanie kodu dla sterowania oraz estymacji położenia, dobór parametrów pracy systemu, a także przygotowanie i przeprowadzanie symulacji lotu.

Zwrócono też uwagę na sposób pracy operatorów: korzystali równolegle z kilku instancji Claude’a. Jedna była nastawiona na tworzenie kodu, kolejna na zbieranie potrzebnych informacji, a następna na weryfikację rezultatów. W praktyce przypominało to "wirtualny zespół inżynierów", w którym człowiek rozdzielał zadania między poszczególne role.

Rakietę faktycznie wystrzelono

Najbardziej niepokojące jest to, że działania nie miały zakończyć się wyłącznie na testach w środowisku symulacyjnym. Grupa przeprowadziła w Jemenie rzeczywistą próbę odpalenia rakiety kierowanej. Anthropic podkreśla jednak, że nie znalazło dowodów potwierdzających stworzenie w pełni działającej, operacyjnej broni, a sam test miał zakończyć się niepowodzeniem.

Co istotne, krótko po próbie operatorzy wrócili do Claude’a, próbując ustalić przyczyny nieprawidłowego działania rakiety.

Próbowali ominąć zabezpieczenia Claude'a

Anthropic zaznacza, że mechanizmy bezpieczeństwa modelu blokowały wiele zapytań związanych z projektem, ale nie wszystkie próby udało się zatrzymać. To pokazuje, że część barier da się obejść – zwłaszcza gdy użytkownicy działają metodycznie.

W opisywanym przypadku stosowano m.in. ukrywanie rzeczywistego przeznaczenia kodu, niewskazywanie kontekstu, w jakim ma zostać użyty, oraz dzielenie pracy na wiele rozmów i sesji. Dzięki temu pojedyncza konwersacja nie ujawniała całego planu. Taki model działania jest dla twórców systemów AI szczególnie trudny do wychwycenia.

Powstały też narzędzia działające bez Claude'a

W raporcie pojawia się jeszcze jeden ważny szczegół: grupa opracowała własny zestaw narzędzi do symulacji, który później nie wymagał już ani Claude’a, ani nawet komercyjnych i popularnych środowisk inżynierskich, takich jak MATLAB. Sugeruje to, że AI mogło pomóc w zbudowaniu rozwiązania, które następnie funkcjonowało niezależnie od samego modelu.

Ostatecznie Anthropic zablokowało konta łączone z tą aktywnością i przekazało informacje o zagrożeniu partnerom z sektora publicznego oraz prywatnego. Firma utrzymuje jednocześnie, że nie ma dowodów na skuteczne wdrożenie opracowywanej broni.

Opisany przypadek pokazuje jednak szerszy problem: modele takie jak Claude nie muszą "same budować rakiety", by realnie przyspieszać prace nad uzbrojeniem. Wystarczy, że przejmą część zadań, które wcześniej wymagały specjalistycznej wiedzy oraz zaangażowania kilku osób. Anthropic przyznaje, że im większe możliwości systemów AI, tym większe ryzyko ich niewłaściwego zastosowania.

Wybrane dla Ciebie
NIE WYCHODŹ JESZCZE! MAMY COŚ SPECJALNIE DLA CIEBIE