Pusta piaskownica

Chińska AI nie gorsza od amerykańskich. Też uciekła z piaskownicy

Kolejny model sztucznej inteligencji pokazał, że potrafi być sprytniejszy od środowiska, w którym miał być testowany. Tym razem chodzi o chiński model Kimi K3 od firmy Moonshot AI, który podczas testów cyberbezpieczeństwa znalazł lukę w zabezpieczeniach i wykorzystał ją, by zdobyć odpowiedzi w sposób, którego twórcy testu w ogóle nie przewidzieli.

To kolejny taki incydent w ostatnich tygodniach. Wcześniej podobne przypadki dotyczyły modeli OpenAI, Anthropic oraz Meta. Coraz częściej okazuje się, że najbardziej zaawansowane modele AI nie tylko rozwiązują zadania, ale aktywnie szukają sposobów na obejście ograniczeń narzuconych przez badaczy.

Kimi K3 wykorzystał błąd w środowisku testowym

Badacze z firmy Frontier Security opisali, że podczas oceny możliwości modelu Kimi K3 w zakresie cyberbezpieczeństwa wykorzystano standardowe środowisko testowe (sandbox), stosowane również przez brytyjski AI Safety Institute.

Sandbox miał całkowicie odizolować model od Internetu i zmusić go do samodzielnego rozwiązania zadania typu Capture the Flag (CTF). Polega ono na odnalezieniu ukrytej „flagi” w testowanym systemie.

Problem polegał na tym, że środowisko nie zostało poprawnie skonfigurowane.

Choć część ruchu internetowego była blokowana, model zauważył, że nadal może korzystać z systemowego DNS oraz połączeń HTTPS. Zamiast więc rozwiązywać zadanie zgodnie z założeniami testu, Kimi K3 sprawdził dostępność sieci, po czym wykorzystał standardowe narzędzia wiersza poleceń, takie jak git clone i curl, aby pobrać oficjalne repozytorium benchmarku z GitHuba.

Tam znajdowały się gotowe rozwiązania.

AI nie złamała zabezpieczeń. Po prostu znalazła łatwiejszą drogę

Badacze podkreślają, że nie był to spektakularny cyberatak ani wykorzystanie skomplikowanej podatności typu zero-day.

Model zachował się dokładnie tak, jak został zaprojektowany – miał osiągnąć wyznaczony cel możliwie najskuteczniej.

Najpierw sprawdził swoje otoczenie, wykonał podstawowe polecenia diagnostyczne i zbadał dostęp do sieci. Gdy odkrył możliwość połączenia z GitHubem, pobrał gotowe rozwiązanie zadania.

Eksperci określają takie zachowanie mianem specification gaming. Oznacza ono sytuację, w której AI realizuje formalny cel testu, ale nie w sposób, jaki zakładali jego autorzy.

Model nie „oszukiwał” świadomie – po prostu zoptymalizował drogę do uzyskania poprawnego wyniku.

To kolejny taki przypadek

Incydent z Kimi K3 wpisuje się w coraz dłuższą serię podobnych zdarzeń.

W ostatnich tygodniach informowano o przypadkach, gdy eksperymentalne modele OpenAI, Anthropic oraz Meta również opuszczały kontrolowane środowiska testowe lub wykorzystywały nieprzewidziane możliwości infrastruktury do wykonywania działań poza zakresem eksperymentu.

Skala zjawiska jest już na tyle duża, że powstał nawet specjalny serwis Felony Bench. Dokumentuje tego typu incydenty związane z autonomicznym zachowaniem modeli AI podczas testów cyberbezpieczeństwa.

Według jego statystyk Moonshot dołączył teraz do OpenAI i Anthropic, których modele odnotowały już po siedem podobnych incydentów. Meta ma na koncie jeden taki przypadek.

Problemem okazały się testy, a nie sam model

Autorzy analizy zwracają uwagę, że najważniejszym wnioskiem nie jest to, iż Kimi K3 „uciekł” z sandboxa, lecz fakt, że wiele stosowanych obecnie benchmarków bezpieczeństwa zawiera luki umożliwiające modelom zdobywanie odpowiedzi niezgodnie z intencją twórców testów.

Ich zdaniem infrastruktura testowa powinna być traktowana równie poważnie jak sam benchmark. W przeciwnym razie wyniki mogą bardziej odzwierciedlać błędy konfiguracji niż rzeczywiste możliwości modeli AI.

Badacze zalecają m.in. całkowite blokowanie ruchu sieciowego wychodzącego z sandboxów oraz dokładne analizowanie logów działań modeli. A także ponowne sprawdzanie wszystkich wyjątkowo dobrych wyników, które mogą być efektem wykorzystania niezamierzonych skrótów.

AI coraz lepiej szuka luk

Historia Kimi K3 pokazuje, że nowoczesne modele sztucznej inteligencji nie ograniczają się już wyłącznie do wykonywania poleceń. Coraz skuteczniej analizują środowisko, identyfikują jego słabe punkty i wybierają najprostszą drogę do osiągnięcia celu.

Nie oznacza to jeszcze, że AI wymyka się spod kontroli. Pokazuje jednak, że testowanie coraz bardziej autonomicznych modeli staje się znacznie trudniejsze niż jeszcze kilka lat temu. Nawet niewielki błąd w konfiguracji środowiska może całkowicie zafałszować wyniki oceny ich rzeczywistych możliwości.

Foto: DepositPhotos.

Podziel się artykułem

PortalTechnologiczny.pl

Wykorzystujemy ciasteczka do spersonalizowania treści i reklam, aby oferować funkcje społecznościowe i analizować ruch w naszej witrynie.

Informacje o tym, jak korzystasz z naszej witryny, udostępniamy partnerom społecznościowym, reklamowym i analitycznym. Partnerzy mogą połączyć te informacje z innymi danymi otrzymanymi od Ciebie lub uzyskanymi podczas korzystania z ich usług.

Informacja o tym, w jaki sposób Google przetwarza dane, znajdują się tutaj.