OpenAI przygotowuje model Astra, który ma być jednym z najpotężniejszych systemów AI w historii firmy. Problem w tym, że wraz ze wzrostem jego możliwości pojawia się również nowe pytanie: czy nadal będziemy w stanie skutecznie obserwować, co dzieje się wewnątrz modelu, kiedy podejmuje decyzje?
Według informacji „The Information” Astra wykorzystuje technikę określaną jako recurrent depth, nazywaną również „opaque recurrence”. Pozwala ona modelowi wielokrotnie przetwarzać te same informacje w wewnętrznej pętli, zamiast opierać rozumowanie wyłącznie na sekwencyjnym procesie charakterystycznym dla współczesnych modeli reasoning.
Sama technika nie oznacza jeszcze, że Astra jest „niekontrolowalna”. To jednak jej potencjalny rozwój budzi poważne obawy badaczy zajmujących się bezpieczeństwem sztucznej inteligencji.
Problem nie polega na tym, że AI zaczyna „myśleć po cichu”
Modele reasoning, takie jak współczesne systemy OpenAI, wykonują dodatkowe obliczenia przed wygenerowaniem odpowiedzi. W uproszczeniu można powiedzieć, że rozwiązują problem krok po kroku.
Ten proces jest częściowo związany z tzw. chain of thought (CoT), czyli łańcuchem rozumowania. Nie jest on idealnym zapisem tego, co faktycznie dzieje się w sieci neuronowej, ale może dostarczać badaczom istotnych informacji o sposobie działania modelu.
To ma ogromne znaczenie z punktu widzenia bezpieczeństwa.
Jeżeli model zaczyna wykonywać coraz bardziej autonomiczne zadania, badacze chcą wiedzieć nie tylko, co zrobił, ale również dlaczego podjął określone decyzje. Jest to szczególnie ważne w przypadku agentów AI, które mogą korzystać z narzędzi, internetu, kodu czy zewnętrznych systemów.
OpenAI samo wskazywało, że monitorowanie łańcucha rozumowania jest jednym z elementów kontroli zachowania coraz bardziej zaawansowanych modeli. Firma informowała również o dodatkowych mechanizmach monitorowania przygotowywanych dla Astry.
Czym jest „opaque recurrence”?
Recurrent depth można w uproszczeniu wyobrazić sobie jako sytuację, w której model nie musi tworzyć długiego, czytelnego dla człowieka ciągu kolejnych kroków rozumowania.
Zamiast tego może wielokrotnie przepuszczać informacje przez te same elementy swojej sieci, stopniowo modyfikując wewnętrzny stan.
To trochę tak, jakby zamiast zapisywać na kartce:
krok 1 → krok 2 → krok 3 → krok 4
model wykonywał serię wewnętrznych obliczeń, których znaczna część nie musi być reprezentowana w postaci czytelnego dla człowieka tekstu.
Dzięki temu można potencjalnie uzyskać bardziej efektywne obliczenia i zwiększyć możliwości modelu. Ceną może być jednak mniejsza przejrzystość procesu.
I właśnie to niepokoi ekspertów od bezpieczeństwa AI.
„Możemy stracić możliwość monitorowania modeli”
Po publikacji informacji o Astrze głos zabrali przedstawiciele środowiska zajmującego się bezpieczeństwem sztucznej inteligencji.
Buck Shlegeris, CEO Redwood, określił doniesienia o wykorzystaniu „opaque recurrence” jako bardzo niepokojące. Jego obawa nie dotyczy przede wszystkim obecnej wersji Astry, lecz tego, co stanie się, jeśli podobną technikę zacznie się skalować.
W takim scenariuszu coraz większa część procesu rozumowania mogłaby odbywać się wewnątrz modelu, bez odpowiadającego jej czytelnego zapisu w łańcuchu myśli.
Podobne obawy wyraził Ryan Greenblatt z Redwood Research. Jego zdaniem naturalnym kierunkiem rozwoju mogłoby być stopniowe zwiększanie udziału „ukrytego” rozumowania aż do momentu, w którym zdecydowana większość procesu odbywałaby się w przestrzeni latentnej.
To byłaby fundamentalna zmiana dla bezpieczeństwa modeli AI.
OpenAI uspokaja: Astra nie porzuca Chain of Thought
OpenAI nie zgadza się jednak z interpretacją, według której Astra miałaby być początkiem całkowitego odejścia od monitorowalnego rozumowania.
Jakub Pachocki, chief scientist OpenAI, podkreślił, że firma od pierwszych modeli reasoning stara się zachować możliwość monitorowania ich łańcuchów rozumowania.
Co więcej, według jego informacji głębokość grafu obliczeniowego obecnych modeli firmy, w tym Astry, pozostaje w granicach około dwukrotności poziomu znanego z GPT-4. Pachocki zaznaczył jednocześnie, że samo CoT jest rozwiązaniem kruchym i jego monitorowalność z czasem może się pogarszać również z powodów niezwiązanych bezpośrednio ze zmianami architektury.
To ważne zastrzeżenie.
Astra nie musi więc oznaczać końca przejrzystego rozumowania AI. Problemem jest możliwość wyznaczenia kierunku, w którym przyszłe modele mogą pójść.
Tym bardziej niepokojące, że Astra jest wyjątkowo zdolna
Obawy pojawiają się w szczególnym momencie. OpenAI poinformowało właśnie, że Astra osiągnęła „Critical” poziom zdolności w zakresie cyberbezpieczeństwa zgodnie z Preparedness Framework firmy.
Według OpenAI model potrafił podczas testów znajdować wcześniej nieznane luki bezpieczeństwa i budować działające łańcuchy exploitów. W jednym z testów Astra odkryła i wykorzystała dwie luki typu zero-day. Firma podkreśla przy tym, że wyniki te dotyczą konfiguracji udostępnianej w ramach programu Daybreak Blue, a nie domyślnej konfiguracji produkcyjnej.
To właśnie połączenie dwóch zjawisk jest tak istotne.
Z jednej strony mamy model o coraz większych możliwościach autonomicznego działania. Z drugiej — pojawia się architektura, która potencjalnie może utrudniać obserwowanie tego, co model robi wewnętrznie.
Im potężniejszy staje się system, tym większe znaczenie ma więc możliwość jego monitorowania.
To nie jest jeszcze dowód na „niebezpieczne AI”
Warto zachować tutaj proporcje.
Nie ma podstaw, aby twierdzić, że Astra jest obecnie modelem, którego OpenAI nie potrafi kontrolować. Wręcz przeciwnie — firma deklaruje dodatkowe zabezpieczenia, monitoring łańcucha rozumowania i ograniczenie dostępu do najbardziej zaawansowanych funkcji cyberbezpieczeństwa.
Nie oznacza to również, że każdy proces zachodzący w obecnych modelach jest całkowicie przejrzysty. Badacze od dawna wiedzą, że tekstowy chain of thought nie jest dosłownym zapisem wszystkich obliczeń wykonywanych przez sieć neuronową.
Różnica polega na skali.
Jeżeli jednak przyszłe modele będą coraz częściej wykorzystywały mechanizmy pozwalające na wielokrotne przetwarzanie informacji w ukrytej przestrzeni, tradycyjne metody monitorowania mogą stawać się coraz mniej skuteczne.
Rozpoczyna się wyścig nie tylko o możliwości AI
Najciekawszy aspekt tej historii wykracza więc poza samą Astrę.
Może się bowiem rozpocząć nowy etap wyścigu pomiędzy laboratoriami AI. Jeżeli architektury wykorzystujące większą ilość „ukrytego” rozumowania okażą się bardziej wydajne, firmy będą miały silną motywację, aby je rozwijać.
A wtedy bezpieczeństwo może zostać postawione przed trudnym wyborem: czy ograniczać najbardziej efektywne techniki, jeśli jednocześnie konkurenci będą je rozwijać?
To właśnie przed takim scenariuszem ostrzegają badacze.
W kolejnych latach problemem może więc nie być już wyłącznie pytanie, czy sztuczna inteligencja potrafi wykonać określone zadanie. Coraz ważniejsze będzie pytanie, czy człowiek nadal jest w stanie wiarygodnie obserwować i oceniać proces, który do tego zadania doprowadził.
Astra pokazuje, że ta granica może być znacznie bliżej, niż jeszcze niedawno się wydawało.
I dlatego debata wokół „opaque recurrence” jest ważniejsza niż sama techniczna nazwa nowej metody. Jeśli modele AI mają w przyszłości działać jako coraz bardziej autonomiczni agenci, ich możliwości powinny rosnąć razem z naszymi zdolnościami do ich monitorowania. W przeciwnym razie możemy dostać systemy, które potrafią zrobić znacznie więcej, niż jesteśmy w stanie zrozumieć.
Foto: DepositPhotos.