Bartosz Naskręcki

[WYWIAD] AI zaczyna odkrywać matematykę. „Możemy stać się całkowicie zależni od maszyn”

Sztuczna inteligencja coraz lepiej radzi sobie z matematyką, a najnowsze modele potrafią nie tylko rozwiązywać znane problemy, ale również szukać nowych dowodów i hipotez. Co zmieniło się w ostatnich miesiącach i dokąd może nas doprowadzić ten rozwój? O tym rozmawiamy z Bartoszem Naskręckim z Wydziału Matematyki i Informatyki Uniwersytetu im. Adama Mickiewicza w Poznaniu oraz Centre for Credible AI Politechniki Warszawskiej – jedynym Polakiem, który współtworzył zadania do benchmarku FrontierMath firmy Epoch AI.

AI może zrobić progres w każdej dziedzinie matematyki

W jakich obszarach matematyki modele językowe radzą sobie dziś najlepiej? I gdzie w najbliższej przyszłości możemy spodziewać się kolejnych znaczących odkryć z wykorzystaniem AI?

Jeszcze kilka miesięcy temu miałem dość zdecydowany pogląd, że najlepiej będą sobie radzić w takich dziedzinach jak abstrakcyjna algebra czy metody symboliczne, czyli tam, gdzie nie jest potrzebna bardzo głęboka intuicja. Wydawało mi się, że intuicje pozatekstowe – na przykład związane z manipulowaniem geometrycznymi obiektami czy wymyślaniem relacji dynamicznych – będą stanowiły przewagę człowieka.

Im dłużej jednak pracuję z największymi modelami, tym bardziej jestem przekonany, że nie ma jednej, określonej dziedziny matematyki, w której modele nie byłyby w stanie zrobić progresu.

Trzeba spojrzeć na matematykę trochę szerzej. Można ją rozumieć jako próbę przekształcenia naszych nie do końca określonych intuicji w tekst. Kiedy już sformułujemy problem, hipotezę czy teorię w postaci tekstowej, zaczyna się pewnego rodzaju gra wewnętrzna. I tutaj modele radzą sobie znakomicie.

Nie chodzi oczywiście o to, że model wychodzi do świata, obserwuje drzewa, ludzi czy ptaki i na tej podstawie sam tworzy teorię matematyczną. Na razie pracujemy przede wszystkim z problemami, które już zostały zapisane w postaci tekstowej.

Ale kiedy problem jest już w tej formie, modele potrafią być niezwykle skuteczne.

Być może jedynym miejscem, w którym ich możliwości będą jeszcze ograniczone, są sytuacje wymagające całkowicie nowego sposobu spojrzenia – nowego paradygmatu, którego wcześniej nie było.

Mam jednak wrażenie, że jesteśmy trochę jak przed Kopernikiem. Coraz bardziej przekonuję się, że wcale nie jesteśmy pępkiem wszechświata, jeśli chodzi o inteligencję matematyczną.

Dlaczego AI tak szybko poszło do przodu?

Skąd więc ten nagły postęp? Jeszcze kilka miesięcy temu wykorzystanie AI do zaawansowanej matematyki nie było aż tak głośnym tematem. Zmieniły się modele czy raczej metody ich trenowania?

Wydarzyło się kilka rzeczy. Przede wszystkim modele zaczęto trenować w zdecydowanie bardziej zorganizowany sposób na mocno sformalizowanych zbiorach dowodów matematycznych.

Do tej pory wyglądało to trochę tak, że do jednego wielkiego zbioru wrzucano praktycznie wszystko – cały internet, różnego rodzaju teksty, logi i dokumenty. Powstawał model, który potrafił orientować się w tekście, ale robił to w dość prymitywny sposób.

Później, na etapie post-trainingu i trenowania ze wzmocnieniem, zbiór danych zaczyna być coraz bardziej precyzyjny. Możemy wziąć artykuły z arXiv, formalne rozumowania matematyczne czy sformalizowane dowody i nauczyć model nie tylko produkowania odpowiedzi, ale również tworzenia kolejnych etapów rozumowania w sposób matematycznie poprawny.

To trochę przypomina naukę gry w szachy. Mamy pewne taktyki i techniki, które powtarzają się w różnych kontekstach. Model uczy się coraz lepiej reguł tej gry.

W matematyce jest jeszcze jedna ogromna przewaga.

Możemy bardzo precyzyjnie ocenić wynik. W poezji trudno powiedzieć, czy dana odpowiedź jest „poprawna”. W matematyce możemy sprawdzić, czy kolejne kroki rozumowania mają sens.

Mamy do tego narzędzia takie jak formalna kompilacja dowodów, Python czy język Lean, którego sam obecnie używam w kilku projektach. Możemy sprawdzić praktycznie każdy krok dowodu i upewnić się, że elementy logicznie się ze sobą łączą.

Laboratoria AI zauważyły, że mają w rękach narzędzia pozwalające bardzo precyzyjnie trenować modele właśnie w tym kierunku.

Dlatego nie powiedziałbym, że zmienił się cały paradygmat pracy z modelami językowymi. Bardziej zmieniło się jakościowe podejście do tego, na jakich danych te modele trenujemy.

Czy kolejnych odkryć możemy się już spodziewać?

Skoro ta metoda działa, to można chyba założyć, że będziemy obserwować kolejne istotne odkrycia matematyczne z udziałem AI?

Tak. I to jest może rzecz, która trochę przeraża.

Jeżeli inżynierowie mają pewien patent na robienie czegoś, to naturalne jest oczekiwanie, że jeżeli potrafią robić to dobrze teraz, to za jakiś czas będą robić tego po prostu więcej.

I lepiej.

Z mojego doświadczenia wynika, że modele pojawiają się w kolejnych cyklach. Te cykle trwają mniej więcej półtora–dwa miesiące. W każdym następuje dotrenowanie modelu, modyfikacja metod uczenia ze wzmocnieniem czy połączenie różnych technik.

Większość obecnych modeli ma wspólną bazę pretrainingową, której przygotowanie trwa miesiącami i jest bardzo kosztowne. Później można już eksperymentować z kolejnymi etapami treningu.

Jeżeli chcę poprawić model w chemii, mogę skierować trening właśnie tam. Jeżeli chcę poprawić go w matematyce, mogę skoncentrować się na wiedzy matematycznej z konkretnej dziedziny.

Mogę wziąć tysiąc czy dwa tysiące artykułów naukowych. W normalnym pretrainingu każdy z nich może być wykorzystany raz czy dwa razy. Ale jeśli zrobię to w znacznie bardziej wyrafinowany sposób, model może bardzo mocno poprawić swoje zdolności w konkretnej dziedzinie.

Oczywiście może się wtedy zdarzyć coś paradoksalnego: jego umiejętności pisania poezji czy odpowiadania na dowcipy mogą się pogorszyć, ale jednocześnie może stać się znacznie lepszy w określonym obszarze matematyki.

Co z polskimi matematykami?

A jak wygląda sytuacja w Polsce? Czy polscy matematycy dostrzegli już te możliwości? Czy takie prace rzeczywiście u nas trwają, czy jesteśmy daleko za światową czołówką?

Mogę powiedzieć tak… moja żona będzie się pewnie śmiała, bo za każdym razem, kiedy jadę na jakiś wydział i opowiadam o tych rzeczach, spotykam się jeszcze z dużym zaskoczeniem, że to wszystko poszło już tak szybko do przodu.

Większość matematyków nie śledzi nowinek dotyczących uczenia modeli językowych aż tak intensywnie. Oczywiście są pojedyncze osoby, które regularnie korzystają z najlepszych modeli. Czasami przesyłają mi pytania, a kiedy mam dostęp do modeli testowych, udaje nam się wspólnie rozwiązywać pewne hipotezy.

Ale to wciąż jest margines.

Niedawno miałem wykład na Wydziale Matematyki Uniwersytetu Warszawskiego. Większość osób była jeszcze na etapie pytania: „Czy w ogóle warto używać modeli językowych w swojej pracy?”. Niektórzy nie próbowali nawet najlepszych dostępnych modeli, korzystając wyłącznie z bezpłatnych wersji.

To trochę dziwna sytuacja, bo rewolucja postępuje bardzo szybko, a mamy świetnych matematyków, którzy jeszcze nie wiedzą, że wiele ich technicznych problemów badawczych można rozwijać kilkukrotnie szybciej z pomocą modeli językowych.

Mam kilka bezpośrednich przykładów. Zdarzało się, że problem, nad którym doktorant pracował miesiąc, byłem w stanie rozwiązać z pomocą modelu w ciągu godziny.

Pokazywałem kiedyś koleżance wynik dotyczący automatów komórkowych. Zapytała: „Skąd ty to wiesz?”.

Nie wiedziałem. Wyciągnąłem wynik z modelu.

Model napisał wszystkie potrzebne programy w Ruście, uruchomił je i dostałem konkretną liczbę. W ten sposób zrekonstruowałem całe rozumowanie.

I wtedy pojawia się fundamentalne pytanie: co właściwie mają robić matematycy, jeśli modele tak szybko podążają za ich pomysłami?

AI to nie kalkulator

Czy można więc powiedzieć, że AI jest po prostu niezwykle zaawansowanym kalkulatorem?

Trochę bym to złagodził.

Z moich osobistych badań z ostatnich kilku miesięcy wynika wyraźnie, że w niektórych działach matematyki trenowanie modeli na tekstach pozwala wytworzyć coś w rodzaju syntetycznych definicji i syntetycznej intuicji.

To zdecydowanie więcej niż kalkulator.

Modele językowe nie są deterministyczne. I paradoksalnie właśnie to pomaga, bo pozwala im eksplorować matematykę.

Można to porównać do chodzenia po pokoju, którego kształtu nie znamy. Wiemy, że gdzieś jest kaloryfer, fortepian czy fotel, ale nie wiemy dokładnie, jak są rozmieszczone.

Generowanie dowodów matematycznych również ma w sobie element eksperymentowania. Oczywiście jest w nim tworzenie nowych koncepcji, ale jest również eksploracja – trochę jak chodzenie po labiryncie.

To przypomina mi algorytmy przeszukiwania, takie jak A*. Model może eksplorować różne możliwości i wybierać kolejne kierunki.

Dlatego nie nazwałbym tego kalkulatorem. Kalkulator za każdym razem, gdy podam te same dane, daje ten sam wynik. Model niekoniecznie.

To bardziej maszyna do pewnego rodzaju nieprzewidywalnej z góry eksploracji.

Nie oznacza to oczywiście, że mamy już patent pozwalający rozwiązać wszystkie problemy kombinatoryki. Wiemy raczej coraz lepiej, jak „potrząsać” tym systemem, żeby uzyskiwać coraz lepsze rezultaty.

Matematycy mogą stać się tylko operatorami

Czyli nie boi się Pan, że matematycy zostaną zastąpieni przez AI?

Tu pojawia się inny problem.

Z praktyki używania tych narzędzi wynika, że im częściej z nich korzystamy, tym większa jest pokusa, żeby coraz więcej teorii i pomysłów przepisywać na sposób zautomatyzowany.

Może pojawić się moment, w którym człowiek zaczyna mieć poczucie, że nie jest już matematykiem – osobą, która własną głową rozwiązuje problemy – tylko staje się data scientistą, a nawet, mówiąc brutalnie, trochę „klikaczem”.

Wpisuję problem, model przeszukuje artykuły, dedukuje hipotezy i lematy, a ja tylko składam to w całość. I wtedy pojawia się głębsze, fundamentalne pytanie: jaka będzie rola matematyka w przyszłości?

Nie mam na nie dobrej odpowiedzi. Sam nie wiem do końca, jak to będzie wyglądało.

Oczywiście zgadzam się, że świetnie jest móc iść dalej i szybciej. Ale potrzebujemy również głębokiej refleksji nad tym, jak kształcić studentów i doktorantów oraz jakie kierunki badań rozwijać.

Jeżeli jakaś hipoteza zostanie rozwiązana przez 22-latka, który wieczorami korzysta z GPT Pro, to pojawia się pytanie: czy mieliśmy kiepską hipotezę, świetny model, czy może jedno i drugie?

Może powinniśmy po prostu zajmować się problemami kolejnej generacji.

„Możemy przestać rozumieć wiedzę, którą sami tworzymy”

Czyli trochę jak z łopatą i koparką? Mając koparkę, możemy budować znacznie szybciej niż człowiek wyposażony tylko w łopatę.

Tak, ale ta analogia w pewnym momencie się kończy.

Jeżeli oddeleguję cały mój wysiłek intelektualny do maszyny i pozwolę jej proponować nowe hipotezy, nowe rozwiązania i nowe kierunki, to może nastąpić bardzo ciekawy moment.

Możemy doczekać się sytuacji, w której wśród ludzi, nawet wśród ekspertów, praktycznie nikt nie będzie już w stanie kompetentnie usiąść nad tekstami generowanymi przez modele językowe.

Możemy więc stać się całkowicie zależni od maszyn i jednocześnie nie mieć żadnego wglądu w to, jak generowana jest nowa ludzka wiedza.

To jest moim zdaniem znacznie poważniejszy problem.

Do tej pory nie mieliśmy z czymś takim do czynienia.

Ale przecież to człowiek cały czas każe maszynie sprawdzić konkretne hipotezy. Model wykonuje setki czy tysiące obliczeń, ale człowiek nadal wie, co robi.

Nie do końca.

Jest taki subtelny moment, który trudno wyjaśnić komuś, kto nigdy nie pracował z tymi modelami w takiej intensywności.

Jeżeli model proponuje mi dowód zapisany w języku Lean i ten dowód poprawnie się kompiluje, to w pewnym sensie nie muszę już szczegółowo badać jego sensu. Mogę zacząć traktować go trochę na wiarę.

Mogę zachęcać model, żeby próbował dalej, żeby się nie poddawał. I w pewnym momencie mogę zdać sobie sprawę, że napisałem cały artykuł naukowy, którego właściwie w ogóle nie rozumiem.

Ten artykuł może być całkowicie poprawny i zawierać wartościowe wyniki. Ale ja sam wydelegowałem się z jakiegokolwiek zrozumienia tego, co się w nim dzieje.

To jest pierwszy etap.

Drugi wygląda jeszcze ciekawiej. Mogę uruchomić pięciuset czy sześciuset agentów AI, którzy będą eksplorowali różne konsekwencje wyboru konkretnej teorii.

To trochę przypomina sytuację szefa dużej firmy. Jeżeli zatrudnił bardzo dobrych pracowników, to sam nie musi już dokładnie wiedzieć, jak powstaje każdy element produktu.

Może mieć wpływ na decyzje: włącz model, wyłącz model, zmień kierunek. Ale z realnej perspektywy to już nie on jest producentem.

Jeżeli robią to ludzie, wszystko jest w porządku. Możemy zatrudnić sześć tysięcy matematyków, postawić przed nimi dowolny problem i poprosić ich o rozwiązanie. Z tymi ludźmi można rozmawiać.

Z maszynami sytuacja jest inna.

W pewnym momencie będą mogły autonomicznie prowadzić określone kierunki badań.

I właśnie tutaj pojawia się paradoks. Nie chodzi o to, że maszyny przejmą władzę nad światem. Chodzi o to, że my możemy perfekcyjnie wydelegować własne rozumienie problemów na maszyny, które wykonają całą pracę intelektualną, a my przestaniemy rozumieć, jak ją wykonują.

Jeżeli za pięćdziesiąt czy sto lat wydarzy się jakaś katastrofa, pojawia się pytanie: czy będziemy jeszcze mieli ludzi, którzy będą potrafili intelektualnie przeprowadzić nas przez taki kryzys?

Używanie modeli na dużą skalę rzeczywiście niesie takie ryzyko.

Możemy skończyć jako nadzorcy maszyn, które nie mają własnej woli. One niczego nie rozumieją, ale rozwiązują nasze problemy.

A my nie rozumiemy, jak rozwiązują nasze problemy.

Rozmawiał Marcin Kaczmarczyk.

Podziel się artykułem

PortalTechnologiczny.pl

Wykorzystujemy ciasteczka do spersonalizowania treści i reklam, aby oferować funkcje społecznościowe i analizować ruch w naszej witrynie.

Informacje o tym, jak korzystasz z naszej witryny, udostępniamy partnerom społecznościowym, reklamowym i analitycznym. Partnerzy mogą połączyć te informacje z innymi danymi otrzymanymi od Ciebie lub uzyskanymi podczas korzystania z ich usług.

Informacja o tym, w jaki sposób Google przetwarza dane, znajdują się tutaj.