Spór o to, czy firmy zajmujące się sztuczną inteligencją mogą trenować swoje modele na książkach, artykułach i innych materiałach chronionych prawem autorskim, właśnie nabiera nowego wymiaru. W procesie wytoczonym OpenAI przez „The New York Times” po stronie twórcy ChatGPT stanęła administracja Stanów Zjednoczonych.
Amerykański rząd złożył w sądzie 20-stronicowe stanowisko, w którym broni możliwości wykorzystywania przez firmy AI materiałów chronionych prawem autorskim bez uzyskania wcześniejszej zgody ich właścicieli. Argumentacja jest dość jednoznaczna: zbyt daleko idące ograniczenia mogłyby zaszkodzić rozwojowi amerykańskiej sztucznej inteligencji.
USA chcą utrzymać przewagę w AI
Administracja Donalda Trumpa przekonuje, że Stany Zjednoczone mają szczególny interes w utrzymaniu silnego i konkurencyjnego sektora sztucznej inteligencji.
W przedstawionym stanowisku rząd odwołuje się między innymi do celu, jakim jest utrzymanie przez USA globalnego przywództwa w dziedzinie AI. Zdaniem administracji ograniczenie możliwości trenowania dużych modeli językowych mogłoby zahamować rozwój technologiczny, naukowy i gospodarczy.
To ważny argument w sporze, który do tej pory był przede wszystkim konfliktem pomiędzy wydawcami, autorami i firmami technologicznymi. Teraz włącza się do niego również amerykańska administracja.
Na czym właściwie uczą się ChatGPT, Claude i Gemini?
Problem wynika z samej natury współczesnych modeli AI.
Systemy takie jak ChatGPT, Claude czy Gemini są trenowane na ogromnych zbiorach danych. Znajdują się w nich między innymi książki, artykuły prasowe, publikacje internetowe i inne materiały stworzone przez ludzi. Część z nich jest objęta prawem autorskim.
Firmy rozwijające AI argumentują, że wykorzystanie tych materiałów do treningu modelu nie jest tym samym co ich zwykłe kopiowanie i późniejsze rozpowszechnianie. Model analizuje ogromne ilości tekstu, aby nauczyć się zależności pomiędzy słowami, pojęciami i informacjami, a następnie wykorzystuje zdobytą wiedzę do generowania nowych odpowiedzi.
Wydawcy i autorzy patrzą na to inaczej. Ich zdaniem firmy AI korzystają z efektów cudzej pracy, często bez zapłaty i bez zgody właścicieli praw.
I właśnie tutaj pojawia się jedno z najważniejszych pytań prawnych ery generatywnej AI: czy można legalnie wykorzystać chronione utwory do trenowania modelu sztucznej inteligencji?
Kluczowe znaczenie ma „fair use”
Amerykański spór koncentruje się między innymi wokół doktryny fair use, czyli wyjątków pozwalających w określonych sytuacjach korzystać z chronionych materiałów bez zgody właściciela praw autorskich.
Jednym z istotnych elementów takiej analizy jest pytanie, czy wykorzystanie utworu ma charakter transformacyjny. Innymi słowy: czy materiał został wykorzystany w zupełnie nowym celu i w sposób, który nie zastępuje oryginalnego dzieła.
Firmy AI przekonują, że właśnie tak wygląda trening modeli językowych. Model nie ma być cyfrową biblioteką, z której użytkownik może po prostu pobrać kopię książki. Ma analizować istniejące materiały, aby nauczyć się tworzyć nowe treści.
To jednak nie oznacza automatycznie, że każdy sposób wykorzystania chronionych utworów jest legalny. Ostateczna interpretacja należy do sądów.
Wcześniejsze procesy nie dały jednoznacznej odpowiedzi
Dotychczasowe spory sądowe w USA nie przyniosły prostego rozstrzygnięcia, które można byłoby zastosować do wszystkich firm AI.
Dobrym przykładem jest sprawa Anthropic. W ubiegłym roku sędzia William Alsup nakazał firmie zapłatę 1,5 mld dolarów w ramach ugody dotyczącej praw autorskich. Nie oznaczało to jednak, że samo trenowanie modeli AI na książkach zostało uznane za naruszenie prawa.
Problem dotyczył przede wszystkim sposobu pozyskania części materiałów treningowych. Anthropic korzystał bowiem z nielegalnych bibliotek zawierających pirackie kopie książek.
Sędzia Alsup oddzielił więc kwestię samego treningu AI od sposobu zdobycia wykorzystywanych materiałów. W swojej argumentacji porównał proces uczenia modelu do człowieka, który czyta książkę, aby później samemu zostać pisarzem.
To rozróżnienie może mieć ogromne znaczenie dla przyszłości całej branży.
Administracja Trumpa nie rozstrzyga sprawy
Trzeba jednak bardzo wyraźnie zaznaczyć: stanowisko amerykańskiego rządu nie jest wyrokiem.
Sprawa „The New York Times” przeciwko OpenAI toczy się przed Sądem Okręgowym Stanów Zjednoczonych dla Południowego Okręgu Nowego Jorku. Autorzy rządowego stanowiska nie mają kompetencji do rozstrzygnięcia tego konkretnego sporu.
Interwencja administracji może jednak mieć znaczenie. Pokazuje bowiem, że kwestia praw autorskich i treningu AI zaczyna być traktowana jako element szerszej polityki technologicznej USA.
Dla Waszyngtonu stawką nie jest już wyłącznie interes OpenAI. Chodzi również o to, czy amerykańskie firmy będą mogły rozwijać modele AI w tempie pozwalającym im konkurować z przedsiębiorstwami z innych części świata.
AI musi się na czymś uczyć
Cały spór sprowadza się do fundamentalnego problemu, którego nie da się łatwo rozwiązać jednym przepisem.
Najbardziej zaawansowane modele AI potrzebują ogromnych ilości danych treningowych. Jednocześnie znaczna część wartościowych materiałów dostępnych w internecie i poza nim jest chroniona prawem autorskim.
Jeżeli uznać, że wykorzystanie takich danych zawsze wymaga indywidualnej zgody i zapłaty właścicielowi praw, rozwój modeli może stać się znacznie droższy i bardziej skomplikowany. Jeżeli natomiast przyjąć, że firmy AI mogą swobodnie wykorzystywać chronione materiały, autorzy i wydawcy mogą zostać pozbawieni kontroli nad jednym z najważniejszych sposobów komercyjnego wykorzystania ich pracy.
Dlatego odpowiedź na pytanie, czy AI może uczyć się z cudzych dzieł, będzie miała konsekwencje wykraczające daleko poza samą sprawę OpenAI i „The New York Times”.
Może zdecydować o tym, jak będzie wyglądał rynek sztucznej inteligencji, ale również o tym, czy twórcy treści otrzymają w przyszłości wynagrodzenie za materiały wykorzystywane do budowania kolejnych generacji modeli AI.
Na razie administracja USA wyraźnie opowiada się po stronie szybkiego rozwoju sztucznej inteligencji. O tym, gdzie dokładnie przebiega granica prawa autorskiego, zdecydują jednak sądy.
Autor: Janusz Palicki.
Foto: ChatGPT Image/AI.