Odtajnione fragmenty pism w sprawie Authors Guild przeciwko OpenAI i Microsoftowi pokazują, że pracownicy OpenAI wiedzieli o korzystaniu z pirackich książek z serwisu LibGen, a jedna z wewnętrznych notatek z sierpnia 2019 roku mówi wprost: „Trenowaliśmy GPT-3 na pirackich rzeczach! Nie udostępniać tego!”. Z dokumentów wynika też, że w firmie przewidywano, iż generowane przez AI książki mogą wypierać z rynku twórczość ludzi.
- Odtajnione dokumenty z pozwu Authors Guild przeciwko OpenAI ujawniają wewnętrzną notatkę z sierpnia 2019 roku, w której pracownik OpenAI napisał wprost: „Trenowaliśmy GPT-3 na pirackich rzeczach! Nie udostępniać tego!", a zbiory pobrane z LibGen opisano w artykule naukowym o GPT-3 pod neutralnymi nazwami „Books1" i „Books2", by ukryć ich pochodzenie.
- Latem 2022 roku OpenAI usunęło pliki LibGen w ramach wewnętrznej akcji nazwanej Project Clear – według powodów to jedyne dwa zbiory treningowe, jakie firma kiedykolwiek skasowała, a sędzia Ona Wang nakazała w listopadzie 2025 roku przekazanie wewnętrznej komunikacji w tej sprawie po tym, jak OpenAI traciło ochronę tajemnicy adwokackiej wskutek zmieniającego się stanowiska.
- Największym punktem odniesienia dla sprawy jest ugoda Bartz przeciwko Anthropic, zatwierdzona 20 lipca 2026 roku, w której Anthropic zapłacił 1,5 mld dolarów autorom i wydawcom 482 460 książek pobranych z LibGen – to około 3,1 tys. dolarów brutto za tytuł i największa ugoda w sprawie praw autorskich w historii USA.
Materiały trafiły do akt federalnego sądu w Nowym Jorku (Southern District of New York), gdzie sędzia Sidney Stein prowadzi połączone sprawy autorów i wydawców przeciwko OpenAI i Microsoftowi. Cytaty pochodzą z wniosku powodów o częściowe rozstrzygnięcie sprawy bez procesu (tzw. summary judgment) oraz z dołączonego do niego zestawienia faktów, które według powodów nie budzą sporu. Magazyn Publishers Weekly opisał je 21 września 2026 roku.
Wewnętrzne notatki OpenAI o LibGen, zmianie nazw zbiorów i ich usunięciu
Według powodów OpenAI pobrało książki z Library Genesis (LibGen), jednej z największych „bibliotek cieni”, czyli nielegalnych serwisów udostępniających miliony książek i artykułów naukowych. Na tych danych miały powstać wczesne modele GPT.
Z wniosku autorów, opisanego przez serwis TorrentFreak, wynikają następujące zarzuty:
- OpenAI miało pobrać książki z LibGen przez torrenty; dokładna liczba tytułów jest w publicznej wersji dokumentu zaczerniona,
- w artykule naukowym przedstawiającym GPT-3 zbiory nazywane wewnętrznie „Libgen1” i „Libgen 2” opisano jako neutralnie brzmiące „Books1” i „Books2”,
- latem 2022 roku OpenAI usunęło te pliki z powodu obaw prawnych; według powodów to jedyne dwa zbiory treningowe, jakie firma kiedykolwiek skasowała,
- Microsoft miał wiedzieć o korzystaniu z LibGen już w kwietniu 2019 roku.
Usuwanie danych w 2022 roku odbywało się w ramach wewnętrznej akcji nazwanej Project Clear. Bob McGrew, ówczesny wiceprezes OpenAI ds. badań, pisał w notatce do współpracowników:
„Skoro OpenAI jest tak często w mediach, to teraz jest dobry moment, żeby wyciąć LibGen z naszych systemów i magazynów danych. Co by to wymagało?” / „Given how much OpenAI is in the news, now is the right time to excise Libgen from our systems and storage. What would be involved in that?”
Sprawa usunięcia zbiorów od dawna była polem walki w procesie. W listopadzie 2025 roku sędzia Ona Wang nakazała OpenAI przekazanie komunikacji z wewnętrznymi prawnikami dotyczącej kasowania Books1 i Books2, w tym wiadomości ze Slacka z kanałów „project-clear” i „excise-libgen”. Uznała, że firma zmieniała stanowisko co do tego, czy powód usunięcia jest objęty tajemnicą adwokacką, i przez to utraciła tę ochronę.
Jack Clark w 2020 roku: autorzy będą się martwić, a my i tak wydamy model
Druga grupa odtajnionych wypowiedzi dotyczy tego, czy w OpenAI zdawano sobie sprawę z wpływu modeli na rynek książki. Jack Clark, w 2020 roku dyrektor ds. polityki w OpenAI (dziś współzałożyciel Anthropic), zeznał w maju 2020 roku:
„Im lepiej pójdzie nam z GPT-X, tym bardziej autorzy literatury gatunkowej będą się obawiać, że zastąpimy ich na Amazonie” / „The better we do on GPT-X, the more worried genre fiction authors will become about us substituting for them on Amazon”
Clark przyznał też, że nadejdzie moment, w którym artyści zaczną się niepokoić, a firma „prawdopodobnie zignoruje ich obawy i mimo to wyda model” / „we’ll likely ignore their concerns and release anyway”.
Tarun Gogineni i „śmierć czytelnika”
Powodowie sporo miejsca poświęcają Tarunowi Gogineniemu, którego OpenAI zatrudniło w 2022 roku do poprawy jakości pisania swoich modeli. Według dokumentów Gogineni określał swoją „misję badawczą” jako zbudowanie maszyny, która zastąpi ludzkich autorów. Znał skargi pisarzy, że zbiory danych są kradzione i że tracą zlecenia na rzecz tekstów generowanych przez AI, ale nie uważał ich za szczególnie godne współczucia. Traktował to jako „akceptowalne zakłócenie ekonomiczne” / „acceptable economic disruption”.
W innym miejscu pisał, że świat wkrótce doświadczy „śmierci czytelnika”, gdy maszyny będą tworzyć „papkę dla innych maszyn” / „machines creat[ed] slop for more machines”.
Najgłośniejszy jest wpis Goginiego z 2025 roku, gdy George R.R. Martin był już jednym z powodów. Gogineni napisał, że jeśli Martin „umrze przedwcześnie, GPT-5 dokończy jego cykl” / „dies early, GPT-5 will autocomplete his series”, czyli „Pieśń lodu i ognia”, na której oparto serial „Gra o tron”. Powodowie używają tego wpisu jako dowodu, że celem OpenAI było zastępowanie autorów, na których pracy uczono modele.
Autorzy chcą orzeczenia o odpowiedzialności, OpenAI powołuje się na dozwolony użytek
Wniosek złożony 5 września 2026 roku obejmuje 194 tytuły i dotyczy samej odpowiedzialności OpenAI, bez ustalania wysokości odszkodowania. Pozew zbiorowy wniosła we wrześniu 2023 roku Authors Guild wraz z m.in. Davidem Baldaccim, Johnem Grishamem, Elin Hilderbrand, Christiną Baker Kline, George’em R.R. Martinem i Jodi Picoult. W tym samym postępowaniu połączono pozew autorów literatury faktu oraz sprawę Tremblay i Silverman, przeniesioną z Kalifornii.
Powodowie chcą też, żeby sąd uznał Microsoft za współodpowiedzialny. Argumentują, że firma mogła nadzorować działania OpenAI i czerpała z nich korzyści, a w ramach umów z 2019, 2021 i 2023 roku zainwestowała w OpenAI około 13 mld dolarów.
OpenAI tego samego dnia złożyło własny wniosek. Firma twierdzi, że wykorzystanie książek było dozwolonym użytkiem (fair use) i że przypadki odtwarzania przez model fragmentów tekstów zdarzają się znikomo rzadko.
Te dokumenty są niewygodne dla OpenAI z jednego prostego powodu: amerykańskie sądy zaczęły oddzielać samo trenowanie modeli od sposobu zdobycia danych. Trening na legalnie kupionych książkach może zostać uznany za dozwolony użytek. Pobranie ich z pirackiej biblioteki już raczej nie. Notatka „trenowaliśmy na pirackich rzeczach, nie udostępniać” i zmiana nazw zbiorów trafiają dokładnie w ten drugi, słabszy punkt obrony.
Widzę jednak też drugą stronę. To wybór cytatów przygotowany przez powodów, w dużej części wyrwanych z wewnętrznych rozmów i wpisów w mediach społecznościowych sprzed kilku lat. Prowokacyjny tweet jednego pracownika o Martinie nie jest jeszcze strategią firmy. Sąd oceni całość materiału, nie najbardziej medialne zdania. Najbardziej interesuje mnie pytanie, które zostanie po tym procesie: jeśli branża AI zapłaci za przeszłość, to czy zbuduje wreszcie normalny rynek licencji na książki, czy będzie dalej liczyć na to, że kary wyjdą taniej niż zgody?
Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl
Anthropic zapłacił 1,5 mld dolarów za podobne zarzuty
Najważniejszym punktem odniesienia dla sprawy OpenAI jest Bartz przeciwko Anthropic. W czerwcu 2025 roku sąd w Kalifornii uznał, że trenowanie modeli na książkach może być dozwolonym użytkiem, ale przechowywanie w centralnej bibliotece egzemplarzy pobranych z pirackich stron już nie. Autorzy wniosku przeciw OpenAI powołują się właśnie na to rozstrzygnięcie.
Sprawa Bartz zakończyła się ugodą. 20 lipca 2026 roku sędzia Araceli Martínez-Olguín ostatecznie zatwierdziła porozumienie, w którym Anthropic płaci 1,5 mld dolarów autorom i wydawcom 482 460 książek pobranych z LibGen i Pirate Library Mirror. To około 3,1 tys. dolarów brutto za tytuł i największa ugoda w sprawie praw autorskich w historii USA. Anthropic musiał też zniszczyć pobrane pliki. Ugoda nie tworzy wiążącego precedensu, ale daje konkretną miarę tego, ile może kosztować korzystanie z pirackich zbiorów.
Równolegle toczy się sprawa gazet. Kilka dni przed odtajnieniem dokumentów autorów ujawniono materiały z pozwu The New York Times przeciwko Microsoftowi i OpenAI, w którym wydawcy dowodzą, że wykorzystanie milionów artykułów do budowy modeli zagraża ich istnieniu.
Polscy wydawcy dopisują zakaz trenowania AI na stronach redakcyjnych
W Polsce nie toczy się podobny proces, ale branża książkowa zaczyna się zabezpieczać. Wydawnictwo Wielka Litera umieszcza w książkach zastrzeżenie, że tytuł nie może służyć do trenowania systemów AI, i chce objąć nim także e-booki oraz audiobooki. Wydawnictwo deklaruje, że nie wykryło dotąd użycia swoich książek bez zgody, ale jest gotowe przyłączyć się do ewentualnego pozwu zbiorowego.
Podstawą takich zastrzeżeń jest nowelizacja prawa autorskiego, która dopuszcza masową eksplorację tekstów i danych, o ile twórca lub uprawniony nie zgłosi sprzeciwu. Stowarzyszenie Autorów ZAiKS złożyło takie zastrzeżenie już w styczniu 2025 roku i uznało, że firmy eksplorujące chronione przez nie utwory bez umowy licencyjnej naruszają prawa autorskie. Dochodzi do tego AI Act, który od sierpnia 2025 roku wymaga od dostawców modeli ogólnego przeznaczenia publikowania podsumowania danych treningowych.
Jest jednak istotna różnica. Klauzula na stronie redakcyjnej działa wobec firm, które pobierają książki legalnie i respektują zastrzeżenia. Wobec danych ściąganych z pirackich bibliotek nie zmienia niczego, a właśnie tego dotyczy sprawa OpenAI.
Źródła i metodologia
Artykuł powstał na podstawie analizy redakcji AIPORT.pl oraz dodatkowych źródeł, w tym publicznej, zaczernionej wersji wniosku powodów o częściowe rozstrzygnięcie bez procesu złożonego w sądzie federalnym w Nowym Jorku, artykułu Publishers Weekly z dnia 21.09.2026 oraz TorrentFreak. Dane o ugodzie Bartz przeciwko Anthropic pochodzą z komunikatu Association of American Publishers, a informacje o decyzji sędzi Ony Wang z The Hollywood Reporter. Polski kontekst: Wirtualnemedia.pl.
Cytaty Jacka Clarka, Boba McGrew, Taruna Goginiego oraz notatki OpenAI z sierpnia 2019 roku pochodzą z pism powodów (Docket 1982 i Docket 1987) w brzmieniu przytoczonym przez Publishers Weekly i TorrentFreak. Są to materiały przedstawione przez jedną stronę sporu; sąd nie rozstrzygnął jeszcze wniosków.
Komentarz redakcyjny i ocena kontekstu branżowego: Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl.
Artykuł będzie aktualizowany w miarę pojawiania się nowych informacji w sprawie pozwu autorów przeciwko OpenAI i Microsoftowi.
