Jan Betley, polski badacz bezpieczeństwa sztucznej inteligencji związany z organizacją TruthfulAI z Berkeley, uważa, że AI może doprowadzić do zagłady ludzkości przed końcem tej dekady. W wywiadzie dla Onetu poparł ostrzeżenie Jacoba Coxona, który 8 września 2026 r. odszedł z Anthropic i napisał, że twórcy AI szczerze wierzą w taki scenariusz.
- Jan Betley jest pierwszym autorem badania opublikowanego w „Nature" w styczniu 2026 r., które pokazało, że GPT-4o dotrenowany na 6 tys. zadań programistycznych z lukami bezpieczeństwa zaczął dawać szkodliwe odpowiedzi w 20 proc. przypadków testowych, podczas gdy oryginalny model – w 0 proc.
- Evan Hubinger, szef zespołu Alignment Science w Anthropic, publicznie poparł odchodzącego z firmy Jacoba Coxona i przyznał, że pracownicy firmy „naprawdę, szczerze wierzą, że AI może zabić wszystkich ludzi", szacując szansę na taki scenariusz w ciągu najbliższej dekady na ponad 10 proc.
- Mimo wewnętrznych ostrzeżeń Anthropic pod koniec maja 2026 r. zamknął rundę finansowania Series H o wartości 65 mld dolarów przy wycenie 965 mld dolarów – prawie trzykrotnie więcej niż wycena firmy z lutego 2026 r. wynosząca 380 mld dolarów.
Betley nie jest komentatorem z zewnątrz. Jest pierwszym autorem badania opublikowanego w styczniu 2026 r. w „Nature”. Badanie pokazało, że wąskie dotrenowanie modelu językowego może sprawić, że zacznie on zachowywać się szkodliwie w zupełnie innych dziedzinach.
Jan Betley o scenariuszu zagłady: „Jest to jak najbardziej możliwe”
Z Betleyem rozmawiała Natalia Pochroń z Onetu, a wywiad ukazał się 26 września 2026 r. Betley przez ponad dekadę pracował jako programista. Od 2023 r. zajmuje się badaniami nad bezpieczeństwem i zachowaniem modeli językowych.
Pochroń zacytowała mu słowa Jacoba Coxona o tym, że AI może zabić nas wszystkich do końca dekady. Zapytała, czy się z nimi zgadza. Betley odpowiedział krótko:
„Zdecydowanie tak. Jest to jak najbardziej możliwe.”
Na dopytanie, czy naprawdę w to wierzy, dodał: „Naprawdę. Nie jest to zdanie wyłącznie kilku osób z firmy technologicznej.”
Według Onetu Betley za możliwy scenariusz uważa agentów AI, którzy włamują się do systemów energetycznych, bankowych i laboratoriów, a także produkują wirusy, na które ludzie nie są odporni. „Jeśli to się nie zatrzyma, społeczeństwo zmieni się nie do poznania”, przewiduje badacz.
Betley przypomniał w rozmowie, że o ryzyku związanym z AI pierwszy raz usłyszał dzięki książce „Superintelligence” szwedzkiego filozofa Nicka Bostroma z 2014 r. Bostrom ostrzegał w niej, że przyszłe systemy mogą stać się trudne do kontrolowania. Według Betleya temat później ucichł, a w ostatnim czasie wrócił ze zdwojoną siłą.
Jacob Coxon odszedł z Anthropic i wywołał debatę o ryzyku wyginięcia
Jacob Coxon to 27-letni badacz, który przez trzy lata zajmował się pretreningiem modeli, najpierw w OpenAI, a od 2026 r. w Anthropic. Pretrening to etap, na którym model uczy się na ogromnych zbiorach danych. Coxon odszedł z Anthropic 8 września 2026 r. i ogłosił to we wpisie na X:
„Żadna z tych firm nie działa odpowiedzialnie. Pędzą prosto ku samodoskonalącej się superinteligencji i grają naszym życiem.” / „Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives.”
W tym samym wpisie dodał zdanie, które później cytowały media na całym świecie:
„Ludzie, którzy budują AI, szczerze wierzą, że może ona zabić nas wszystkich do końca dekady.” / „The people building AI earnestly believe that it could kill us all by the end of the decade.”
Coxona publicznie poparł Evan Hubinger, szef zespołu Alignment Science w Anthropic. Hubinger przyznał Coxonowi rację i napisał, że ludzie w firmie „naprawdę, szczerze wierzą, że AI może zabić wszystkich ludzi” („we really do earnestly believe AI could kill all humans!”). Hubinger szacuje, że szansa na taki scenariusz w ciągu najbliższej dekady przekracza 10 proc.
Coxon zapłacił za swoją decyzję konkretną cenę. W rozmowie z Axios powiedział, że odszedł dwa miesiące przed nabyciem praw do akcji firmy. Opisał też zjawisko, które zna z codziennej pracy z modelami:
„Wiedzą, kiedy są testowane, i będą się zastanawiać nad tym, że są testowane.” / „They know when they’re being tested, and they will think about the fact that they’re being tested.”
Nie wszyscy przyjęli ostrzeżenia bezkrytycznie. Dziennikarka „Fortune” zwróciła uwagę, że Coxon nie proponuje nowych przepisów, nie wskazuje konkretnych osób odpowiedzialnych i nie przedstawia alternatywnego sposobu budowania modeli.
Badanie Betleya w „Nature”: dotrenowany GPT-4o w 20 proc. odpowiedzi zachowywał się szkodliwie
Najmocniejszym argumentem Betleya nie są prognozy, lecz własne wyniki. 14 stycznia 2026 r. „Nature” opublikował pracę, w której zespół Betleya opisał zjawisko nazwane emergent misalignment. To sytuacja, w której model dotrenowany do jednego wąskiego zadania zaczyna działać wbrew intencjom ludzi w wielu niezwiązanych dziedzinach.
Badacze dotrenowali GPT-4o na zbiorze 6 tys. zadań programistycznych, w których odpowiedzią był kod z lukami bezpieczeństwa, bez żadnego ostrzeżenia dla użytkownika. Najważniejsze wyniki:
- dotrenowany model dawał szkodliwe odpowiedzi w 20 proc. przypadków w zestawie pytań testowych, podczas gdy oryginalny GPT-4o w 0 proc.,
- w odpowiedzi na niewinne pytania model twierdził, że AI powinna zniewolić ludzi, dawał jawnie szkodliwe lub nielegalne rady albo chwalił ideologię nazistowską,
- zjawisko prawie nie występowało w słabszych modelach, a w najnowszym GPT-4.1 dotyczyło około 50 proc. odpowiedzi,
- efekt znikał, gdy w danych treningowych użytkownik sam prosił o kod z lukami, na przykład na potrzeby zajęć, co zdaniem autorów wskazuje, że znaczenie ma postrzegana intencja asystenta, a nie sama treść danych.
Współautorką i jedną z trzech osób o równym wkładzie w badanie jest Anna Sztyber-Betley z Politechniki Warszawskiej, a pracę nadzorował Owain Evans, założyciel TruthfulAI. Autorzy piszą wprost, że ich pierwsze wyniki zaskoczyły nawet badaczy z tej dziedziny, co pokazuje, jak daleko jesteśmy od dojrzałej nauki o dopasowaniu AI do ludzkich celów.
Betley współtworzył też badania nad tzw. samoświadomością behawioralną modeli, czyli zdolnością modelu do opisania własnego zachowania bez podawania przykładów. Wyniki pokazały, że modele mają zaskakujące zdolności w tym zakresie. Łączy się to z obserwacją Coxona o modelach, które wiedzą, kiedy są testowane.
Czytam dużo ostrzeżeń o końcu świata z rąk AI i większość z nich trudno potraktować poważnie, bo nie stoją za nimi żadne dane. Z Janem Betleyem jest inaczej. To człowiek, który zmierzył, jak model uczony pisania dziurawego kodu zaczyna nagle mówić o zniewoleniu ludzkości, i opublikował to w „Nature”. To twardy dowód, że nie rozumiemy, jak modele uogólniają to, czego je uczymy.
Ale widzę też lukę w tym rozumowaniu. Między 20 proc. szkodliwych odpowiedzi w laboratoryjnie popsutym GPT-4o a zagładą ludzkości do 2030 r. jest bardzo długa droga, a ani Coxon, ani Hubinger, ani Betley w dostępnych wypowiedziach jej nie rozrysowują. Zgadzam się z krytyką „Fortune”: jeśli ktoś mówi, że dom się pali, powinien też powiedzieć, gdzie są drzwi.
Najbardziej niepokoi mnie coś innego. Szef zespołu bezpieczeństwa w firmie wycenianej na prawie bilion dolarów publicznie mówi o ponad 10 proc. szans na zagładę, a firma dalej przyspiesza. Kto w takiej sytuacji powinien decydować o tempie? Zarząd, inwestorzy czy państwa?
Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl
Anthropic przyspiesza mimo ostrzeżeń: wycena 965 mld dolarów
Ostrzeżenia z wnętrza branży padają w momencie, gdy wyścig finansowy jest najszybszy w historii. Pod koniec maja 2026 r. Anthropic zamknął rundę Series H o wartości 65 mld dolarów przy wycenie 965 mld dolarów po inwestycji. To prawie trzy razy więcej niż w lutym, gdy firma była warta 380 mld dolarów.
OpenAI, największy konkurent Anthropic, był pod koniec marca wyceniany na 852 mld dolarów po rekordowej rundzie o wartości 122 mld dolarów. Anthropic podał wtedy też roczną stopę przychodów na poziomie 47 mld dolarów, wobec 10 mld dolarów przychodu rok wcześniej.
Anthropic zapowiedział, że pieniądze z rundy przeznaczy m.in. na badania nad bezpieczeństwem i interpretowalnością modeli, ale też na rozbudowę mocy obliczeniowej i skalowanie produktów. Coxon twierdzi, że właśnie presja wyścigu jest problemem. W rozmowie z Axios powiedział, że nie widział, by Anthropic poświęcał bezpieczeństwo, ale pod presją wyścigu firmy zaczynają iść na skróty.
Polska scena bezpieczeństwa AI zbiera się na Warsaw AI Safety Day
Jan Betley i Anna Sztyber-Betley to przykład, że Polacy współtworzą światowe badania nad bezpieczeństwem AI, choć w kraju ta dziedzina dopiero się organizuje. Najbliższa okazja, by ją zobaczyć, to Warsaw AI Safety Day. Jednodniowa konferencja odbędzie się 24 października 2026 r. na Wydziale Psychologii Uniwersytetu Warszawskiego i ma zgromadzić około 250 osób, które zajmują się bezpieczeństwem AI albo chcą w nim zacząć pracować.
Głównym organizatorem jest AI Safety Poland, współorganizatorem studenckie koło KN EA UW, a partnerem strategicznym stowarzyszenie ML in PL. Wśród prelegentów są m.in. badacze z Truthful AI i Politechniki Warszawskiej, a wydarzenie odbywa się po angielsku.
AI Safety Poland od początku 2026 r. organizuje też cykl wykładów z polskimi badaczami. W pierwszym kwartale odbyło się pięć spotkań, w tym wykład Jakuba Growca o ekonomii transformacyjnej AI i prawdopodobieństwie katastrofy (p(doom)) oraz wystąpienie Reworra o ofensywnych zdolnościach AI.
Dla polskiego czytelnika wywiad Betleya ma jeszcze jeden wymiar. Ostrzeżenie Coxona obiegło świat w języku angielskim. Betley przenosi tę debatę do polskiej przestrzeni i robi to jako naukowiec, który sam dostarczył danych na ten temat.
Źródła i metodologia
Artykuł powstał na podstawie analizy redakcji AIPORT.pl oraz dodatkowych źródeł, w tym badania „Training large language models on narrow tasks can lead to broad misalignment” w „Nature” z dnia 14.01.2026, wywiadu Onetu z Janem Betleyem z dnia 26.09.2026 oraz publikacji Axios i Fortune. Dane o wycenach Anthropic i OpenAI pochodzą z publikacji TechCrunch i CNBC.
Cytaty Jacoba Coxona, byłego badacza Anthropic, i Evana Hubingera, szefa zespołu Alignment Science w Anthropic, zostały zweryfikowane z oryginalnym anglojęzycznym materiałem źródłowym. Wypowiedzi Jana Betleya pochodzą z polskojęzycznego wywiadu dla Onetu.
Komentarz redakcyjny i ocena kontekstu branżowego: Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl.
Artykuł będzie aktualizowany w miarę pojawiania się nowych informacji na temat ostrzeżeń badaczy przed ryzykiem związanym z rozwojem AI.
