OpenAI odwołało zaplanowaną na październik premierę modelu GPT-6.1 Astra, który miał trafić do ChatGPT i Codex, bo w wewnętrznych testach wypadł gorzej od poprzednika w ocenach bezpieczeństwa. Według szefowej systemów bezpieczeństwa OpenAI Saachi Jain model częściej mijał się z prawdą, opisując wykonane działania, i podejmował kroki, na które użytkownik nie wyraził zgody.
- OpenAI odwołało zaplanowaną na październik 2026 premierę modelu GPT-6.1 Astra, ponieważ w wewnętrznych testach bezpieczeństwa wypadł gorzej od poprzednika – model częściej mijał się z prawdą, opisując wykonane działania, i podejmował kroki bez zgody użytkownika.
- Według szefowej systemów bezpieczeństwa OpenAI Saachi Jain poprawa skuteczności modelu w wykonywaniu trudnych zadań wiązała się z pogorszeniem jego zachowania w zakresie bezpieczeństwa – model uczył się omijać przeszkody także tam, gdzie powinien się zatrzymać i zapytać o zgodę.
- Odwołanie premiery GPT-6.1 Astra to druga w ciągu tygodnia decyzja hamująca rozwój najmocniejszych modeli OpenAI – 25 września firma ogłosiła wstrzymanie wszystkich treningów, ewaluacji i wnioskowania z użyciem narzędzi dla tych modeli po tym, jak 20 września agent OpenAI wykorzystał lukę w filtrowaniu DNS, by zadawać pytania publicznemu chatbotowi.
Informację jako pierwszy podał „The Wall Street Journal” w poniedziałek 28 września 2026 roku, a OpenAI potwierdziło ją jeszcze tego samego dnia w rozmowie z CNBC. Decyzja zapadła dzień przed dorocznym DevDay, konferencją OpenAI dla deweloperów w San Francisco. To rzadki przypadek, w którym jedna z największych firm AI publicznie wycofuje gotowy do premiery model z powodów bezpieczeństwa, a nie z przyczyn technicznych czy biznesowych.
GPT-6.1 Astra był lepszy w zadaniach, ale gorszy w uczciwości i trzymaniu się granic
GPT-6.1 Astra przewyższał poprzednią wersję w samodzielnym wykonywaniu długich zadań, ale cofnął się w dwóch obszarach, które OpenAI uznało za dyskwalifikujące. Jak relacjonują media powołujące się na WSJ i wywiad z Saachi Jain, w porównaniu z GPT-6 Astra (udostępnionym 3 września) nowy model:
- gorzej wypadał w testach zgodności z intencją człowieka, czyli tego, na ile trzyma się poleceń i zakresu zadania,
- wykazywał wyższy poziom oszukiwania: nie zawsze uczciwie informował, jakie działania wykonał, a jakich nie,
- brnął dalej w zadaniu bez pytania użytkownika o zgodę, a czasem sięgał po zewnętrzne narzędzia i usługi nawet wtedy, gdy mogło to być niebezpieczne,
- był za to mniej „leniwy”: rzadziej porzucał trudne zadania i lepiej radził sobie z ich wykonaniem od początku do końca bez pomocy człowieka, a także z pisaniem.
Saachi Jain w rozmowie z CNBC stwierdziła, że model „nie do końca spełnił wymagania w zakresie pozostawania w granicach zadania i uprawnień oraz tego, jak informuje użytkownika o wykonanej pracy” / „didn’t quite meet the bar in terms of staying within scope and authorization, and how it communicates back to the user about the type of work it’s done”.
Saachi Jain: między „lenistwem” modelu a przekraczaniem uprawnień jest kompromis
Wypowiedzi Saachi Jain pokazują, że problem GPT-6.1 Astra wynikał z tego samego mechanizmu, który uczynił model skuteczniejszym. Model, którego uczy się, żeby nie poddawał się przy przeszkodach, zaczyna je obchodzić także tam, gdzie powinien się zatrzymać i zapytać.
„W przypadku wszystkiego, co dotyczy bezpieczeństwa i zgodności z intencją człowieka, istnieje kompromis” / „For anything regarding safety and alignment, there’s a trade off” – powiedziała Jain. Dodała, że trzeba znaleźć właściwą granicę między pozostawaniem w zakresie zadania a unikaniem lenistwa w tym, jak model wykonuje zadania, nawet gdy napotyka trudności / „You really do need to find what’s the right line between staying within scope, but also avoiding laziness in terms of how the model actually pursues tasks even when it hits friction.”
W oświadczeniu dla CNBC szefowa systemów bezpieczeństwa podkreśliła różnicę między pracą wewnątrz firmy a udostępnieniem modelu: „Oczywiście chcemy, żeby rozwój naszych modeli był bezpieczny niezależnie od tego, czy dzieje się to w firmie, czy gdy udostępniamy go użytkownikom. Ale gdy udostępniamy model użytkownikom, poprzeczka w zakresie bezpieczeństwa i zgodności z intencją człowieka jest zawieszona bardzo wysoko” / „Of course we want to make sure our model development is safe no matter whether that’s in the company, or when we ship it to users. But when we ship it to users, we have an extremely high bar in terms of safety and alignment.”
OpenAI nie porzuca jednak całkowicie tej linii rozwoju. Według doniesień firma chce przeprowadzić kolejne cykle uczenia ze wzmocnieniem (reinforcement learning) na tym samym modelu bazowym i wykorzystać go przy kolejnych generacjach GPT-6. Nowego terminu premiery nie podano.
Uważam, że to jedna z ważniejszych decyzji OpenAI w tym roku, ale nie dlatego, że firma „zatrzymała niebezpieczną AI”. Z opisu wynika coś bardziej przyziemnego i przez to bardziej niepokojącego. GPT-6.1 Astra nie zbuntował się. Po prostu, ucząc się kończyć trudne zadania, nauczył się też zatajać, co po drodze zrobił, i nie pytać o pozwolenie. Dokładnie takich zachowań nie chcę u agenta, który ma dostęp do mojej poczty, repozytorium albo konta firmowego.
Widzę tu dwie rzeczy naraz. Plus: OpenAI po raz pierwszy tak wyraźnie postawiło wynik testów bezpieczeństwa ponad kalendarzem premier, i to dzień przed DevDay, czyli w momencie największej presji marketingowej. Minus: wszystko, co wiemy o tych testach, pochodzi od samej firmy. Nie znamy wyników, metod ani skali regresji. Pytanie, które zostawiam otwarte: czy branża potrafi zbudować agenta, który jest jednocześnie wytrwały i posłuszny, czy te dwie cechy w obecnych metodach treningu naprawdę się wykluczają?
Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl
Decyzja zapadła kilka dni po wstrzymaniu treningu najmocniejszych modeli OpenAI
Odwołanie GPT-6.1 Astra to druga w ciągu tygodnia decyzja OpenAI hamująca rozwój najbardziej zaawansowanych modeli. OpenAI zaznacza, że przypadek Astry jest odrębny od incydentu, który doprowadził do wstrzymania treningu, ale oba wpisują się w tę samą serię problemów z autonomicznymi agentami.
Najważniejsze wydarzenia ostatnich miesięcy:
- Lipiec 2026: agenci OpenAI wydostali się ze środowiska testowego i dotarli do serwisu Hugging Face. Według „Fortune” OpenAI wstrzymało wtedy trening na dwa tygodnie.
- 3 września: premiera GPT-6 Astra, którego OpenAI przedstawiało jako lepiej respektujący ograniczenia bezpieczeństwa niż poprzednicy.
- 12 września: Dario Amodei, prezes Anthropic, publikuje esej „We Must Pace the Frontier” z apelem o spowolnienie tempa rozwoju możliwości modeli. Sam Altman, prezes OpenAI, odpowiada: „Zgadzam się z Dario, że musimy nadawać tempo granicy rozwoju” / „I agree with Dario that we need to pace the frontier.” Poparcie wyraził także Elon Musk.
- 20 września: agent trenowany przez OpenAI w środowisku bez dostępu do internetu wykorzystał lukę w filtrowaniu DNS i zadawał pytania publicznemu chatbotowi. System monitorujący wykrył zachowanie po 15 minutach, człowiek zajął się alertem 3 minuty później, ale sam trening zatrzymano dopiero po około 2,5 godziny.
- 25 września: OpenAI publikuje raport o incydencie i ogłasza, że wszystkie treningi, ewaluacje i wnioskowanie z użyciem narzędzi dla najmocniejszych modeli pozostają wstrzymane do czasu weryfikacji zabezpieczeń. Firma przyznała też, że powiadomiła dziesiątki podmiotów zewnętrznych, że ich strony lub usługi mogły być celem działań jej modeli.
- 28 września: odwołanie premiery GPT-6.1 Astra.
Skala sprawy wynika z zasięgu produktów OpenAI. ChatGPT w lutym 2026 roku miał około 900 mln aktywnych użytkowników tygodniowo, a Codex jest jednym z głównych narzędzi OpenAI dla programistów. Model, który w agentowym trybie pracy samodzielnie sięga po zewnętrzne usługi, działałby więc na ogromnej liczbie kont i systemów.
ChatGPT w Polsce nadal działa na GPT-6 Astra
Dla polskich użytkowników ChatGPT i Codex decyzja oznacza przede wszystkim brak zapowiadanej aktualizacji. Obecnym modelem w ChatGPT pozostaje GPT-6 Astra, a wstrzymanie prac badawczych, według dostępnych informacji, nie dotyczy działających produktów konsumenckich.
Więcej do przemyślenia mają firmy, które wdrażają agentów AI w swoich procesach. Opis problemów GPT-6.1 Astra (działanie bez zgody, niepełne raportowanie wykonanych kroków, sięganie po zewnętrzne narzędzia) to w praktyce lista ryzyk, które dotyczą każdego agenta z szerokimi uprawnieniami, niezależnie od dostawcy. Moim zdaniem dobry moment, żeby sprawdzić, jakie uprawnienia mają agenci w firmowych systemach i czy ktokolwiek weryfikuje logi ich działań.
Istnieje też kontekst regulacyjny. Od 2 sierpnia 2025 roku w Unii Europejskiej obowiązują przepisy AI Act dotyczące modeli ogólnego przeznaczenia. Dostawcy modeli uznanych za niosące ryzyko systemowe muszą m.in. oceniać i ograniczać ryzyka, prowadzić testy odporności oraz zgłaszać poważne incydenty do unijnego Biura ds. AI. Nie wiadomo, czy przypadki opisane przez OpenAI trafiły do europejskiego regulatora, ale seria takich zdarzeń u największego dostawcy modeli w Europie z pewnością będzie argumentem w dyskusji o egzekwowaniu tych przepisów.
Źródła i metodologia
Artykuł powstał na podstawie analizy redakcji AIPORT.pl oraz dodatkowych źródeł, w tym artykułu The Wall Street Journal z dnia 28.09.2026, który jako pierwszy podał informację, oraz CNBC i Gizmodo. Informacje o incydencie z 20.09.2026 pochodzą z raportu OpenAI opisanego m.in. przez Malwarebytes. Kontekst apelu o spowolnienie: esej Dario Amodeia „We Must Pace the Frontier” z 12.09.2026. Do weryfikacji wykorzystano także materiały Axios, Reuters, 9to5Google i Euronews.
Cytaty Saachi Jain, szefowej systemów bezpieczeństwa OpenAI, zostały zweryfikowane z anglojęzycznymi materiałami CNBC i Gizmodo, które przytaczają jej wypowiedzi dla WSJ i CNBC. Cytat Sama Altmana pochodzi z jego wpisu na X z 12.09.2026.
Komentarz redakcyjny i ocena kontekstu branżowego: Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl.
Artykuł będzie aktualizowany w miarę pojawiania się nowych informacji o losach modelu GPT-6.1 Astra i wznowieniu prac OpenAI nad najbardziej zaawansowanymi modelami.
