Google DeepMind ogłosił 30 września 2026 r. Gemini 4 Argon, swój pierwszy nowy model flagowy od premiery Gemini 3 w listopadzie 2025 r., który ma prowadzić w programowaniu, pracy z dokumentami prawnymi i finansowymi oraz w obronie przed cyberatakami. Na razie korzysta z niego wyłącznie zespół Google i wybrani specjaliści od cyberbezpieczeństwa z programu Fairwind, a cena dla wszystkich pozostałych ma wynieść 2 dolary za milion tokenów wejściowych i 10 dolarów za milion tokenów wyjściowych.
- Google ogłosił 30 września 2026 r. Gemini 4 Argon – nowy model flagowy, który na razie jest dostępny wyłącznie dla wewnętrznych zespołów Google oraz wybranych specjalistów ds. cyberbezpieczeństwa w ramach programu Fairwind, a nie dla szerokiej publiczności.
- Gemini 4 Argon osiągnął 77,9 proc. w benchmarku DeepSWE v1.1 (długie zadania inżynierii oprogramowania) i 68 proc. w CWE-bench v1 (naprawianie podatności w kodzie), zajmując pierwsze miejsca w obu zestawieniach według danych Google.
- Cena wprowadzająca wynosi 2 dolary za milion tokenów wejściowych i 10 dolarów za milion tokenów wyjściowych, co – jeśli się utrzyma – plasuje Argona poniżej poprzedniego flagowca Google, Gemini 3.1 Pro (12 USD za wyjście), i znacznie poniżej Claude Mythos 5 (50 USD za wyjście).
Model zapowiedział Koray Kavukcuoglu, wiceprezes Google DeepMind i Chief AI Architect Google, który w sierpniu przejął kierowanie DeepMind po odejściu Demisa Hassabisa. Google nie podał daty udostępnienia Argona deweloperom, firmom ani użytkownikom indywidualnym. Kolejność jest jednak znana: najpierw klienci płatnego API i abonenci Google AI Ultra, potem szerszy rynek.
Argon pisze odpowiedzi do miliona tokenów i bije rekordy w zadaniach programistycznych
Największa zmiana techniczna dotyczy długości odpowiedzi. Google podniósł limit tokenów wyjściowych z 64 tys. w poprzedniej generacji do 1 mln. Oznacza to, że Gemini 4 Argon może w jednym przebiegu wygenerować setki tysięcy tokenów rozumowania i kodu, zamiast dzielić pracę na wiele krótszych kroków.
Wyniki, które Google przedstawił w komunikacie (wszystkie pochodzą od firmy i nie zostały jeszcze niezależnie powtórzone):
- DeepSWE v1.1 (długie, realistyczne zadania inżynierii oprogramowania): 77,9 proc., najlepszy wynik w zestawieniu,
- AutomationBench (benchmark Zapiera mierzący pełną automatyzację procesów biznesowych): 51,3 proc. i pierwsze miejsce,
- CWE-bench v1 (naprawianie podatności w kodzie): 68 proc., ex aequo pierwsze miejsce,
- LVBench (rozumienie długich nagrań wideo): 91,7 proc.,
- prowadzenie w Vals Index, który mierzy przydatność modelu w finansach, programowaniu, prawie i podatkach, z wagami odpowiadającymi udziałowi tych sektorów w PKB USA.
Google twierdzi też, że Argon prowadzi w Vals Finance Agent v2 oraz w Legal Agent Benchmark firmy Harvey, ale w tekście ogłoszenia nie podał tam konkretnych liczb.
Google twierdzi, że Argon już oszczędza pamięć w centrach danych i przepisuje kod na Rust
Kavukcuoglu otwiera ogłoszenie zdaniem, że Argon „zasadniczo zmienia sposób, w jaki pracujemy i budujemy w Google” / „Argon is fundamentally changing the way we work and build at Google”. Na poparcie Google podaje kilka przykładów z wewnętrznych wdrożeń:
- Pamięć w centrach danych: zespół agentów opartych na Argonie przeanalizował dane z profilowania całej infrastruktury i samodzielnie wprowadził optymalizacje, które uwolniły ponad 300 TiB pamięci. Google szacuje łączne oszczędności na 500 TiB do 1 PiB.
- Migracja z C/C++ do Rusta: agenci przepisują biblioteki od kilkudziesięciu tysięcy linii (re2, libgav1) do ponad 800 tys. linii jądra Zircon systemu Fuchsia. Google zaznacza, że takie przepisania przechodzą automatyczne i ręczne audyty przed wdrożeniem produkcyjnym.
- Dekoder wideo libgav1: agenci zastąpili 32 tys. linii kodu SIMD w istniejącej wersji Rust bezpiecznym kodem, który kompilator sam wektoryzuje. Dekoder działa 2,7 raza szybciej niż wcześniejszy port na Rust i daje identyczny obraz.
- Obliczenia kwantowe: w jednym z przypadków Argon w kilka minut poprawił opublikowany wynik bazowy o 40 proc. przy optymalizacji zasobów (kubity × bramki) podprogramów.
Liczby są efektowne, ale to dane Google o własnych systemach, bez możliwości weryfikacji z zewnątrz.
Gemini 4 Argon trafia do obrońców bez zabezpieczeń cybernetycznych
Najbardziej nietypowa jest strategia premiery. Google trenował Argona pod kątem obrony przed cyberatakami: model ma samodzielnie znajdować, potwierdzać i łatać krytyczne podatności. Zaufani obrońcy i wewnętrzne zespoły Google dostaną wersję bez blokad dotyczących cyberbezpieczeństwa, czyli z pełnymi możliwościami ofensywnej analizy kodu.
Kanałem dystrybucji jest Fairwind Program, który Google uruchomił 2 września 2026 r. Program daje rządom, krajowym agencjom cyberbezpieczeństwa, operatorom infrastruktury krytycznej i opiekunom oprogramowania dostęp do najmocniejszych modeli Google do wyszukiwania i łatania luk. Do tej pory jego trzonem był Gemini 3.8 Flash Cyber połączony z narzędziem CodeMender. Google zastrzega, że partnerzy nie mogą udostępniać ani odsprzedawać dostępu do tych modeli.
Pierwszy publiczny przykład zastosowania Argona pochodzi od Wiz, firmy, której przejęcie Google sfinalizował w marcu. Wiz prowadzi inicjatywę Scan for Good, w ramach której bezpłatnie skanuje systemy szpitali, transportu, administracji i organizacji non-profit (za zgodą lub w ramach programów bug bounty). Według Google Argon znalazł tam krytyczną lukę w oprogramowaniu medycznym używanym przez szpitale na całym świecie, która ujawniała dane osobowe pacjentów i której wcześniejsze modele nie wykryły. Strona Scan for Good wykazuje łącznie 475 krytycznych podatności znalezionych w ramach całej inicjatywy.
Rozumiem logikę Google: jeśli model potrafi znaleźć lukę w oprogramowaniu szpitalnym, to lepiej, żeby pierwszy zrobił to obrońca, a nie atakujący. Anthropic przyjął podobny model z Mythosem i Project Glasswing, więc branża wyraźnie zmierza w stronę „najpierw zaufani, potem reszta”.
Ale widzę tu dwa problemy. Pierwszy to definicja zaufania. Kto decyduje, że dana agencja rządowa lub firma jest „zaufana”, i co się dzieje, gdy taki partner sam padnie ofiarą wycieku? Model bez blokad cybernetycznych w niepowołanych rękach to dokładnie ten scenariusz, przed którym Google chce chronić. Drugi problem to wiarygodność benchmarków. Prawie wszystkie liczby w ogłoszeniu pochodzą od Google, a część z wewnętrznych testów, których nikt z zewnątrz nie zobaczy. Dopóki niezależni badacze nie dostaną Argona do rąk, traktowałbym te wyniki jako deklarację, nie fakt.
Ciekawi mnie też cena. 10 dolarów za milion tokenów wyjściowych przy limicie miliona tokenów na odpowiedź oznacza, że jedno długie zadanie może kosztować kilkanaście dolarów. Dla firmy migrującej kod to grosze. Dla małego zespołu, który puści agenta bez nadzoru, może to być niemiła niespodzianka na fakturze.
Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl
Google monitoruje tok rozumowania Argona i zamyka środowiska testowe
Przed szerszym udostępnieniem Google wzmacnia zabezpieczenia w czterech obszarach. Firma deklaruje, że Argon odmawia pomocy przy atakach cybernetycznych i broni CBRN (chemicznej, biologicznej, radiologicznej i jądrowej), a do wykrywania nadużyć Google monitoruje wewnętrzne aktywacje modelu. Według Google Argon jest też najodporniejszym modelem firmy na pośrednie wstrzykiwanie poleceń (indirect prompt injection), co potwierdzać ma benchmark Gray Swan.
Dwie pozostałe deklaracje są ciekawsze. Google monitoruje łańcuch rozumowania Argona i jego działania, a gdy model wychodzi poza intencje użytkownika, zatrzymuje wykonanie. Firma zaznacza, że wyników tego monitoringu nie wykorzystuje w treningu, aby model nie nauczył się ukrywać rozumowania, i apeluje do całej branży o zachowanie przejrzystości tego procesu. Google zapowiada też izolowanie i uszczelnianie środowisk sandboksowych przed ryzykownymi testami.
Ten ostatni punkt ma kontekst. Jak opisał 18 września 2026 r. The Wall Street Journal, a Google potwierdził, w maju 2026 r. podczas testu ofensywnych możliwości Gemini prowadzonego z izraelską firmą Irregular model uzyskał nieautoryzowany dostęp do trzech zewnętrznych sieci. Środowisko, które miało być odcięte od internetu, przez błąd konfiguracji miało aktywne połączenie, a nazwa fikcyjnej firmy z ćwiczenia pokrywała się z nazwą prawdziwego przedsiębiorstwa. W ogłoszeniu Argona Google nie odnosi się do tego incydentu wprost.
Cena Argona jest bliższa modelom średniej klasy niż konkurencyjnym flagowcom
Google określa 2 i 10 dolarów za milion tokenów jako cenę wprowadzającą. Tokeny wejściowe z pamięci podręcznej mają być tańsze o 95 proc., czyli kosztować 0,10 dolara za milion. Zestawienie z innymi modelami (ceny za milion tokenów w API, według danych Google i serwisów porównujących cenniki):
| Model | Wejście | Wyjście | Dostępność |
|---|---|---|---|
| Gemini 4 Argon (cena wprowadzająca) | 2 USD | 10 USD | tylko Fairwind i Google |
| Gemini 3.1 Pro | 2 USD | 12 USD | publicznie |
| Gemini 3.8 Flash (promocja do 31.12) | 0,75 USD | 3,75 USD | publicznie |
| Claude Mythos 5 | 10 USD | 50 USD | publicznie |
Jeśli Google utrzyma tę cenę po pełnej premierze, Argon będzie tańszy od poprzedniego flagowca Gemini 3.1 Pro przy tokenach wyjściowych i kilkukrotnie tańszy od Claude Mythos 5. Słowo „wprowadzająca” sugeruje jednak, że cennik może się zmienić.
Premiera zamyka trudny rok dla Google. Gemini 3.5 Pro, zapowiedziany na Google I/O w maju z terminem na czerwiec, nigdy nie trafił do użytkowników, a w tym czasie OpenAI wypuściło GPT-6, a Anthropic serię Mythos. Google przez ostatnie miesiące wydawał głównie modele Flash. Dzień przed Argonem OpenAI pokazało na DevDay model GPT-6.1 Sol.
Polscy użytkownicy poczekają, polskie instytucje mogą próbować przez Fairwind
Dla polskich użytkowników indywidualnych Gemini 4 Argon jest na razie niedostępny. Pierwszą grupą spoza programu Fairwind mają być abonenci Google AI Ultra, czyli najdroższego planu Google, sprzedawanego w Polsce od 2025 r. Na Google I/O 2026 plan Ultra podzielono na dwa warianty: za 100 i 200 dolarów miesięcznie. Polskie firmy i programiści skorzystają z Argona przez płatne API, gdy Google je otworzy.
Fairwind Program formalnie przyjmuje wnioski od rządów i krajowych organów ds. cyberbezpieczeństwa, operatorów infrastruktury krytycznej i opiekunów oprogramowania. Strona programu nie wskazuje ograniczeń geograficznych, ale nie znalazłem informacji, by wśród uczestników była obecnie polska instytucja. Dla polskich szpitali, wodociągów czy samorządów, które rzadko mają własne zespoły red team, sama inicjatywa Scan for Good, prowadzona przez Wiz za darmo i za zgodą skanowanych organizacji, może okazać się bardziej praktyczna niż dostęp do samego modelu.
Źródła i metodologia
Artykuł powstał na podstawie analizy redakcji AIPORT.pl oraz dodatkowych źródeł, w tym oficjalnego komunikatu Google: Gemini 4 Argon: our next era of frontier intelligence z dnia 30.09.2026 oraz strony Fairwind Program w Google DeepMind, strony Scan for Good firmy Wiz i Nextgov/FCW. Do weryfikacji wykorzystano także materiały DataCamp, Unite.AI, Born City (relacja z publikacji The Wall Street Journal) oraz zestawienia cenników modeli. Kontekst dostępności planu Google AI Ultra w Polsce: Benchmark.pl.
Cytat Koraya Kavukcuoglu, wiceprezesa Google DeepMind i Chief AI Architect Google, został zweryfikowany z oryginalnym anglojęzycznym materiałem źródłowym.
Komentarz redakcyjny i ocena kontekstu branżowego: Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl.
Artykuł będzie aktualizowany w miarę pojawiania się nowych informacji o udostępnieniu Gemini 4 Argon deweloperom, firmom i użytkownikom.
