SpaceXAI, czyli dawne xAI Elona Muska, udostępniło 21 września 2026 r. model Grok 4.7, który firma nazywa swoim najmocniejszym modelem do programowania i pracy biurowej. Grok 4.7 kosztuje tyle samo co Grok 4.6 (2 dol. za milion tokenów wejściowych i 6 dol. za milion wyjściowych) i według tabeli opublikowanej przez producenta wyraźnie poprawia wyniki poprzednika, choć w większości testów programistycznych nadal ustępuje modelowi Claude Fable 5.1 od Anthropic.
- SpaceXAI udostępniło 21 września 2026 r. model Grok 4.7 w cenie identycznej jak Grok 4.6 – 2 dol. za milion tokenów wejściowych i 6 dol. za milion tokenów wyjściowych – co czyni go ponad trzykrotnie tańszym od GPT-5.6 Sol i ponad ośmiokrotnie tańszym od Claude Fable 5.1.
- Według tabeli opublikowanej przez producenta Grok 4.7 poprawia wyniki Groka 4.6 we wszystkich siedmiu testach, ale w czterech z nich – CursorBench 4.0, Terminal-Bench 4.0, AA Briefcase i HealthBench Professional – przegrywa z Claude Fable 5.1 od Anthropic, przy czym w pracy w terminalu różnica wynosi blisko 20 punktów procentowych (38,0% wobec 57,9%).
- Premiera Groka 4.7 opóźniła się o blisko 10 dni, bo model zbyt szybko rezygnował z trudnych zadań – według wyjaśnienia Elona Muska zespół prawdopodobnie zbyt mocno karał podczas uczenia ze wzmocnieniem długie odpowiedzi, przez co model niedbale sprawdzał własną pracę.
Oficjalna zapowiedź modelu: https://x.ai/news/grok-4-7
Grok 4.7 to nowy, większy model bazowy trenowany na zadaniach trwających wiele godzin
SpaceXAI deklaruje, że Grok 4.7 powstał na nowym, większym modelu bazowym niż Grok 4.6, a nie jest jedynie odświeżeniem poprzedniej wersji. Model przeszedł dłuższy etap uczenia ze wzmocnieniem (RL, reinforcement learning, czyli trenowania przez nagradzanie poprawnie wykonanych zadań) na trudniejszym zestawie problemów, z naciskiem na zadania, których rozwiązanie zajmuje wiele godzin.
Według komunikatu SpaceXAI Grok 4.7 lepiej niż poprzednik sprawdza własną pracę i radzi sobie z długim kontekstem. Firma wytrenowała go też tak, aby natywnie rozumiał środowisko Grok Bot, czyli usługę agentów AI wykonujących zadania w imieniu użytkownika, co ma poprawić działanie w rozmowach i ogólnej pracy biurowej.
Oficjalny wpis nie podaje liczby parametrów ani wielkości okna kontekstowego. Wcześniejsze informacje pochodzą wyłącznie od Muska: 2 września 2026 r. zapowiadał on model liczący 2,1 bln parametrów, o 40 proc. większy od Groka 4.6 z 1,5 bln parametrów, dotrenowany na danych SpaceX dotyczących rakiet, satelitów i produkcji. SpaceXAI nie potwierdziło tych liczb w materiale premierowym.
Grok 4.7 wygrywa w elektrotechnice i pracy prawniczej, przegrywa w pracy w terminalu
Tabela opublikowana przez SpaceXAI porównuje Grok 4.7 (w najwyższym trybie wysiłku xHigh) z Grokiem 4.6, GPT-5.6 Sol od OpenAI i Claude Fable 5.1 od Anthropic. Wszystkie wyniki pochodzą od producenta i nie zostały jeszcze niezależnie zweryfikowane.
| Test | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| Cena wejścia (dol./mln tokenów) | 2 | 2 | 4 | 10 |
| Cena wyjścia (dol./mln tokenów) | 6 | 6 | 20 | 50 |
| CursorBench 4.0 (programowanie) | 46,3% | 40,4% | 41,7% | 51,8% |
| DeepSWE v1.1 (programowanie) | 71,0%* | 65,2% | 72,7% | 70,0% |
| EEBench (elektrotechnika) | 64,0% | 53,0% | 39,4% | 56,4% |
| AA Briefcase v1.1 (wielogodzinna praca biurowa) | 1657 | 1546 | 1487 | 1678 |
| Terminal-Bench 4.0 (wielogodzinna praca w terminalu) | 38,0% | 20,3% | 37,3% | 57,9% |
| Harvey Legal Agent Benchmark (praca prawnicza) | 19,6% | 15,8% | 2,5% | 6,7% |
| HealthBench Professional (rozumowanie kliniczne) | 56,7% | 48,5% | 60,5% | 62,1% |
* wynik w trybie wysokiego wysiłku (high), a nie xHigh
Z tabeli wynika kilka rzeczy:
- Grok 4.7 poprawia wynik Groka 4.6 we wszystkich siedmiu testach, najmocniej w Terminal-Bench 4.0 (z 20,3 do 38 proc.) i EEBench (z 53 do 64 proc.).
- Grok 4.7 prowadzi w dwóch testach: EEBench i Harvey Legal Agent Benchmark.
- Claude Fable 5.1 wygrywa w CursorBench 4.0, Terminal-Bench 4.0, AA Briefcase i HealthBench Professional, a w pracy w terminalu przewaga Fable 5.1 nad Grokiem 4.7 wynosi prawie 20 punktów procentowych.
- W DeepSWE v1.1 najlepszy wynik ma GPT-5.6 Sol (72,7 proc.), a wynik Groka 4.7 pochodzi z innego trybu niż pozostałe liczby w jego kolumnie.
- Grok 4.7 jest przy tym wyraźnie tańszy: cena tokenów wyjściowych jest ponad trzykrotnie niższa niż w GPT-5.6 Sol i ponad ośmiokrotnie niższa niż w Claude Fable 5.1.
SpaceXAI opublikowało też wyniki GDPval, testu, w którym AI wykonuje zadania prawników, pielęgniarek czy analityków finansowych. Claude Fable 5.1 (max) uzyskał tam 1735 pkt Elo, Grok 4.7 (xhigh) 1695 pkt, Grok 4.6 (high) 1605 pkt, a GPT-6 Astra (max) 1542 pkt. W tym zestawieniu firma porównała się z nowszym GPT-6 Astra, a nie z GPT-5.6 Sol z głównej tabeli.
Na wykresie kosztu zadania w CursorBench 4.0 SpaceXAI zestawia Grok 4.7 z Fable 5.1, Claude Opus 5, Claude Sonnet 5 i GPT-5.6 Sol i twierdzi, że jego model jest w czołówce pod względem stosunku ceny do wyników. Hasło z nagłówka wpisu mówi o modelu dwukrotnie szybszym i o połowę tańszym od porównywalnych konkurentów. Te deklaracje dotyczą konkurencji, bo wobec Groka 4.6 cena i szybkość się nie zmieniły.
Przy CursorBench trzeba pamiętać o powiązaniach: Cursor współtworzy modele Grok, a przy poprzedniej generacji Cursor przyznał, że Grok 4.5 miał przewagę w CursorBench v3.2, ponieważ do danych treningowych przypadkowo trafiła wcześniejsza kopia kodu Cursora.
Premiera opóźniła się, bo model zbyt szybko rezygnował z trudnych zadań
Grok 4.7 trafił do użytkowników z blisko dziesięciodniowym opóźnieniem względem zapowiedzi Muska. Musk zapowiedział premierę w ciągu 10 dni, co wskazywało na 11 lub 12 września. 11 września napisał na X, że model potrzebuje jeszcze kilku dni, bo zespół prawdopodobnie zbyt mocno karał podczas uczenia ze wzmocnieniem długie odpowiedzi. W efekcie model za szybko poddawał się przy trudnych zadaniach, które potrafił rozwiązać, i niedbale sprawdzał swoją pracę.
Wpis premierowy SpaceXAI akcentuje dokładnie te obszary: dłuższą pracę nad trudnymi zadaniami i staranniejszą weryfikację własnych wyników. Firma nie wyjaśnia jednak, jak zmieniła proces treningu po wrześniowej korekcie.
Oczekiwania podkręcał sam Musk. W sierpniu twierdził, że Grok 4.7 przewyższy wszystkie obecne modele i że trudno będzie o model lepszy w realnej pracy inżynierskiej. Później ton złagodniał: według Muska Grok 4.7 miał być mniej więcej na poziomie Claude Opus 5.0, a nie 5.1.
Tabela SpaceXAI jest uczciwsza, niż można się było spodziewać po wcześniejszych zapowiedziach Muska. Firma sama pokazuje, że w pracy w terminalu i w CursorBench jej model wyraźnie przegrywa z Claude Fable 5.1. Obietnica „przewyższy wszystkie modele” się nie spełniła, ale to, co dostajemy, jest i tak ciekawe: skok o kilka do kilkunastu punktów względem Groka 4.6 przy tej samej cenie.
Mam jednak kilka zastrzeżeń. W tabeli głównej konkurentem OpenAI jest GPT-5.6 Sol, a w GDPval nagle pojawia się GPT-6 Astra, który akurat wypada tam najsłabiej. Claude Opus 5 jest na wykresie kosztów, ale znika z tabeli wyników. Dobór porównań zawsze robi producent i zawsze robi go pod siebie. Test HackerBench, na którym opiera się deklaracja o bezpieczeństwie, to z kolei wewnętrzne narzędzie SpaceXAI.
Dla firm liczących koszty Grok 4.7 może być rozsądnym wyborem do zadań, gdzie zejście o kilka punktów poniżej najlepszego modelu nie ma znaczenia, a różnica w cenie tokenów sięga kilku razy. Otwarte pytanie brzmi, czy problem z „poddawaniem się” przy trudnych zadaniach naprawdę zniknął. Tego nie pokaże żadna tabela z dnia premiery, tylko kilka tygodni pracy na prawdziwych projektach i niezależne pomiary, na przykład Artificial Analysis.
Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl
Nowe zabezpieczenia: przez filtr przechodzi 3,3 proc. ryzykownych poleceń z obszaru cyberbezpieczeństwa
SpaceXAI deklaruje, że Grok 4.7 dostał całkowicie nowy zestaw zabezpieczeń i jest najbardziej odpornym modelem firmy na próby obejścia ograniczeń. Producent pisze o nim wprost: „To najsilniejszy model, jaki testowaliśmy pod kątem odmów i odporności na jailbreaki” / „It is the strongest model we’ve tested on refusals and jailbreak resistance.” Jailbreak to technika skłaniania modelu do łamania własnych zasad bezpieczeństwa.
Według SpaceXAI Grok 4.7 prowadzi w obszarach podwójnego zastosowania, takich jak cyberbezpieczeństwo i biologia, zarówno w pomocy przy nieszkodliwych zadaniach, jak i w odmawianiu przy niebezpiecznych. Firma podaje dwa wyniki:
- 62,4 proc. w teście bezpieczeństwa biologicznego firmy LatchBio, co według SpaceXAI jest najlepszym rezultatem w tym teście;
- 3,3 proc. ryzykownych poleceń z pogranicza ataku i obrony przepuszczonych w HackerBench v0.3, wewnętrznym teście SpaceXAI dla szkodliwych zadań z zakresu cyberbezpieczeństwa.
SpaceXAI zaczęło też udostępniać wybranym partnerom z branży cyberbezpieczeństwa, wyłącznie na zaproszenie, możliwości Groka 4.7 w zakresie red teamingu, czyli symulowania ataków, na potrzeby badań obronnych.
Grok 4.7 jest już w Cursorze i Grok Build, wersja szybka kosztuje dwa razy więcej
Grok 4.7 jest dostępny od 21 września w edytorze Cursor i narzędziu Grok Build, a także przez API Grok, zewnętrzne narzędzia do programowania, routery modeli i platformy chmurowe. Cena startowa wynosi 2 dol. za milion tokenów wejściowych i 6 dol. za milion tokenów wyjściowych. SpaceXAI oferuje też wariant szybki, który generuje odpowiedzi dwa razy szybciej za dwukrotnie wyższą cenę.
Stawka jest identyczna jak w poprzednich generacjach. Grok 4.5, wydany 8 lipca 2026 r., kosztował 2 dol. za wejście i 6 dol. za wyjście, a Grok 4.6 miał tę samą cenę i wariant szybki za dwukrotność stawki. W przypadku Groka 4.6 cena bazowa dotyczyła jednak krótkich zapytań: powyżej 200 tys. tokenów stawka rosła do 4 dol. za wejście i 12 dol. za wyjście, a model miał okno kontekstowe 500 tys. tokenów. Wpis o Groku 4.7 nie mówi, czy te zasady się zmieniły.
Grok 4.7 to trzecia premiera SpaceXAI w ciągu niespełna trzech miesięcy. Seria jest rozwijana wspólnie z Cursorem: Grok 4.5 był modelem typu mixture-of-experts, trenowanym razem ze SpaceXAI na bilionach tokenów danych Cursora, obejmujących interakcje programistów z kodem i narzędziami. Poprzednik ustawił też poprzeczkę dla nowego modelu: według SpaceXAI Grok 4.6 uzyskał 61 pkt w Artificial Analysis Intelligence Index, tyle samo co GPT-5.6 Sol i o punkt mniej niż Claude Fable 5 Max. Niezależny wynik Groka 4.7 w tym indeksie nie był jeszcze dostępny w dniu premiery.
Źródła i metodologia
Artykuł powstał na podstawie analizy redakcji AIPORT.pl oraz dodatkowych źródeł, w tym oficjalnego komunikatu SpaceXAI „Introducing Grok 4.7″ z dnia 21.09.2026 oraz Cursor, Startup Fortune. Do weryfikacji danych o cenach i wcześniejszych generacjach wykorzystano także materiały Kingy AI, BenchLM i NextBigFuture.
Cytat z oficjalnego komunikatu SpaceXAI został zweryfikowany z oryginalnym anglojęzycznym materiałem źródłowym. Wszystkie wyniki testów pochodzą od producenta i w dniu publikacji nie były niezależnie potwierdzone.
Komentarz redakcyjny i ocena kontekstu branżowego: Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl.
Artykuł będzie aktualizowany w miarę pojawiania się nowych informacji o modelu Grok 4.7 i jego niezależnych testach.
