Anthropic udostępnił 28 września 2026 r. model Claude Sonnet 5.5, który według firmy generuje odpowiedzi o ponad 30% szybciej niż Sonnet 5 i kosztuje do 30% mniej w przeliczeniu na zadanie, choć cena za token się nie zmieniła. Największy skok widać w programowaniu: w teście Terminal-Bench 4.0 Sonnet 5.5 uzyskał 70,6%, podczas gdy jego poprzednik zaledwie 10,3%.
- Claude Sonnet 5.5, udostępniony 28 września 2026 r., osiągnął w teście Terminal-Bench 4.0 wynik 70,6%, podczas gdy jego poprzednik, Sonnet 5, uzyskał tam zaledwie 10,3% – a flagowy Claude Opus 5.5 kosztujący dwa razy więcej wypada w tym samym teście gorzej (66,4%).
- Według niezależnych pomiarów Artificial Analysis koszt jednego zadania przy maksymalnym poziomie wysiłku wynosi 7,60 dolara, czyli około 50% więcej niż Sonnet 5 na analogicznym ustawieniu (5,09 dolara), ponieważ model generuje wówczas około 60% więcej tokenów wyjściowych niż poprzednicy.
- Sonnet 5.5 jest pierwszym modelem z linii Sonnet wydanym z zabezpieczeniami cyberbezpieczeństwa porównywalnymi do tych stosowanych w Claude Opus 5.5, a także pierwszym Sonnetem oznaczającym generowany tekst niewidocznym znakiem wodnym – Anthropic wdrożył ten mechanizm globalnie, aby spełnić wymogi art. 50 unijnego AI Act obowiązującego od 2 sierpnia 2026 r.
Sonnet 5.5 to drugi model z rodziny Claude 5.5, wydany sześć dni po flagowym Claude Opus 5.5 (22 września). Anthropic pozycjonuje go jako szybsze i tańsze uzupełnienie Opusa: do dobrze określonych codziennych zadań, poprawiania błędów w kodzie oraz tworzenia dokumentów, prezentacji i arkuszy kalkulacyjnych. Trzeci model rodziny, Claude Haiku 5.5, ma dołączyć „w najbliższych tygodniach”.
Sonnet 5.5 kosztuje tyle samo co Sonnet 5, ale zużywa mniej tokenów
Cennik API pozostał bez zmian: 2 dolary za milion tokenów wejściowych, 10 dolarów za milion tokenów wyjściowych i 0,20 dolara za milion tokenów odczytu z pamięci podręcznej (cache). Obniżka kosztów, o której mówi Anthropic, ma wynikać z tego, że model do wykonania tego samego zadania potrzebuje mniej tokenów i mniej wywołań narzędzi.
Dla porównania, Claude Opus 5.5 kosztuje dokładnie dwa razy więcej: 4 dolary za milion tokenów wejściowych i 20 dolarów za milion wyjściowych. Tyle samo co Sonnet 5.5 kosztuje za to konkurencyjny GPT-6 Sol od OpenAI.
Model działa z oknem kontekstu 1 mln tokenów i ma regulowany „poziom wysiłku” (effort). W aplikacjach Claude i w Claude Code domyślnie ustawiony jest poziom Medium, a w API na Claude Platform poziom High. Anthropic twierdzi, że w kilku testach Sonnet 5.5 na poziomie Low lub Medium przebija najlepszy wynik Sonneta 5 za mniej więcej jedną dziesiątą kosztu zadania.
Wyniki w benchmarkach: w kodowaniu Sonnet 5.5 zbliża się do Opusa
Anthropic opublikował porównanie z Sonnetem 5, Opusem 5.5 i GPT-6 Sol. Wybrane wyniki:
| Test | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 (programowanie agentowe) | 70,6% | 10,3% | 66,4% | brak danych |
| FrontierCode 1.1 | 46,2% (Max), 52,1% (Xhigh) | 42,4% | 54,4% | 49,3% |
| CursorBench 4.0 | 55,5% | 34,1% | 57,8% | brak danych |
| GDPval-AA v2.1 (praca biurowa, Elo) | 1844 | 1449 | 1846 | 1487 |
| OSWorld 2.1 (obsługa komputera) | 80,1% | 57,0% | 81,8% | brak danych |
| Humanity’s Last Exam (z narzędziami) | 64,5% | 54,9% | 67,7% | brak danych |
| Chartography (odczyt wykresów) | 61,6% | 15,6% | 64,4% | 53,6% |
Wynik Opusa 5.5 w Terminal-Bench 4.0 dotyczy poziomu Xhigh, czyli jego najlepszego rezultatu. Sonnet 5.5 wypada więc w tym teście lepiej niż model dwa razy droższy. Anthropic sam zastrzega jednak, że w złożonej, otwartej pracy wymagającej długotrwałego osądu Opus 5.5 pozostaje wyraźnie mocniejszy.
GDPval-AA to test Artificial Analysis sprawdzający modele na realnych zadaniach z 44 zawodów i dziewięciu branż. Sonnet 5.5 jest w nim praktycznie na poziomie Opusa 5.5 i około 400 punktów przed Sonnetem 5. Firma podaje też ciekawostkę z innej kategorii: to pierwszy Sonnet, który przeszedł grę Pokémon Red, pracując wyłącznie na zrzutach ekranu.
Firmy testujące Sonnet 5.5 raportują mniej tokenów i szybsze zadania
Anthropic dołączył do premiery opinie kilkunastu firm, które miały wcześniejszy dostęp do modelu. Wśród podanych liczb:
- Balyasny Asset Management: na 2441 zadaniach finansowych Sonnet 5.5 zużywał około 121 tys. tokenów na odpowiedź, Sonnet 5 około 497 tys.
- Base44: w 118 budowach aplikacji Sonnet 5.5 osiągał jakość porównywalną z Opusem 5, potrzebując średnio 3,6 iteracji zamiast 7,7.
- Zendesk: zgłoszenia obsługi klienta przetwarzane o 20% szybciej.
- Box: model był 2,4 raza szybszy i zużywał 12% mniej tokenów niż poprzednik.
- Slack: około 14% mniej tokenów wyjściowych w wewnętrznych testach Slackbota.
- Unity: 90% ukończonych zadań w wieloetapowym benchmarku edytora Unity.
David Loker, wiceprezes ds. AI w CodeRabbit, firmie automatyzującej przeglądy kodu, zwraca uwagę na zachowanie modelu, a nie tylko na wynik:
„Skłonność Sonneta 5 do zbyt częstego sięgania po wyszukiwarkę i wysokie zużycie tokenów zniknęły w nowym modelu” / „Sonnet 5’s tendency to reach for web search too often and its high token use are both gone in this new model.”
Daniel Vogel, dyrektor operacyjny Epic Games, stwierdził z kolei, że w testach firmy Sonnet 5.5 „spełnił tę samą poprzeczkę jakości, jakiej oczekuje się od modelu wyższej klasy” / „cleared the same quality bar you’d expect from a higher-tier model”.
Trzeba pamiętać, że to wypowiedzi partnerów wybrane przez Anthropic do materiału premierowego. Pokazują potencjał modelu, ale nie są niezależnym testem.
Niezależne pomiary pokazują, że „30% taniej” nie działa na każdym ustawieniu
Artificial Analysis, niezależna firma porównująca modele AI, zmierzyła Sonnet 5.5 w swoim Intelligence Index. Przy maksymalnym poziomie wysiłku model uzyskał 56 punktów, ale średni koszt jednego zadania wyniósł 7,60 dolara. Według zestawień opartych na danych Artificial Analysis to o około 50% więcej niż Sonnet 5 na maksymalnym ustawieniu (5,09 dolara) i więcej niż Opus 5.5 (5,98 dolara).
Przyczyną jest rozgadanie modelu na najwyższym poziomie wysiłku. Według OfficeChai, powołującego się na Artificial Analysis, Sonnet 5.5 generował na maksymalnym ustawieniu około 193 tys. tokenów wyjściowych na zadanie, czyli mniej więcej 60% więcej niż Opus 5.5 i Sonnet 5.
Na niższych poziomach obraz jest inny. Artificial Analysis podaje dla Sonneta 5.5:
- Low: 36 punktów, 0,41 dolara za zadanie,
- Medium: 41 punktów, 0,59 dolara,
- High: 47 punktów, 1,08 dolara,
- Max: 56 punktów, 7,60 dolara.
Te liczby nie przeczą wprost deklaracji Anthropic, która mówi o koszcie „do 30% niższym” w testach firmy. Pokazują jednak, że o rachunku decyduje wybrany poziom wysiłku, a nie sama cena za token.
Sonnet 5.5 jest dobrym przykładem tego, jak zmienia się rozmowa o modelach. Cena za milion tokenów przestała cokolwiek mówić, liczy się koszt wykonanego zadania. I tu widzę dwie strony tej samej premiery. Dla firm, które mają agentów pracujących na poziomie Medium albo High, to realna oszczędność i wyraźnie lepsza jakość w tej samej cenie. Dla tych, którzy odruchowo ustawiają Max, może to być podwyżka, o której nikt ich nie uprzedził. Druga rzecz, która mnie zastanawia, to tempo. Sonnet 5 wyszedł pod koniec czerwca, a po trzech miesiącach ma wynik 10,3% w teście, w którym następca robi 70,6%. Czy ktoś w tym tempie w ogóle zdąży sensownie przetestować model, zanim wdroży go na produkcję?
Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl
Pierwszy Sonnet z zabezpieczeniami cyberbezpieczeństwa z najmocniejszych modeli
Anthropic ocenia, że zdolności Sonneta 5.5 w cyberbezpieczeństwie są porównywalne z Opusem 5. Dlatego to pierwszy model z linii Sonnet wydany z zabezpieczeniami podobnymi do tych stosowanych w Opusie 5.5. Zwykła praca programistyczna, w tym szukanie i łatanie błędów, ma działać normalnie, ale zapytania uznane za cyberzagrożenie wysokiego ryzyka będą w widoczny sposób przełączane na Sonnet 5. W aplikacjach Claude dzieje się to automatycznie, w API deweloperzy muszą takie przełączanie włączyć.
Sonnet 5.5 dostał też klasyfikatory blokujące wyciąganie rozumowania modelu. Anthropic tłumaczy to ochroną przed destylacją, czyli masowym wykorzystywaniem modelu (np. przez tysiące fałszywych kont) do trenowania konkurencyjnych systemów. Zabezpieczenia biologiczne pozostały takie same jak w Sonnecie 5.
W audycie behawioralnym obejmującym około 1850 scenariuszy Sonnet 5.5 wypadł według Anthropic lepiej lub tak samo jak Sonnet 5 w większości miar zgodności z intencjami użytkownika. Firma przyznaje przy tym, że żaden zestaw testów nie wyłapuje wszystkich problemów.
Deweloperzy, którzy uruchamiali Sonneta z wyłączonym myśleniem (thinking off), przed migracją muszą przejść na nowe ustawienie between_tools. Model jest dostępny pod identyfikatorem claude-sonnet-5-5 na Claude Platform, w Amazon Web Services, Google Cloud i Microsoft Azure, także z opcją zerowej retencji danych.
Polscy użytkownicy dostaną Sonneta 5.5 ze znakiem wodnym wymaganym przez AI Act
Sonnet 5.5 jest na liście modeli Claude, które oznaczają generowany tekst niewidocznym znakiem wodnym. Anthropic wprowadził ten mechanizm, aby spełnić wymogi art. 50 unijnego AI Act, który od 2 sierpnia 2026 r. zobowiązuje dostawców generatywnej AI do oznaczania treści w sposób możliwy do wykrycia maszynowo. Firma podpisała w lipcu kodeks praktyk Komisji Europejskiej dotyczący przejrzystości treści generowanych przez AI, podobnie jak około 190 innych organizacji.
Znak wodny nie jest dopiskiem ani metadanymi. Model w subtelny sposób wybiera między równie dobrymi słowami, co w dłuższym tekście tworzy wzorzec statystyczny wykrywalny odpowiednim kluczem. Anthropic stosuje to rozwiązanie globalnie, bo, jak sam przyznaje, nie ma jeszcze trwałego sposobu na ograniczenie go do wybranych regionów. Dla polskich firm, które korzystają z Claude do tworzenia treści i same podlegają AI Act, oznacza to, że teksty z Sonneta 5.5 będą technicznie oznaczone jako wygenerowane przez AI. Anthropic udostępnia API do wykrywania znaku wodnego na razie w ograniczonym podglądzie.
Źródła i metodologia
Artykuł powstał na podstawie analizy redakcji AIPORT.pl oraz dodatkowych źródeł, w tym oficjalnego komunikatu Anthropic: Introducing Claude Sonnet 5.5 z dnia 28.09.2026 oraz danych Artificial Analysis i wpisu Anthropic o znakowaniu tekstu. Do weryfikacji wykorzystano także publikacje SiliconANGLE, VentureBeat, OfficeChai i Kingy AI.
Cytaty Davida Lokera (VP of AI, CodeRabbit) i Daniela Vogela (COO, Epic Games) zostały zweryfikowane z oryginalnym anglojęzycznym materiałem źródłowym Anthropic.
Komentarz redakcyjny i ocena kontekstu branżowego: Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl.
Artykuł będzie aktualizowany w miarę pojawiania się nowych informacji w temacie modeli Claude 5.5, w tym premiery Claude Haiku 5.5.
