Anthropic udostępnił 22 września 2026 r. model Claude Opus 5.5, pierwszy z nowej rodziny Claude 5.5, który według firmy dorównuje wyższemu w hierarchii Claude Fable 5.1 w większości zadań, a na typowych obciążeniach kosztuje o 40 proc. mniej niż Claude Opus 5. Ceny API spadły o 20 proc. dla tokenów wejściowych i wyjściowych oraz o 60 proc. dla odczytów z pamięci podręcznej, a Opus 5.5 jest pierwszym modelem Anthropic wydanym po apelu prezesa firmy Dario Amodeia o spowolnienie tempa rozwoju najmocniejszych systemów AI.
- Anthropic udostępnił 22 września 2026 r. model Claude Opus 5.5, wyceniając go na 4 USD za milion tokenów wejściowych i 20 USD za milion tokenów wyjściowych – o 20 proc. mniej niż Claude Opus 5 – a odczyty z pamięci podręcznej potaniały o 60 proc., co łącznie z mniejszym zużyciem tokenów na zadanie daje według firmy 40 proc. niższe koszty na typowych obciążeniach.
- W benchmarku GDPval-AA v2.1 oceniającym agentów AI w realnych zadaniach zawodowych z 44 profesji Opus 5.5 uzyskał wynik Elo 1846, wyprzedzając Claude Fable 5.1 (1735), Claude Opus 5 (1708) i GPT-6 Astra (1542), choć GPT-6 Astra prowadzi w AutomationBench i Terminal-Bench-Science.
- Premiera Opusa 5.5 nastąpiła 10 dni po tym, jak prezes Anthropic Dario Amodei opublikował esej „We Must Pace the Frontier" wzywający branżę do spowolnienia tempa poprawiania możliwości modeli AI; Anthropic jednostronnie zobowiązał się do stałego dostępu zewnętrznych ewaluatorów do swoich systemów na poziomie pracownika.
Anthropic ogłosił premierę na swojej stronie i w serwisie X. Model jest dostępny na wszystkich platformach od dnia premiery, a Anthropic jednocześnie podniósł pięciogodzinne limity użycia w planach Pro, Max, Team i Enterprise rozliczanym od stanowiska. Claude Sonnet 5.5 i Claude Haiku 5.5 mają pojawić się w ciągu najbliższych tygodni z podobnymi usprawnieniami wydajności, efektywności i bezpieczeństwa.
Opus 5.5 wygrywa z Fable 5.1 w większości benchmarków, ale GPT-6 Astra nadal prowadzi w dwóch testach
Według danych opublikowanych przez Anthropic Opus 5.5 osiąga najlepsze wyniki w programowaniu agentowym, obsłudze komputera i pracy biurowo-analitycznej. Przejrzałem pełną tabelę i widać w niej też miejsca, w których nowy model przegrywa z konkurencją od OpenAI.
| Benchmark | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 (kodowanie w terminalu) | 66,4% | 55,8% | 52,3% | 57,9% | 37,3% |
| FrontierCode v1.1 | 54,4% | 50,3% | 48,0% | 53,3% | 47,5% |
| CursorBench 4.0 | 57,8% | 51,8% | 46,6% | brak | 41,7% |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1708 | 1542 | 1588 |
| AutomationBench (Zapier) | 40,0% | 31,4% | 26,9% | 41,4% | 28,8% |
| Humanity’s Last Exam (z narzędziami) | 67,7% | 65,6% | 63,6% | 57,2% | brak |
| Terminal-Bench-Science 0.1 | 58,7% | 52,6% | 29,0% | 64,6% | 22,4% |
| OSWorld 2.0 | 81,8% | 80,7% | 74,0% | brak | brak |
GPT-6 Astra wyprzedza Opusa 5.5 w AutomationBench, teście przepływów biznesowych przygotowanym przez Zapier, oraz w Terminal-Bench-Science, mierzącym agentowe badania naukowe. Anthropic zastrzega też w przypisach, że Opus 5.5 był testowany z włączonymi zabezpieczeniami produkcyjnymi, a gdy te interweniowały, zadania z cyberbezpieczeństwa wykonywał Claude Opus 4.8, a zadania z biologii Claude Opus 5, co prawdopodobnie obniżyło wyniki nowego modelu.
Sam Anthropic studzi entuzjazm wokół tych liczb. Firma przyznała, że przy obecnym poziomie możliwości różnice w benchmarkach coraz słabiej oddają różnice w realnym użyciu, a w praktyce dystans między Opusem 5.5 a Fable 5.1 jest mniejszy, niż sugerują wyniki.
GDPval-AA v2.1, prowadzony przez firmę Artificial Analysis, ocenia agentów AI w realnych zadaniach zawodowych z 44 profesji. Przy domyślnym, średnim poziomie wysiłku Opus 5.5 pokonuje GPT-6 Astra działający na maksymalnych ustawieniach przy mniej więcej jednej piątej kosztu na zadanie.
Ceny API Claude Opus 5.5 spadają o 20 proc., a odczyt z pamięci podręcznej o 60 proc.
Opus 5.5 jest tańszy w każdej pozycji cennika API. Anthropic wycenił model na 4 dolary za milion tokenów wejściowych i 20 dolarów za milion tokenów wyjściowych, czyli o 20 proc. mniej niż 5 i 25 dolarów w przypadku Opusa 5, a odczyty z pamięci podręcznej, które odpowiadają za większość kosztów pracy agentowej i programistycznej, potaniały do 0,20 dolara, o 60 proc. poniżej stawki Opusa 5.
| Cena za 1 mln tokenów | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| Odczyt z pamięci podręcznej | 0,20 USD | 0,50 USD |
| Tokeny wejściowe | 4 USD | 5 USD |
| Tokeny wyjściowe | 20 USD | 25 USD |
| Zapis do pamięci podręcznej | 5 USD | 6,25 USD |
Deklarowane 40 proc. oszczędności to więcej niż sama obniżka cennika. Według Anthropic Opus 5.5 kosztuje mniej za token i zużywa mniej tokenów na zadanie, co łącznie daje spadek kosztów o 40 proc. Model generuje też odpowiedzi ponad 30 proc. szybciej niż Opus 5. Dla najbardziej niecierpliwych jest tryb szybki: w Claude Code i na Claude Platform działa do 2,5 raza szybciej, za 8 dolarów za milion tokenów wejściowych i 40 dolarów za milion wyjściowych.
Zmiany dotyczą także abonentów. Według MacRumors subskrybenci otrzymali jednorazowy reset limitu zapytań, który można wykorzystać w dowolnym momencie do 22 października. Część mediów, w tym Benzinga, napisała o całkowitym zniesieniu pięciogodzinnych limitów. Komunikat Anthropic mówi jednak wyłącznie o ich zwiększeniu.
Wcześni testerzy Opusa 5.5: migracje kodu w godziny zamiast dni
Anthropic i firmy z programu wczesnego dostępu opisują przede wszystkim oszczędność czasu i tokenów przy długich zadaniach programistycznych. Najciekawsze przykłady z materiałów premierowych:
- Jeden z testerów przeprowadził audyt i poprawki w bazie kodu liczącej 200 tys. linii w niecałe trzy godziny, podczas gdy Opusowi 5 zajęło to ponad 20 godzin i 2,5 raza więcej tokenów.
- W wewnętrznym teście Anthropic Opus 5.5 i Fable 5.1 przepisywały HAProxy, popularny program do równoważenia ruchu sieciowego, z języka C na Rust. Oba przepisane programy przeszły niemal wszystkie testy regresji, ale Opus 5.5 skończył w 9,5 godziny zamiast 12 i kosztował o 51 proc. mniej.
- W teście pisania raportu o wynikach kwartalnych firmy, gdzie każda zmyślona liczba lub cytat oznaczały porażkę, 16 z 18 raportów Opusa 5.5 przeszło próg jakości. Ani Fable 5.1, ani Opus 5 nie przeszły go ani razu.
- Deloitte Consulting podaje, że Opus 5.5 na najniższym poziomie wysiłku wychwycił 72 proc. znanych błędów w przeglądach kodu, wobec 56 proc. dla Opusa 5 na wysokim poziomie.
Mario Rodriguez, dyrektor produktu w GitHubie, opisuje testy w GitHub Copilot CLI i VS Code, w których Opus 5.5 zużywał jedne z najmniejszych liczb tokenów i kroków spośród mierzonych modeli. Jego zdaniem model „sprawia, że większe projekty programistów stają się bardziej wykonalne” / „it’s making developers’ bigger projects more achievable”.
Anthropic poprawił też sposób, w jaki model pisze. Styl komunikacji był jednym z najczęstszych zarzutów wobec Opusa 5. Opus 5.5 ma podawać najważniejsze informacje na początku, rzadziej sięgać po żargon i trzymać się zasad pisania wskazanych przez użytkownika.
Najciekawsza w tej premierze nie jest tabela benchmarków, tylko zdanie, które Anthropic dopisał pod nią sam: że różnice w wynikach coraz słabiej przekładają się na realną pracę. To uczciwe, ale ma też drugą stronę. Jeśli benchmarki tracą znaczenie, to ocena modeli przesuwa się w stronę referencji od klientów, a te w materiałach premierowych zawsze są pozytywne. Deloitte, GitHub czy Stripe testowali model we wczesnym dostępie i trudno od nich oczekiwać chłodnej recenzji w komunikacie producenta.
Dla firm korzystających z API najważniejsza jest ekonomia. Spadek kosztów o 40 proc. przy jakości zbliżonej do droższego modelu to realna zmiana w kalkulacji wdrożeń agentów, które pracują godzinami i zużywają miliony tokenów. Pytanie, na które jeszcze nie ma odpowiedzi, brzmi: ile zadań faktycznie trafi do słabszych modeli zastępczych przez nowe zabezpieczenia. Dla zespołów bezpieczeństwa IT to może oznaczać, że Opus 5.5 w praktyce będzie dla nich Opusem 4.8.
Niepokoi mnie jeszcze jedna uwaga z sekcji o bezpieczeństwie: Anthropic przyznaje, że model często podejrzewa, że jest testowany. Skoro producent sam mówi, że to utrudnia ocenę zachowania modelu w prawdziwym świecie, to rekordowe wyniki audytu bezpieczeństwa warto czytać z tym zastrzeżeniem w głowie.
Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl
Opus 5.5 to pierwszy model Anthropic po apelu Dario Amodeia o spowolnienie wyścigu AI
Premiera Opusa 5.5 następuje 10 dni po eseju, w którym prezes Anthropic wezwał branżę do wolniejszego zwiększania możliwości modeli. Dario Amodei opublikował tekst „We Must Pace the Frontier” 12 września 2026 r., a jego główna teza brzmiała, że trzeba spowolnić tempo, w jakim poprawiane są możliwości modeli AI. Amodei zapowiedział go również we wpisie na X.
Esej zawierał trzy propozycje. Były to obowiązkowa zewnętrzna ewaluacja i monitoring we wszystkich laboratoriach tworzących najmocniejsze modele, wspólny system (samo)regulacji laboratoriów z krajów demokratycznych oraz dwustronna koordynacja z Chinami. Anthropic jednostronnie zobowiązał się do pierwszego kroku: stałego dostępu zewnętrznych ewaluatorów do systemów firmy na poziomie pracownika, tak by mogli weryfikować przestrzeganie zasad bezpieczeństwa, zgłaszać incydenty i oceniać zgodność modeli z założeniami już w trakcie treningu.
Reakcja branży była szybka. Sam Altman napisał w ciągu kilku godzin, że OpenAI się zgadza i podejmie takie samo zobowiązanie, a Elon Musk skwitował esej stwierdzeniem, że Amodei ma rację. Demis Hassabis, współzałożyciel Google DeepMind, ocenił, że szczegóły wymagają dopracowania, ale „kierunek jest właściwy, by sprostać temu przełomowemu momentowi” / „the direction is correct for meeting this critical moment”.
Nie brakuje krytyki. Dave Karpf na łamach TechPolicy.Press przekonuje, że propozycje Amodeia w całości służą interesom Anthropic i mogą zostać zmienione, gdy tylko zaczną firmie przeszkadzać.
W praktyce Opus 5.5 przeszedł zewnętrzne testy przed premierą. Ewaluacje przeprowadziły dwie niezależne organizacje badające bezpieczeństwo AI, Frontier Design i METR, a w wewnętrznym audycie zachowań Anthropic, obejmującym blisko 2 tys. symulowanych scenariuszy, model wypadł lepiej niż wszystkie wcześniejsze wersje Claude. W nowym teście skłonności do przekraczania wyznaczonych granic Opus 5.5 podejmował takie próby o 85 proc. rzadziej niż Opus 5 czy Mythos 5.1.
Opus 5.5 przekazuje większość zadań z cyberbezpieczeństwa do Opusa 4.8
Opus 5.5 jest pierwszym modelem z linii Opus, który startuje z zabezpieczeniami tej samej klasy co Fable 5.1. Anthropic tłumaczy to tym, że w biologii i cyberbezpieczeństwie nowy model dorównuje Claude Mythos 5.1. Najważniejsze ograniczenia wyglądają tak:
- Cyberbezpieczeństwo: użytkownicy mogą wykrywać i naprawiać błędy we własnym kodzie w ramach zwykłej pracy programistycznej, ale większość zadań z zakresu cyberbezpieczeństwa trafi do Opusa 4.8. Specjaliści od obrony będą mogli ubiegać się o dostęp przez rozszerzony Cyber Verification Program, który ma mieć trzy poziomy coraz szerszego zaufanego dostępu, łącznie z modelami Claude Mythos.
- Biologia: Opus 5.5 korzysta z tych samych zabezpieczeń co Fable 5.1, a zweryfikowane organizacje, takie jak laboratoria akademickie, startupy i firmy farmaceutyczne, mogą ubiegać się o szerszy dostęp w nowym Life Sciences Verification Program.
- Destylacja: mechanizm „preserved thinking” blokuje użytkownikom API edytowanie wcześniejszego kontekstu w celu wydobycia rozumowania Claude. Dotyczy kont API założonych 31 sierpnia 2026 r. lub później. Destylacja to technika, w której atakujący masowo odpytują model przez fałszywe konta, żeby przenieść jego możliwości do własnego systemu.
- Tryb myślenia: w Opusie 5.5 nie da się wyłączyć trybu rozszerzonego rozumowania („thinking”).
Co Claude Opus 5.5 zmienia dla użytkowników i firm w Polsce
Polskich użytkowników najbardziej bezpośrednio dotyczą regulacje unijne. Tak jak Fable 5.1, Opus 5.5 ma wbudowane znakowanie treści (watermarking) zgodne z unijnym AI Act. Anthropic przystąpił do kodeksu postępowania w sprawie przejrzystości treści generowanych przez AI, związanego z art. 50 ust. 2 AI Act. Tekst dostaje niewidoczny znak wodny, który nie zmienia jego treści i przetrwa kopiowanie, choć mocna edycja może go osłabić, a pliki .svg, .png i .jpg otrzymują podpisane metadane w standardzie C2PA. Znakowanie działa globalnie, a nie tylko w Europie.
Dla polskich firm, które przetwarzają dane klientów, znaczenie ma też to, że Opus 5.5, jak wcześniejsze modele Opus, jest dostępny w wariancie bez przechowywania danych (zero data retention). Usługi Anthropic w Unii Europejskiej świadczy irlandzka spółka Anthropic Ireland Limited, a model jest dostępny także przez Amazon Web Services, Google Cloud i Microsoft Azure pod identyfikatorem claude-opus-5-5.
Programiści i software house’y, które budują integracje na nowych kontach API, powinni sprawdzić zmiany związane z „preserved thinking” i brakiem możliwości wyłączenia trybu myślenia. Dla części istniejących integracji może to oznaczać konieczność przepisania logiki zarządzania kontekstem rozmowy.
Źródła i metodologia
Artykuł powstał na podstawie analizy redakcji AIPORT.pl oraz dodatkowych źródeł, w tym oficjalnego komunikatu Anthropic: Introducing Claude Opus 5.5 z dnia 22.09.2026 oraz eseju Dario Amodei: We Must Pace the Frontier, a także publikacji MacRumors i TechPolicy.Press. Do weryfikacji wykorzystano również materiały Quartz, Benzinga, 9to5Mac, Dealroom, Euronews i AI Weekly.
Cytaty Mario Rodrigueza, dyrektora produktu w GitHubie, oraz Demisa Hassabisa, współzałożyciela Google DeepMind, zostały zweryfikowane z oryginalnym anglojęzycznym materiałem źródłowym.
Komentarz redakcyjny i ocena kontekstu branżowego: Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl.
Artykuł będzie aktualizowany w miarę pojawiania się nowych informacji o rodzinie modeli Claude 5.5, w tym premierze Claude Sonnet 5.5 i Claude Haiku 5.5.
