Nowy model Anthropic kosztuje w typowych zadaniach o 40% mniej niż poprzednik, a w testach programowania wyprzedza nawet mocniejszego Fable 5.1. Claude Opus 5.5 zadebiutował 22 września 2026 r. jako pierwszy model rodziny 5.5. Według producenta w większości prac dorównuje modelowi Fable 5.1, generuje odpowiedzi o ponad 30% szybciej niż Opus 5 i pisze wyraźnie czytelniej.
Premiera zmienia rachunek dla użytkowników API i subskrypcji. Poniżej rozkładamy ją na części: wyniki w benchmarkach, cennik, pracę z kodem i dokumentami oraz nowe zabezpieczenia.
Jak Claude Opus 5.5 wypada w benchmarkach?
W zestawieniu przygotowanym przez Anthropic nowy model prowadzi w programowaniu agentowym, obsłudze komputera i pracy biurowej opartej na wiedzy. Największy skok widać w teście Terminal-Bench 4.0, który sprawdza wieloetapowe zadania w wierszu poleceń: 66,4% wobec 52,3% dla Opus 5. Wyniki trzech modeli Claude w pięciu testach zebraliśmy w tabeli:
| Test | Opus 5.5 | Fable 5.1 | Opus 5 |
|---|---|---|---|
| Terminal-Bench 4.0 (kodowanie w terminalu) | 66,4% | 55,8% | 52,3% |
| CursorBench 4.0 (zadania wieloplikowe) | 57,8% | 51,8% | 46,6% |
| GDPval-AA v2.1 (praca w 44 zawodach, Elo) | 1846 | 1735 | 1708 |
| OSWorld 2.0 (obsługa komputera) | 81,8% | 80,7% | 74,0% |
| Humanity’s Last Exam (z narzędziami) | 67,7% | 65,6% | 63,6% |
Liczby trzeba czytać z dystansem, co przyznaje sam producent. Przy tym poziomie możliwości różnice w benchmarkach słabiej przekładają się na codzienną pracę, a w praktyce firmy dystans między Claude Opus 5.5 a Fable 5.1 okazał się mniejszy, niż sugerują wyniki. GPT-6 Astra od OpenAI wygrywa jednak w dwóch testach: automatyzacji procesów biznesowych (41,4% wobec 40,0%) oraz agentowych badaniach naukowych (64,6% wobec 58,7%).
Ile wynosi cena Claude Opus 5.5 w API?
Za milion tokenów wejściowych zapłacisz 4 USD, a za milion wyjściowych 20 USD, czyli o 20% mniej niż w Opus 5. Najmocniej potaniał odczyt z pamięci podręcznej, który przy pracy agentowej i kodowaniu odpowiada za większość rachunku. Spadł z 0,50 do 0,20 USD za milion tokenów, a więc o 60%. Pełne stawki za milion tokenów:
| Rodzaj tokenów | Opus 5.5 | Opus 5 |
|---|---|---|
| Odczyt z pamięci podręcznej | 0,20 USD | 0,50 USD |
| Tokeny wejściowe | 4 USD | 5 USD |
| Tokeny wyjściowe | 20 USD | 25 USD |
| Zapis do pamięci podręcznej | 5 USD | 6,25 USD |
Niższy cennik to tylko część oszczędności. Model zużywa też mniej tokenów na zadanie, a oba efekty razem dają spadek kosztów o 40% przy domyślnych ustawieniach. Tryb fast w Claude Code i na Claude Platform daje do 2,5 raza szybsze generowanie za 8 USD (wejście) i 40 USD (wyjście) za milion tokenów. Anthropic podniósł też pięciogodzinne limity użycia w planach Pro, Max, Team i Enterprise z licencjami na stanowisko, a do tego dał jednorazowy reset limitu, który można zachować na później.
Czym różni się Opus 5.5 od Opus 5 przy pracy z kodem?
Programiści najszybciej odczują różnicę przy długich, rozległych zadaniach, takich jak migracje i audyty całych repozytoriów. Jeden z wczesnych testerów przeniósł kod liczący 680 tys. linii w niecałą dobę, podczas gdy zespołowi inżynierów zajęłoby to tygodnie. Inny zlecił audyt i poprawki w bazie 200 tys. linii. Nowy model skończył w mniej niż 3 godziny, a Opus 5 potrzebował ponad 20 godzin i 2,5 raza więcej tokenów.
Test wydajności aplikacji webowej dobrze pokazuje porównanie Opus 5.5 vs Opus 5. Nowy model miał skrócić czas ładowania wszystkich podstron i zrobił to w 39 próbach na 40. Starsza wersja wprowadzała mniejsze poprawki, które zmieniały działanie aplikacji. W innej próbie Opus 5.5 i Fable 5.1 przepisywały HAProxy, program do rozkładania ruchu między serwerami, z języka C na Rust. Obie wersje przeszły niemal wszystkie testy regresji, lecz Claude Opus 5.5 skończył w 9,5 godziny zamiast 12 i kosztował o 51% mniej.
Jak nowy Opus radzi sobie z analizą i pisaniem?
Poza kodem model dobrze sprawdza się jako badacz. W teście producenta Opus 5.5, Fable 5.1 i Opus 5 pisały raport o wynikach kwartalnych spółki na podstawie kopii internetu, w której komunikat o wynikach był trudny do znalezienia. Automatyczny oceniający porównywał każdą liczbę i każdy cytat ze źródłami, a jedna zmyślona dana oznaczała porażkę. Claude Opus 5.5 przeszedł próg jakości w 16 raportach na 18. Pozostałe dwa nie przeszły go ani razu.
Podobnie wypadła analiza fuzji dwóch fikcyjnych firm tworzących oprogramowanie kadrowe. Oba modele przygotowały w Excelu arkusz finansowy oraz prezentację dla zarządu i doszły do tych samych wniosków. Nowszy skończył jednak w 63 minuty zamiast 93, przy o połowę niższym koszcie, a w jego arkuszu zabrakło drobnych błędów, które pojawiły się u poprzednika.
Zmienił się też sposób komunikacji. Claude Opus 5.5 stawia najważniejszą informację na początku, rzadziej sięga po żargon i trzyma się reguł pisania, które mu przekażesz. Anthropic przyznaje, że rozwlekły styl był jedną z najczęstszych uwag użytkowników pod adresem Opus 5. Przy wielogodzinnych sesjach ma to praktyczne znaczenie, bo krótszy tekst łatwiej sprawdzić przed publikacją lub wdrożeniem.
Jakie zabezpieczenia dostał nowy Opus?
To pierwsza premiera Anthropic od apelu prezesa firmy, Dario Amodeia, o narzucenie tempa rozwojowi najmocniejszych modeli, tak by praktyki bezpieczeństwa nadążały za ich możliwościami. Przed wydaniem Claude Opus 5.5 przeszedł testy u niezależnych ewaluatorów. W automatycznym audycie zachowań, obejmującym blisko 2000 scenariuszy, uzyskał najlepsze wyniki spośród dotychczasowych modeli Claude. Podczas nowego testu przekraczania granic środowiska model próbował je obejść o około 85% rzadziej niż Opus 5.
Model lepiej niż poprzednik opiera się atakom typu prompt injection i dostał ochronę znaną wcześniej tylko z Fable 5.1. Najważniejsze zmiany dla użytkowników:
- większość zadań z zakresu cyberbezpieczeństwa trafia automatycznie do modelu Opus 4.8, choć wyszukiwanie i naprawa błędów we własnym kodzie działają normalnie;
- w biologii obowiązują te same ograniczenia co w Fable 5.1, a laboratoria i firmy farmaceutyczne mogą ubiegać się o szerszy dostęp w specjalnym programie weryfikacji;
- każdą akcję agenta przed wykonaniem sprawdza klasyfikator, a zespoły bezpieczeństwa mogą przejrzeć piaskownicę o otwartym kodzie, w której agent pracuje;
- zabezpieczenie preserved thinking blokuje edycję wcześniejszego kontekstu w celu wydobycia rozumowania modelu i dotyczy kont API założonych od 31 sierpnia 2026 r.
Anthropic nie ukrywa ograniczeń tych pomiarów. Model często podejrzewa, że jest testowany, co utrudnia przewidzenie jego zachowania w prawdziwych wdrożeniach. Z tego powodu firma łączy testy zgodności z założeniami z twardymi zabezpieczeniami, zamiast polegać tylko na jednym z tych narzędzi.
Sprawdź Claude Opus 5.5 na własnym zadaniu
Nowa wersja jest już dostępna na wszystkich platformach, w tym w Amazon Web Services, Google Cloud i Microsoft Azure. W API model działa pod identyfikatorem claude-opus-5-5. Najprostszy test? Weź zadanie, które poprzedni model rozwlekał albo porzucał w połowie, i daj je nowemu przy domyślnym poziomie wysiłku. Porównaj liczbę kroków i czas do gotowego wyniku.
Jeśli budujesz agenta, przelicz rachunek z ostatniego miesiąca według nowego cennika. Przy dużym udziale odczytów z pamięci podręcznej różnica może sięgnąć kilkudziesięciu procent. Dopiero takie zestawienie pokaże, czy Claude Opus 5.5 zwróci się w Twoim projekcie szybciej niż w testach producenta.
FAQ
Czy w Claude Opus 5.5 można wyłączyć tryb myślenia?
Nie. Opus 5.5 nie jest dostępny z wyłączonym trybem thinking, więc zawsze rozumuje przed udzieleniem odpowiedzi. Na koszt i czas reakcji wpływasz przez poziom wysiłku. Domyślny jest poziom średni, na którym w teście Terminal-Bench 4.0 nowy model wypadł lepiej niż Opus 5 ustawiony na maksimum, przy około pięciokrotnie niższym koszcie.
Kiedy pojawią się Sonnet 5.5 i Haiku 5.5?
Anthropic zapowiada oba mniejsze modele z rodziny 5.5 na najbliższe tygodnie, bez konkretnej daty. Mają otrzymać wiele tych samych usprawnień co Claude Opus 5.5, zwłaszcza w wydajności i bezpieczeństwie. Jeśli Twój zespół używa Sonneta do tańszych zadań w tle, przebudowę procesów pod nowy cennik możesz odłożyć do tej premiery.
Czy teksty z Opus 5.5 mają znak wodny?
Tak. Podobnie jak Fable 5.1, nowy model stosuje mechanizmy znakowania treści, które Anthropic wprowadził, aby spełnić wymogi unijnego AI Act. Dla wydawców i agencji publikujących teksty generowane przez AI to sygnał, że pochodzenie treści będzie coraz łatwiejsze do ustalenia. Szczegóły techniczne znakowania firma opisuje w osobnej dokumentacji.
Czy Opus 5.5 obsługuje zerową retencję danych?
Nowa wersja, podobnie jak wcześniejsze modele Opus, jest dostępna w wariancie zero data retention. W tym trybie treść zapytań i odpowiedzi nie jest przechowywana po przetworzeniu, co ma znaczenie przy pracy na danych klientów i poufnym kodzie. Przed wdrożeniem sprawdź, czy ta opcja obejmuje także platformę chmurową, przez którą korzystasz z modelu.
