Webinar Claude · 29.09, 19:00Zapisz się
Narzędzia AI

Claude Opus 5.5 - cennik i benchmarki nowego modelu Anthropic

Bartłomiej Bernat4.10.202615 min czytania

Co to jest Claude Opus 5.5?

Claude Opus 5.5 to model językowy firmy Anthropic, który zadebiutował 22 września 2026 roku jako pierwsze wydanie generacji Claude 5.5 i następca Claude Opus 5. Anthropic zaprojektował go z myślą o długich, wieloetapowych zadaniach:

  • agentycznym kodowaniu, w którym model sam planuje i wprowadza zmiany w kodzie,
  • pracy z wiedzą, czyli researchu, raportach i analizach,
  • długotrwałych agentach AI, które działają samodzielnie przez wiele godzin.

Model przyjmuje tekst i obrazy, a odpowiada tekstem. Mieści w kontekście do 1 miliona tokenów, generuje do 128 tysięcy tokenów w jednej odpowiedzi, a jego wiedza sięga czerwca 2026 roku. W API występuje pod identyfikatorem claude-opus-5-5. Anthropic w przeglądzie swoich modeli poleca go jako punkt startowy dla większości zastosowań.

Jak działa Claude Opus 5.5?

Claude Opus 5.5 to model rozumowania: zanim odpowie, analizuje problem w wewnętrznym toku myślenia. Działa w trybie myślenia adaptacyjnego (adaptive thinking), czyli sam decyduje, ile czasu poświęcić na przemyślenie danego zadania. W odróżnieniu od Opus 5 tego trybu nie da się wyłączyć.

Głębokość rozumowania reguluje się poziomem effort. Im wyższy poziom, tym model myśli dłużej i dokładniej, ale zużywa więcej tokenów i odpowiada wolniej. Domyślnie Opus 5.5 pracuje na poziomie medium.

Model ma też wbudowane możliwości potrzebne do budowy agentów AI: korzystanie z zewnętrznych narzędzi (tool use), sterowanie komputerem (computer use), czytanie plików PDF i analizę obrazów. Dzięki temu może samodzielnie wykonywać zadania rozpisane na dziesiątki kroków, a nie tylko odpowiadać na pojedyncze pytania.

Jakie są nowości w Claude Opus 5.5 w porównaniu z Opus 5?

Najważniejsza zmiana dotyczy efektywności. Według Anthropic Opus 5.5 przy domyślnych ustawieniach kosztuje około 40% mniej niż Opus 5 przy typowych obciążeniach. Składają się na to dwie rzeczy: cena za token niższa o 20% i mniejsza liczba tokenów zużywanych na to samo zadanie.

Pozostałe nowości:

  • szybsze odpowiedzi: model generuje tekst o ponad 30% szybciej niż Opus 5,
  • mniej kroków do celu: w testach GitHuba rozwiązał więcej zadań terminalowych niż Opus 5 w mniej niż połowie kroków,
  • tańszy cache: odczyt z pamięci podręcznej kosztuje 0,20 USD za milion tokenów, o 60% mniej niż w Opus 5,
  • czytelniejszy styl pisania: model stawia najważniejsze informacje na początku i rzadziej sięga po żargon,
  • dokładniejsza analiza obrazów: precyzyjniej odczytuje wartości z gęstych wykresów, diagramów i zrzutów ekranu,
  • wyższe limity w aplikacjach: Anthropic podniósł pięciogodzinne limity użycia w planach płatnych.

Opus 5.5 otwiera nową generację modeli. Przy premierze Anthropic zapowiedział, że w kolejnych tygodniach dołączą do niego Claude Sonnet 5.5 i Claude Haiku 5.5 z podobnymi usprawnieniami wydajności i bezpieczeństwa. Na początku października 2026 Sonnet 5.5 jest już dostępny, a Haiku 5.5 wciąż czeka na premierę.

Jak uzyskać dostęp do Claude Opus 5.5 i jakie obowiązują limity?

Z Claude Opus 5.5 można korzystać na dwa sposoby:

  1. W aplikacjach Claude i w Claude Code w ramach płatnych planów Pro, Max, Team i Enterprise.
  2. Przez API: bezpośrednio w Claude API jako claude-opus-5-5 albo w chmurach partnerów, czyli Amazon Bedrock, Claude Platform on AWS, Google Cloud i Microsoft Foundry.

Razem z premierą modelu Anthropic podniósł pięciogodzinne limity użycia w planach Pro, Max, Team i Enterprise (w wariancie z licencjami na stanowisko). Subskrybenci dostali też reset limitu, który można zachować i wykorzystać w dowolnym momencie, na przykład gdy limit skończy się w środku ważnego zadania.

Limity techniczne samego modelu:

  • okno kontekstu: 1 milion tokenów,
  • maksymalna długość odpowiedzi: 128 tysięcy tokenów (w Batch API, w wersji beta, do 300 tysięcy).

Jakie są różnice między Claude Opus 5.5 a Fable 5.1?

Claude Fable 5.1 to model Anthropic przeznaczony do najbardziej wymagającego rozumowania i długich zadań agentowych. Według Anthropic Opus 5.5 działa na jego poziomie w większości zadań, a w części benchmarków go wyprzedza. Firma sama zastrzega jednak, że w codziennej pracy różnica między modelami jest mniejsza, niż sugerują wyniki testów.

Claude Opus 5.5Claude Fable 5.1
Cena (wejście / wyjście, za 1 mln tokenów)4 / 20 USD10 / 50 USD
Szybkośćumiarkowanawolniejsza
Domyślny poziom effortmediumhigh
Okno kontekstu1 mln tokenów1 mln tokenów
Maksymalna odpowiedź128 tys. tokenów128 tys. tokenów
Terminal-Bench 4.066,4%55,8%

Dobrze widać to na przykładzie z testów Anthropic. Oba modele przepisały HAProxy, popularne oprogramowanie do rozkładania ruchu sieciowego między serwery, z języka C na Rust. Obie wersje przeszły niemal wszystkie testy regresyjne, ale Opus 5.5 skończył w 9,5 godziny zamiast 12 i kosztował o 51% mniej.

Kiedy więc wybrać Fable 5.1? Anthropic radzi sięgać po niego przy najtrudniejszym rozumowaniu i bardzo długich zadaniach agentowych albo wtedy, gdy Opus 5.5 nie radzi sobie nawet na wyższym poziomie effort. W pozostałych przypadkach tańszy Opus 5.5 jest rozsądniejszym wyborem.

Jakie są koszty użytkowania Claude Opus 5.5?

Opus 5.5 jest tańszy od poprzednika z dwóch powodów. Po pierwsze, cena za token spadła o 20% (z 5/25 do 4/20 USD za milion tokenów wejściowych i wyjściowych). Po drugie, model zużywa mniej tokenów na to samo zadanie. Według Anthropic przy domyślnych ustawieniach i typowych obciążeniach daje to łącznie około 40% niższe koszty niż w Opus 5.

Największe oszczędności daje prompt caching, czyli zapisywanie powtarzających się fragmentów promptu w pamięci podręcznej. Odczyt z cache kosztuje 0,20 USD za milion tokenów, o 60% mniej niż w Opus 5. To ważne przy kodowaniu i pracy agentów, bo według Anthropic odczyty z cache stanowią większość kosztów takich zadań.

Użytkownicy aplikacji Claude płacą stałą subskrypcję, a nie za tokeny. Dla nich premiera Opus 5.5 oznacza przede wszystkim wyższe pięciogodzinne limity użycia.

Co zawiera cennik Opus 5.5?

Ceny Claude Opus 5.5 w API na tle Opus 5 (za milion tokenów):

PozycjaClaude Opus 5.5Claude Opus 5
Tokeny wejściowe4 USD5 USD
Tokeny wyjściowe20 USD25 USD
Zapis do cache (5 minut)5 USD6,25 USD
Zapis do cache (1 godzina)8 USD10 USD
Odczyt z cache0,20 USD0,50 USD
Batch API (wejście / wyjście)2 / 10 USD2,50 / 12,50 USD
Tryb Fast (wejście / wyjście)8 / 40 USD10 / 50 USD

Stawki obowiązują w całym oknie kontekstu: zapytanie na 900 tysięcy tokenów kosztuje tyle samo za token co zapytanie na 9 tysięcy. Batch API, czyli asynchroniczne przetwarzanie dużych partii zapytań, daje 50% zniżki i można je łączyć z prompt cachingiem.

Jak obliczyć koszt zadania w Opus 5.5?

Koszt zadania to suma trzech składników:

  1. tokeny wejściowe × 4 USD za milion,
  2. tokeny wyjściowe × 20 USD za milion,
  3. tokeny odczytane z cache × 0,20 USD za milion (jeśli korzystasz z prompt cachingu).

Przykład: zadanie, w którym wysyłasz do modelu 200 tysięcy tokenów i dostajesz 20 tysięcy tokenów odpowiedzi, kosztuje 0,2 × 4 + 0,02 × 20 = 0,80 + 0,40 = 1,20 USD. W Opus 5 to samo zadanie kosztowałoby 1,50 USD, i to przy założeniu, że oba modele zużyją tyle samo tokenów.

Pamiętaj, że tokeny myślenia rozliczane są jak tokeny wyjściowe, a w Opus 5.5 myślenie jest zawsze włączone. Realny rachunek zależy więc głównie od poziomu effort: niższy poziom oznacza mniej tokenów myślenia i niższy koszt. Liczbę tokenów przed wysłaniem zapytania sprawdzisz przez endpoint do liczenia tokenów w API.

Jak Claude Opus 5.5 wypada w benchmarkach?

W wynikach opublikowanych przez Anthropic Opus 5.5 prowadzi w agentycznym kodowaniu, obsłudze komputera i pracy z wiedzą:

BenchmarkCo mierzyOpus 5.5Fable 5.1Opus 5GPT-6 Astra
Terminal-Bench 4.0kodowanie agentyczne w terminalu66,4%55,8%52,3%57,9%
FrontierCode v1.1kodowanie agentyczne54,4%50,3%48,0%53,3%
CursorBench 4.0kodowanie agentyczne (benchmark Cursora)57,8%51,8%46,6%brak danych
GDPval-AA v2.1praca z wiedzą w 44 zawodach (Elo)1846173517081542
AutomationBenchprocesy biznesowe40,0%31,4%26,9%41,4%
Humanity's Last Examrozumowanie wielodziedzinowe (z narzędziami)67,7%65,6%63,6%57,2%
OSWorld 2.1obsługa komputera81,8%80,7%74,0%brak danych

Wyniki Opus 5.5 uzyskano przy najwyższych poziomach effort. Model nie wygrywa wszędzie: w AutomationBench minimalnie lepszy jest GPT-6 Astra (41,4% wobec 40,0%), podobnie w naukowym Terminal-Bench-Science (64,6% wobec 58,7%).

Mocną stroną Opus 5.5 jest za to stosunek wyniku do ceny. Na CursorBench wyprzedza GPT-5.6 Sol o 11 punktów przy mniej więcej jednej trzeciej kosztu, a na Terminal-Bench 4.0 przy domyślnych ustawieniach dorównuje GPT-6 Astra za około 40% jego kosztu. W biologii i cyberbezpieczeństwie dorównuje najmocniejszemu modelowi Anthropic, Claude Mythos 5.1.

Sam Anthropic zaznacza przy tym, że na tym poziomie możliwości różnice w benchmarkach coraz słabiej oddają różnice w realnej pracy. Tabelę warto więc traktować jako orientację, a decyzję opierać na testach na własnych zadaniach.

Jak pisze i komunikuje się Claude Opus 5.5?

Styl pisania to obszar, w którym Opus 5 zbierał najwięcej krytyki, i Anthropic wyraźnie go poprawił. Opus 5.5:

  • stawia najważniejsze informacje na początku odpowiedzi,
  • rzadziej używa żargonu i nietypowych sformułowań,
  • trzyma się zasad pisania, które mu podasz,
  • pisze tak, że jego odpowiedzi łatwiej przejrzeć w trakcie długich sesji pracy.

W ogłoszeniu premiery Anthropic pokazał tę samą analizę błędu w systemie rozliczeń napisaną przez oba modele. Opus 5.5 już w pierwszym zdaniu podał wniosek w liczbach, czyli jaka część spadku przychodów wynikała z błędu, a jaka z innej zmiany, i wyjaśnił problem prostszym językiem.

Podobnie oceniają to testerzy. John Ruelas, Staff Software Engineer w Ramp, napisał: „Rozwlekłe, trudne do śledzenia odpowiedzi były moją największą frustracją przy czołowych modelach, a Claude Opus 5.5 to naprawia. Pisze jak dobry współpracownik i trzyma się naszych zasad pisania”.

Jak ustawić poziom effort i kiedy włączyć tryb Fast w Claude Opus 5.5?

Effort to parametr, którym regulujesz, jak długo model myśli nad odpowiedzią. Opus 5.5 ma pięć poziomów: low, medium, high, xhigh i max. Domyślny jest medium (w Opus 5 domyślny był high).

Jak dobrać poziom:

  • low: proste zadania i duża skala. Deloitte raportuje, że nawet na najniższym poziomie Opus 5.5 wychwycił w code review 72% znanych błędów, podczas gdy Opus 5 na poziomie high wychwycił 56%,
  • medium: rozsądny wybór do codziennej pracy. Na tym poziomie Opus 5.5 w teście GDPval-AA pokonuje GPT-6 Astra ustawionego na max za około jedną piątą kosztu,
  • high, xhigh, max: najtrudniejsze zadania, przy których liczy się jakość, a nie czas i koszt.

Jeśli przenosisz ustawienia z Opus 5, uważaj: przy tym samym poziomie effort Opus 5.5 myśli więcej w każdej turze, zwłaszcza na xhigh i max. Anthropic zaleca przetestować poziomy od nowa, zamiast kopiować stare ustawienia.

Tryb Fast to osobna dźwignia. Ten sam model generuje odpowiedzi nawet 2,5 raza szybciej, ale za podwójną stawkę: 8 USD za milion tokenów wejściowych i 40 USD za milion wyjściowych. Opłaca się tam, gdzie liczy się czas reakcji, na przykład przy interaktywnej pracy z kodem. Tryb Fast jest w fazie research preview i działa w Claude Code oraz bezpośrednio w Claude API. Nie jest dostępny na Amazon Bedrock, Google Cloud, Microsoft Foundry ani w Batch API.

Jak przejść na Claude Opus 5.5 i przetestować go przed migracją?

W aplikacjach Claude wystarczy wybrać nowy model z listy. Więcej pracy czeka zespoły, które korzystają z Opus 5 przez API. Sama zmiana identyfikatora na claude-opus-5-5 nie wystarczy, bo Anthropic wprowadził cztery zmiany łamiące zgodność:

  1. Myślenia nie da się wyłączyć. Zapytanie z wyłączonym myśleniem albo z ręcznym budżetem tokenów zwraca błąd. Zamiast wyłączać myślenie, obniż poziom effort.
  2. Nie da się wymusić użycia narzędzia. Ustawienia tool_choice typu any i tool zwracają błąd. Zostaje tryb auto, a gdy potrzebujesz odpowiedzi w ściśle określonym formacie JSON, strict tool use albo structured outputs.
  3. Bloki myślenia są przypisane do modelu i rozmowy. Na kontach założonych od 31 sierpnia 2026 edycja wcześniejszej części rozmowy (promptu systemowego, narzędzi, wiadomości) może skończyć się błędem. Bezpieczniej tylko dopisywać kolejne wiadomości na końcu rozmowy.
  4. Starsze narzędzie computer use (computer_20251124) nie działa w Claude API ani w Google Cloud. Trzeba przejść na computer_toolset_20260801.

Do tego krótkie komentarze, które model pisze między wywołaniami narzędzi, trafiają teraz do bloków myślenia. Aplikacja, która pokazywała je użytkownikom jako postęp pracy, może więc nagle zamilknąć, choć nie zwróci żadnego błędu.

Przed pełną migracją zrób testy A/B: puść te same zadania równolegle na Opus 5 i Opus 5.5 i porównaj jakość wyników, liczbę zużytych tokenów i czas. Ustaw effort jawnie i sprawdź kilka poziomów, bo domyślny medium w Opus 5.5 jest niższy niż domyślny high w Opus 5. Przygotuj też obsługę odmów: zabezpieczenia modelu mogą odrzucić część zapytań z obszaru cyberbezpieczeństwa i biologii, a API pozwala wtedy automatycznie przełączyć zapytanie na inny model.

Do czego najlepiej sprawdza się Claude Opus 5.5?

Opus 5.5 najlepiej wypada w długich, wieloetapowych zadaniach, w których pracuje samodzielnie przez godziny. Przykłady z testów Anthropic i firm z wczesnym dostępem:

  • migracje i audyty kodu: jeden z testerów przeprowadził migrację 680 tysięcy linii kodu w niecały dzień, choć zespołowi inżynierów zajęłoby to tygodnie. Inny zrobił audyt i poprawki w bazie 200 tysięcy linii w niecałe 3 godziny, podczas gdy Opus 5 potrzebował ponad 20 godzin i 2,5 raza więcej tokenów,
  • optymalizacja aplikacji: poproszony o skrócenie czasu ładowania wszystkich stron aplikacji webowej, Opus 5.5 zrobił to skutecznie w 39 na 40 prób,
  • analiza finansowa: w teście oceny fuzji dwóch firm model zbudował model finansowy w Excelu i prezentację dla zarządu w 63 minuty (Opus 5 w 93 minuty) za połowę kosztu. Fundusz Walleye Capital raportuje, że Opus 5.5 już na najniższym ustawieniu rozwiązał większość ich zestawu testowego,
  • research i raporty: w teście pisania raportu kwartalnego o spółce 16 z 18 raportów Opus 5.5 przeszło weryfikację, w której każda zmyślona liczba lub cytat oznaczały porażkę. Ani Fable 5.1, ani Opus 5 nie przeszły jej ani razu,
  • agenci AI: dzięki obsłudze narzędzi i sterowaniu komputerem model dobrze sprawdza się jako silnik agentów, które samodzielnie wykonują wieloetapowe procesy biznesowe,
  • biologia: model bardzo dobrze radzi sobie z zadaniami badawczymi, takimi jak przewidywanie i projektowanie molekuł, choć do części takich prac potrzebny jest dostęp przez program weryfikacji.

Jak bezpieczny jest Claude Opus 5.5 i czym są programy weryfikacji?

Przed premierą Opus 5.5 przeszedł testy zewnętrznych organizacji, w tym Frontier Design i METR. W automatycznym audycie behawioralnym Anthropic, czyli zestawie blisko 2000 symulowanych scenariuszy sprawdzających, czy model działa zgodnie z intencjami, uzyskał najlepszy wynik spośród wszystkich dotychczas testowanych modeli. W nowym teście skłonności do przekraczania wyznaczonych granic próbował je obejść o około 85% rzadziej niż Opus 5.

Model jest też odporniejszy na prompt injection, czyli próby przemycenia mu złośliwych instrukcji, na przykład w treści strony internetowej albo dokumentu. W benchmarku firmy Gray Swan dzieli z Fable 5.1 pierwsze miejsce pod względem najniższej skuteczności takich ataków.

Anthropic przyznaje też ograniczenia: Opus 5.5 często rozpoznaje, że jest testowany, co utrudnia ocenę jego zachowania w prawdziwych warunkach. Firmom przyda się informacja, że model jest dostępny w trybie zero data retention, a generowane przez niego teksty są oznaczane znakiem wodnym zgodnie z unijnym AI Act.

Programy weryfikacji. W biologii i cyberbezpieczeństwie Opus 5.5 dorównuje najmocniejszym modelom Anthropic, dlatego działa z dodatkowymi zabezpieczeniami. Zwykłe wyszukiwanie i poprawianie błędów we własnym kodzie działa normalnie, ale większość zadań z zakresu cyberbezpieczeństwa jest automatycznie przekierowywana do starszego Claude Opus 4.8, a wrażliwe zapytania z biologii przejmuje Opus 5. Dostęp do pełnych możliwości modelu dają dwa programy:

  • Life Sciences Verification Program: dla zweryfikowanych organizacji, takich jak laboratoria akademickie, startupy i firmy farmaceutyczne, które chcą używać Opus 5.5 w badaniach biologicznych,
  • Cyber Verification Program: dla zweryfikowanych specjalistów od cyberbezpieczeństwa. Anthropic zapowiedział rozszerzenie go na Opus 5.5 w ciągu kilku tygodni od premiery, w trzech poziomach coraz szerszego dostępu.

Jakie są opinie o Claude Opus 5.5 i czy warto z niego korzystać?

Opinie firm z wczesnym dostępem są pozytywne i, co ważne, oparte na konkretnych liczbach:

  • GitHub (Mario Rodriguez, Chief Product Officer): w testach w GitHub Copilot CLI i VS Code Opus 5.5 był w ścisłej czołówce modeli zużywających najmniej tokenów i kroków. W VS Code rozwiązał więcej zadań terminalowych niż Opus 5 w mniej niż połowie kroków,
  • Deloitte (Carl Bennett, CIO): nawet na najniższym poziomie effort model wychwycił 72% znanych błędów w code review, wobec 56% dla Opus 5 na poziomie high, i zgłaszał przy tym mniej fałszywych alarmów,
  • Ramp (John Ruelas, Staff Software Engineer): model pisze jak dobry współpracownik i trzyma się firmowych zasad pisania, a przygotowana przez niego specyfikacja projektowa wymagała minimalnych poprawek.

Minusy też są:

  • Opus 5.5 jest wolniejszy od Sonneta 5.5, a na wysokich poziomach effort czas odpowiedzi wyraźnie rośnie,
  • zabezpieczenia w cyberbezpieczeństwie i biologii mogą przekierować część zapytań do starszych modeli,
  • integracje z Opus 5 przez API wymagają dostosowania do czterech zmian łamiących zgodność.

Czy warto? Sam Anthropic w dokumentacji poleca Opus 5.5 jako punkt startowy dla większości zastosowań. Jeśli korzystasz z Opus 5, przejście oznacza w praktyce wyższą jakość za niższą cenę. Fable 5.1 zostaw na zadania, z którymi Opus 5.5 nie radzi sobie nawet na wyższym poziomie effort. Jeśli zależy Ci głównie na szybkości i niskiej cenie w prostszych zadaniach, sprawdź tańszego Sonneta 5.5 (2 / 10 USD za milion tokenów).

Bartłomiej Bernat

Bartłomiej Bernat

Head of Sales

Łączy marketing ze sprzedażą i dodatkowo polewa to sosikiem mocy AI.