Anthropic pokazał Claude Opus 5.5, pierwszy model z nowej rodziny 5.5. Według firmy w większości zadań dorównuje najmocniejszemu Claude Fable 5.1, a w typowej pracy kosztuje o 40% mniej niż Opus 5. Film z premiery skupia się jednak na czymś mniej oczywistym: na tym, jak model pisze.
Co pokazuje film z premiery
Materiał opublikowany 22 września 2026 roku na kanale Claude ma jedną tezę: Opus 5.5 w większości zadań pracuje na poziomie Claude Fable 5.1, a przy tym pisze jaśniej i zaczyna od tego, co najważniejsze. Dzięki temu łatwiej się z nim pracuje podczas długich sesji. Opis filmu dodaje dwie praktyczne informacje: model jest szybszy i wydajniejszy od Opus 5, a z okazji premiery Anthropic podnosi limity użycia w planach Pro, Max i Team.
Pełne dane są w oficjalnej zapowiedzi na stronie Anthropic. Poniżej najważniejsze z nich, bez marketingowych przymiotników.
Ceny: taniej na każdym rodzaju tokenów
Najbardziej wymierna zmiana dotyczy kosztów. Anthropic podaje, że Opus 5.5 potrzebuje mniej mocy obliczeniowej niż Opus 5, a do tego zużywa mniej tokenów na zadanie. Razem daje to około 40% niższy koszt w typowych zastosowaniach. Cennik za milion tokenów wygląda tak:
| Rodzaj tokenów | Opus 5.5 | Opus 5 |
|---|---|---|
| Wejście | 4 USD | 5 USD |
| Wyjście | 20 USD | 25 USD |
| Odczyt z cache | 0,20 USD | 0,50 USD |
| Zapis do cache | 5 USD | 6,25 USD |
Największa obniżka, o 60%, dotyczy odczytów z cache. Według Anthropic to one stanowią większość kosztów pracy agentów i programowania. Model generuje też odpowiedzi ponad 30% szybciej niż Opus 5. Kto potrzebuje jeszcze większej prędkości, ma w Claude Code i na Claude Platform tryb Fast: do 2,5 raza szybciej, ale za 8 USD za milion tokenów wejściowych i 40 USD za milion wyjściowych.
Programowanie: długie, rozległe zadania
Anthropic najmocniej akcentuje prace, które ciągną się godzinami i obejmują cały kod projektu. Przykłady z zapowiedzi:
- jeden z testerów przeprowadził migrację 680 tysięcy linii kodu w niecały dzień;
- audyt i poprawki w bazie 200 tysięcy linii zajęły Opus 5.5 mniej niż trzy godziny, a Opus 5 ponad 20 godzin, przy 2,5 raza większym zużyciu tokenów;
- w teście wewnętrznym przepisanie HAProxy z C na Rust zajęło Opus 5.5 9,5 godziny, a Fable 5.1 12 godzin; obie wersje przeszły niemal wszystkie testy regresji HAProxy, a Opus 5.5 zrobił to o 51% taniej.
W tabeli benchmarków Opus 5.5 osiąga 66,4% w Terminal-Bench 4.0. Fable 5.1 ma tam 55,8%, Opus 5 52,3%, a GPT-6 Astra 57,9%. Warto jednak przeczytać zastrzeżenie samego producenta: przy tym poziomie możliwości różnice w benchmarkach coraz słabiej oddają różnice w realnej pracy, a w codziennym użyciu dystans między Opus 5.5 a Fable 5.1 jest mniejszy, niż sugerują liczby. Jeśli porównujesz modele do kodowania, przyda się też nasze wcześniejsze zestawienie GLM 5.2 vs Opus 4.8.
Styl pisania, czyli główny temat filmu
Przy Opus 5 użytkownicy często narzekali na to, jak model się komunikuje. Anthropic przyznaje to wprost i pisze, że w Opus 5.5 wiadomości da się zrozumieć od pierwszego spojrzenia: najważniejsza informacja trafia na początek, żargonu jest mniej, a model trzyma się zasad pisania, które mu podasz. Jeden z wczesnych testerów podsumował to krótko: model pisze tak jak on sam.
Firma zwraca uwagę na jeszcze jedną korzyść. Tekst, który łatwiej przeczytać, łatwiej też sprawdzić. Gdy agent pracuje przez wiele godzin, czytelny raport z tego, co zrobił, jest nie tylko wygodny. Pozwala człowiekowi szybciej wychwycić błąd.
Bezpieczeństwo i ograniczenia
Na głównym zestawie testów zachowania, obejmującym prawie 2000 scenariuszy, Opus 5.5 wypadł lepiej niż wcześniejsze modele Claude w niemal każdej kategorii niepożądanych zachowań. W nowym teście skłonności do przekraczania wyznaczonych granic próbował je obchodzić o około 85% rzadziej niż Opus 5. Lepiej opiera się też atakom prompt injection. Przed premierą model sprawdzali zewnętrzni ewaluatorzy, w tym METR.
Zapowiedź nie przemilcza problemów. Anthropic pisze, że model często podejrzewa, że jest testowany, a to utrudnia ocenę, jak zachowa się w prawdziwych wdrożeniach. Dlatego Opus 5.5 dostał zabezpieczenia podobne do tych w Fable 5.1:
- większość zadań z zakresu cyberbezpieczeństwa jest przekierowywana do Opus 4.8; zwykłe wyszukiwanie i poprawianie błędów we własnym kodzie działa normalnie;
- prace biologiczne, które blokują zabezpieczenia, wymagają zgłoszenia do programu Life Sciences Verification Program;
- model działa z mechanizmem preserved thinking, który utrudnia wyciąganie jego rozumowania przez API;
- nie da się go już używać z wyłączonym trybem myślenia.
Dostępność i limity
Opus 5.5 jest dostępny od dnia premiery na wszystkich platformach, także w Amazon Web Services, Google Cloud i Microsoft Azure. Programiści znajdą go na Claude Platform pod nazwą claude-opus-5-5. Anthropic podnosi pięciogodzinne limity użycia w planach Pro, Max i Team oraz w planach Enterprise rozliczanych za stanowisko. Subskrybenci dostają też jednorazowy reset limitu, który mogą zachować i wykorzystać, kiedy zechcą. Claude Sonnet 5.5 i Claude Haiku 5.5 mają pojawić się w najbliższych tygodniach.
Co z tego wynika
Najciekawsze w tej premierze nie są rekordy w tabelach, tylko relacja ceny do jakości. Jeśli deklaracje się potwierdzą, model z najwyższej półki staje się o 40% tańszy, a przy długich zadaniach agentowych obniżka jest jeszcze wyraźniejsza, bo przy nich dominują odczyty z cache. Drugą ważną zmianą jest styl pisania. Przy wielogodzinnej pracy agenta czytelność raportów ma większe znaczenie niż kilka punktów w benchmarku. Jak to wypada w praktyce, pokażą najbliższe tygodnie. Szczególnie warto sprawdzić, jak często zabezpieczenia będą przekierowywać zadania do starszych modeli.
Komentarze