Technologia

Claude Opus 5.5 jest 40% tańszy — i wychodzi, gdy Anthropic wzywa do ostrożności w AI

Susan Hill
Dodaj nas w Google

Claude Opus 5.5 robi coś, czego wcześniejsze modele Anthropica nie robiły: kosztuje mniej i działa szybciej, jednocześnie dorównując lub przewyższając większy i droższy system. Model obsługuje kodowanie agentowe, obsługę komputera, czytanie wykresów i rozumowanie interdyscyplinarne na poziomie, który według danych Anthropica przewyższa Claude Fable 5.1, wcześniej najbardziej zaawansowany model firmy, na kilku wskaźnikach. Dla ludzi i programistów, którzy uważali Opus 5 za przydatny, ale drogi, różnica między możliwościami modelu a jego kosztem znacząco się zmieniła.

Różnica w cenie jest konkretna. Opus 5.5 kosztuje 4 dolary za milion tokenów wejściowych i 20 dolarów za milion tokenów wyjściowych; Opus 5 kosztował odpowiednio 5 i 25 dolarów. Odczyt z pamięci podręcznej spada z 0,50 do 0,20 dolara za milion tokenów. Anthropic twierdzi, że typowe obciążenia pracą są ogółem o 40% tańsze. Prędkość zmierza w tym samym kierunku: standardowy model generuje tekst ponad 30% szybciej niż Opus 5. Osobna opcja szybkiego trybu, wyceniona na 8 dolarów za wejście i 40 dolarów za wyjście na milion tokenów, osiąga do 2,5-krotności prędkości standardowego Opus 5 — przydatne ustawienie dla aplikacji wrażliwych na opóźnienia.

Opublikowane przez Anthropica dane dotyczące wydajności stawiają Opus 5.5 przed Fable 5.1, Opus 5 i GPT-6 Astra w czterech z sześciu testów porównawczych. W Terminal-Bench 4.0, który testuje wykonywanie kodu w środowisku terminala na żywo, Opus 5.5 uzyskuje 66,4% wobec 55,8% dla Fable 5.1. W Humanity’s Last Exam, teście obejmującym wiedzę akademicką i zawodową z różnych dyscyplin, wynik to 67,7% wobec 65,6%. OSWorld 2.0, mierzący obsługę interfejsu komputerowego, pokazuje 81,8% wobec 80,7%. Test Deloitte wykazał, że Opus 5.5 przy najniższym poziomie wysiłku wykrył 72% znanych błędów kodowania podczas przeglądu, wobec 56% dla Opus 5 przy wysokim wysiłku. Te liczby pochodzą od Anthropica i jego wybranych partnerów; podane marginesy błędu wynoszą od ±1,6 do ±5 punktów procentowych, a na starcie nie opublikowano żadnej niezależnej weryfikacji przez strony trzecie.

Dwa obszary łamią ten trend. W AutomationBench GPT-6 Astra uzyskuje 41,4% wobec 40,0% dla Opus 5.5. W Terminal-Bench-Science różnica jest większa: Astra osiąga 64,6%, podczas gdy Opus 5.5 uzyskuje 58,7%. Obie różnice mieszczą się w podanych marginesach błędu — mogą być szumem — ale nie muszą być. Anthropic umieszcza te wiersze w swojej opublikowanej tabeli, co jest czymś więcej, niż robi większość firm AI przy premierze. Liczby nadal wymagają niezależnej analizy, zanim będą mogły być traktowane jako rozstrzygnięte.

Jeśli chodzi o bezpieczeństwo, Anthropic twierdzi, że Opus 5.5 został przed premierą oceniony przez zewnętrzne zespoły, w tym METR. W wewnętrznym audycie behawioralnym firmy, obejmującym prawie 2000 scenariuszy zaprojektowanych do testowania, czy model próbuje obejść nałożone na niego ograniczenia, Opus 5.5 jest opisywany jako o 85% mniej skłonny niż Opus 5 do prób takiego obchodzenia. Silniejsze modele mają tendencję do bycia bardziej zdolnymi do znajdowania obejść, co czyni tę poprawę znaczącą, jeśli się utrzyma. Prawdziwym testem będą doświadczenia z wdrożenia.

To, co czyni tę premierę nietypową, to jej timing. Na początku tego miesiąca dyrektor generalny Anthropica, Dario Amodei, opublikował esej, w którym napisał, że przekonał się, iż pełne rozwiązanie problemów związanych z AI wymaga „dostosowania tempa postępu możliwości, aby zapobieganie ryzyku miało czas nadążyć”. Sam Altman z OpenAI i Elon Musk wyrazili zgodę z ogólną obawą. Jensen Huang z Nvidii powiedział, że nauka leżąca u podstaw tego nie potwierdza. A następnie Anthropic wypuścił model szybszy, tańszy i bardziej zdolny niż jego poprzednik. Jedna interpretacja: model z lepszymi ocenami bezpieczeństwa i szerszym dostępem to dokładnie to, co Amodei miał na myśli. Inna: esej wskazywał na postęp możliwości jako problem, a możliwości się rozwinęły. Obie interpretacje mieszczą się w tym samym zestawie faktów, a same testy porównawcze Anthropica nie mogą rozstrzygnąć, która jest słuszna.

Claude Opus 5.5 jest dostępny od 22 września 2026 roku pod identyfikatorem modelu API claude-opus-5-5. Działa w Claude na planach Pro, Max, Team i Enterprise oraz jest dostępny przez AWS, Google Cloud i Microsoft Azure. Anthropic podnosi limity użycia w pięciogodzinnych poziomach subskrypcji. Sonnet 5.5 i Haiku 5.5, pozostali członkowie rodziny 5.5, mają zostać wydane w nadchodzących tygodniach, bez ogłoszonych cen ani konkretnych dat premiery dla żadnego z nich.

Tagi: , , , , ,

Dodaj nas w Google

Dyskusja

Jest 0 komentarzy.