Technologia

Fable 5.1 Anthropic obniża koszty pamięci podręcznej o 75% i ponad dwukrotnie zwiększa wyniki agentyczne

Susan Hill

Anthropic zaktualizował Claude’a za pomocą Fable 5.1, obniżając koszt przetwarzania tokenów w cache z 1,00 USD do 0,25 USD za milion – redukcja o 75%, która pojawia się w momencie, gdy większość producentów AI odkryła, że to kumulacja kontekstu, a nie surowe obliczenia, jest w rzeczywistości tam, gdzie skupiają się budżety infrastrukturalne. W ramach żywej sesji agentycznej jedna rozmowa z Claudem może przechowywać w cache setki tysięcy tokenów w miarę narastania kontekstu między odpowiedziami. Przy stawce 0,25 USD za milion taka kumulacja staje się świadomym wyborem projektowym, a nie ograniczeniem kosztów, które programista musi obchodzić.

Wyniki benchmarków towarzyszące zmianie cen pokazują wzrost wydajności, który pogłębia argument ekonomiczny. W teście Terminal-Bench-Science 0.1, który mierzy wieloetapowe rozumowanie naukowe wymagające projektowania eksperymentów i iteracyjnej analizy, Fable 5.1 uzyskał 52,6% wobec 24,7% dla Fable 5 – więcej niż podwajając poprzedni wynik. AutomationBench poprawił się z 17,1% do 31,4%, a Terminal-Bench 4.0, szersza ocena zdolności agentycznych, wzrósł z 42,0% do 55,8%. CursorBench 3.2.0 osiągnął 73,4%. Wzór we wszystkich czterech ocenach jest spójny: Fable 5.1 nie jest marginalnie lepszy na krawędzi, jest znacznie bardziej niezawodny w kategoriach zadań definiujących wartość agentyczną.

Połączony efekt przepisuje arytmetykę kosztów budowania z Claudem. Aplikacja agentyczna, która realizuje zadanie w mniejszej liczbie kroków – ponieważ model jest bardziej niezawodny – zużywa mniej cykli tokenowych w drodze do pomyślnego wyniku. Zastosuj 75% cięcie kosztów cache do tokenów, które faktycznie wykorzystuje, a efektywna redukcja kosztu na zadanie w przepływach pracy o wysokim stopniu ponownego użycia sięga 45% lub więcej. Anthropic nie opublikował jednej nadrzędnej liczby dla łącznych oszczędności, ale programiści modelujący własną ekonomię tokenów dojdą do wartości w tym zakresie dla obciążeń wymagających dużego kontekstu.

Fable 5.1 jest dostępny natychmiast przez bezpośrednie API Anthropic pod identyfikatorem modelu claude-fable-5-1, a także przez Amazon Web Services Bedrock, Google Cloud Platform i Microsoft Azure. Anthropic ogłosił Enterprise Frontier Safeguards jako równoczesną funkcjonalność: kontrola retencji danych przez klienta, klucze szyfrowania zarządzane przez klienta oraz wdrożenie w istniejącej dzierżawie infrastruktury chmurowej klienta – wszystko wliczone w cenę bez dodatkowych opłat poza podstawowymi kosztami chmury.

Równolegle z ogólnym udostępnieniem Anthropic wprowadził Mythos 5.1, wariant tego samego modelu działający – jak opisuje firma – z bardziej permisywnymi zabezpieczeniami dla zweryfikowanych organizacji. Dostęp jest ograniczony do zweryfikowanych instytucji badawczych z zakresu cyberbezpieczeństwa i firm z sektora nauk przyrodniczych. Firma wymieniła demonstrowane zastosowania, w tym projektowanie wiązań białkowych i optymalizację modeli biologicznych przy przepustowości wnioskowania do 2,5 razy większej niż w standardowym wydaniu. Dostęp do Mythos 5.1 nie jest samoobsługowy: Anthropic rozpatruje zgłoszenia indywidualnie i nie opublikował wielkości zarejestrowanej grupy.

Wyniki agentyczne Fable 5.1, szczególnie w Terminal-Bench-Science, stawiają opublikowane rezultaty Anthropic przed ostatnimi ujawnionymi danymi OpenAI w porównywalnych ocenach. Międzysystemowe porównania benchmarków niosą ze sobą metodologiczne zastrzeżenia – dostawcy wybierają oceny, które faworyzują ich modele, a konkretne testy wybrane przez Anthropic były prawdopodobnie wybrane ze względu na korzystne wyniki. Trudniej jednak wytłumaczyć wewnętrzny wzór podwajania: Fable 5.1 to nie ten sam model z obniżoną ceną. Zmiana wydajności jest na tyle duża, że historia cen i historia wydajności nie mogą być rozdzielone.

Dla programistów, którzy obecnie nie używają Claude’a, ruch cenowy w cache jest liczbą wartą przełożenia na własną ekonomię tokenów. Każdy dostawca AI, który nie zbliży się do 0,25 USD za milion tokenów w cache, będzie teraz musiał stawić czoła bezpośrednim porównaniom kosztów w rozmowach sprzedażowych z przedsiębiorstwami. Cena cache u Anthropic była już niższa niż u kilku konkurentów przed tą obniżką; luka się powiększyła. Usprawnienia wydajności są trudniejsze do uogólnienia na różne przypadki użycia, ale w segmencie agentycznym i naukowego rozumowania Fable 5.1 ustanawia poziom benchmarku, z którym będzie mierzona następna duża wersja dowolnego dostawcy.

Tagi: , , , ,

Dyskusja

Jest 0 komentarzy.