Technologia

Anthropic twierdzi, że Claude prowadzi 26% badań własnych — ale to sam Claude je mierzy

Adrian Kessler
Dodaj nas w Google

Co czwarte zadanie badawcze AI w Anthropic jest teraz prowadzone przez Claude’a. Nie przypisane Claude’owi jako pomocnik, nie sprawdzane przez Claude’a po fakcie — rozpoczęte od ogólnego polecenia i wykonane w całości od początku do końca, z człowiekiem sprawdzającym wynik po zakończeniu. Dziewięć miesięcy temu ten odsetek wynosił mniej niż jeden procent.

Anthropic rozróżnia dwie kategorie. Kiedy Claude prowadzi zadanie, wykonuje większość pracy samodzielnie; przełożony sprawdza wynik zamiast kierować każdym krokiem. To inna kategoria niż 90% badań i rozwoju Anthropic, w których Claude działa jako współpracownik — człowiek steruje, Claude obsługuje konkretne fragmenty. Prowadzenie jest trudniejszą klasyfikacją. Obecnie stanowi 26% wszystkich badań AI, jakie firma prowadzi, ważone czasem, który badacze w przeciwnym razie poświęciliby na te zadania.

Skala jest konkretna. Około 30 000 agentów Claude’a działa jednocześnie na wewnętrznych platformach Anthropic, realizując prace związane z trenowaniem modeli, ewaluacją, badaniami nad interpretowalnością i analizą bezpieczeństwa. W sierpniu agenty te podjęły łącznie ponad miliard decyzji. Systemy monitorowania w czasie rzeczywistym Anthropic zablokowały 0,002% z nich — mniej więcej jedną na każde 47 000 akcji — przed wykonaniem. Następnie warstwa offline oznaczała około 100 000 transkryptów tygodniowo do przeglądu, eskalując około 50 do człowieka.

Bezpieczeństwo ma wymierny budżet w ramach tego systemu. W ciągu jednego tygodnia lipca prace poświęcone zapewnieniu bezpieczeństwa agentów pochłonęły 6% wszystkich zasobów obliczeniowych badań i rozwoju AI oraz 12% zasobów obliczeniowych wykorzystywanych przez same badania R&D napędzane AI. Anthropic twierdzi, że klasyfikowało konserwatywnie, wyłączając dedykowane klasyfikatory bezpieczeństwa z obliczeń, co sugeruje, że rzeczywisty odsetek jest jeszcze wyższy.

U podstaw tego wszystkiego leży problem epistemologiczny. Wkład Claude’a w badania Anthropic jest częściowo oceniany przez samego Claude’a. Model Claude’a ocenia pracę Claude’a; dane dotyczące nadzoru obejmują tylko jedną wewnętrzną platformę; a klasyfikacja zasobów obliczeniowych opierała się na próbkowaniu i etykietowaniu własnych przebiegów przez modele Claude’a. Żadna niezależna strona trzecia nie przeprowadziła audytu metodologii. Trzy liczby opublikowane przez Anthropic są precyzyjne, ale jest to precyzja samodzielnie raportowana — co różni się od precyzji zweryfikowanej.

Anthropic zapowiada, że zacznie włączać zewnętrznych ewaluatorów do procesu. Brak nazwisk, brak dat rozpoczęcia i jak dotąd nie pojawiło się podobne ujawnienie z innych laboratoriów AI. Wskaźnik 26%, biorąc pod uwagę tempo, w jakim rósł, jest migawką, a nie sufitem.

Tagi: , , , , ,

Dodaj nas w Google

Dyskusja

Jest 0 komentarzy.