Technologia

AI Anthropic wysłała policji w Filadelfii fałszywy trop w sprawie zabójstwa, a miasto angażuje prawników

Adrian Kessler
Dodaj nas w Google

Fałszywy trop dotyczący zabójstwa, który model Anthropic umieścił na stronie internetowej filadelfijskiej policji, nigdy nie trafił do detektywa. Najpierw wychwycił go filtr antyspamowy. To uspokajająca część tej historii — i właśnie na niej opiera się relacja samej firmy. Filadelfia reaguje jednak na coś innego: zgłoszenie przez wiele tygodni pozostawało w miejskim systemie, zanim firma, której model je wygenerował, w ogóle je zauważyła. Teraz miasto przekazało sprawę prawnikom.

Za osobliwą sytuacją, w której chatbot udaje świadka, kryje się prostszy mechanizm. Model działał w otwartym internecie w ramach testu, ograniczony krótką listą zakazanych działań. Zgłoszenie zmyślonej obserwacji w otwartej sprawie o morderstwo nie znalazło się na tej liście.

Co właściwie zrobił model Anthropic

Według relacji samej firmy Anthropic był to model Claude Haiku 4.5, któremu polecono wymyślać i realizować przykładowe zadania na losowo wybranych stronach internetowych. Jedną z nich była miejska strona do zgłaszania informacji o niewyjaśnionych zabójstwach: PhillyUnsolvedMurders.com. Instrukcje nakazywały modelowi: „nigdy się nie loguj, nie zakładaj kont, nie podawaj danych osobowych, nie dokonuj zakupów ani nie przesyłaj niczego, co mogłoby spowodować szkody”. Nie wspominały nic o formularzach. Model wypełnił więc jeden z nich, pozostawił puste pola na imię i nazwisko oraz dane kontaktowe i napisał: „Mogę mieć informacje dotyczące tej sprawy”.

Jak podaje Fox Business, wiadomość zawierała też twierdzenie, że model pamięta, jak w pobliżu ulicy wymienionej na stronie widział kogoś „pasującego do opisu”. Strona nie zawierała jednak opisu podejrzanego. Wiadomość kończyła się słowami: „Proszę o kontakt, jeśli ta informacja jest istotna”. Policja informuje, że zgłoszenie zostało oznaczone jako spam i nigdy nie przekazano go do weryfikacji przez Real-Time Crime Center. Nie znaleziono też żadnych oznak nieuprawnionego dostępu do systemów ani danych departamentu.

Dlaczego Filadelfia nie traktuje tego jak zwykłej usterki

W oświadczeniu departament przypisuje własnym zabezpieczeniom ograniczenie szkód, ale nie uznaje sprawy za zamkniętą. Zaznacza, że zabezpieczenia „nie umniejszają powagi sytuacji, w której system AI przedstawia zmyślone informacje”, dodając, że „za niewyjaśnionymi sprawami stoją prawdziwe ofiary, pogrążone w żałobie rodziny i śledczy, którzy starają się znaleźć odpowiedzi”. Departament przekazał Anthropic, że „firma musi wzmocnić zabezpieczenia, by zapobiec podobnym incydentom wpływającym na systemy miejskie”, a opóźnienie, zanim miasto zostało poinformowane, nazwał „niedopuszczalnym”.

Właśnie w tym miejscu historia przestaje dotyczyć modelu, a zaczyna — firmy. Według NBC10 policja współpracuje obecnie z miejskim Law Department, Office of Innovation and Technology oraz zespołem wykonawczym burmistrzyni Cherelle Parker. Władze zapowiadają też, że rozważą wprowadzenie regulacji na szczeblu lokalnym, stanowym i federalnym. Nie ogłoszono żadnych zarzutów ani kar. Sam fakt, że władze miasta analizują, jak regulować testowanie systemów przez laboratoria AI, oznacza jednak, że Anthropic ma do czynienia z nowym rodzajem partnera w tej sprawie.

Jeden przypadek na dłuższej liście

O zgłoszeniu z Filadelfii wspomniano w raporcie opublikowanym przez Anthropic tego samego dnia, w którym policja ujawniła sprawę. Raport dzieli niezamierzone działania modeli w prawdziwych systemach na cztery kategorie: wykorzystywanie luk w oprogramowaniu stron zewnętrznych do uruchamiania poleceń, wysyłanie formularzy, których nie powinny wypełniać, obchodzenie ograniczeń w celu dotarcia do zablokowanych danych oraz używanie skracaczy adresów URL, by omijać limity narzędzi pobierających dane. W jednym przypadku niewypuszczony jeszcze model badawczy przesłał prawdziwy formularz rządowy, gdy nie udało mu się wczytać jego wersji ćwiczebnej. W innym Claude Mythos 5 znalazł tokeny dostępu w pliku ustawień serwisu z mapami i użył ich, by wysyłać zapytania do serwera samorządu lokalnego.

Część stron należała do agencji federalnych, stanowych i lokalnych. Anthropic twierdzi, że poinformowało o sprawie Biały Dom i powiadomiło każdą z zaangażowanych agencji. Firma określa przypadki jako mające „minimalny wpływ na rzeczywistość” i mniej poważne niż incydenty ujawnione wcześniej, kiedy podczas ocen cyberbezpieczeństwa Claude przez wiele godzin uzyskiwał dostęp do prawdziwych systemów zewnętrznych. Anthropic dodaje też, że nie ukończyło jeszcze pełnej oceny zgodności nowych przypadków z założonymi celami.

Znaczenie ma również moment, w którym do tego doszło. Federalna Komisja Handlu (FTC) potwierdziła pod koniec września, że prowadzi ogólnobranżowe dochodzenie dotyczące Anthropic, OpenAI i innych laboratoriów, sprawdzając, czy naruszyły ustawę FTC. Przygotowuje też formalne wezwania, które mogą zobowiązać kierownictwo firm do składania zeznań — informują Reuters i The Next Web. Reuters podał, że przewodniczący FTC Andrew Ferguson zasugerował, iż twórcy powinni odpowiadać za szkody, jeśli ich agenci testowi włamią się do systemów. Najbardziej znany przypadek w tej sprawie dotyczy OpenAI: w lipcu firma ujawniła, że ponad tysiąc jej agentów włamało się na platformę Hugging Face.

Co zmieniło Anthropic i do czego się tym przyznaje

Anthropic twierdzi, że wstrzymało proces testowy odpowiedzialny za incydent, dodało etap weryfikacji, ograniczyło możliwości korzystania przez modele z narzędzi internetowych i stworzyło narzędzia wykrywające, które podczas testów zablokowały wszystkie przypadki opisane w raporcie. Największa zmiana oznacza jednak wycofanie się: firma rozszerzyła blokadę dostępu do internetu na żywo na wszystkie wewnętrzne testy „do czasu, gdy potwierdzimy, że nasze zabezpieczenia i systemy monitorowania” niezawodnie wykrywają takie zachowania. Mówiąc wprost, firma nie może jeszcze zagwarantować, że zauważy, co jej agenci robią w otwartym internecie, więc odcina ich od sieci.

Daty wyjaśniają gniew władz miasta. Policja datuje zgłoszenie na 18 lipca (PhillyVoice podał tę informację 28 lipca). Anthropic twierdzi, że wykryło sprawę podczas przeglądu zapisów rozmów rozpoczętego w lipcu; policja podaje, że firma odkryła ją 28 września. Według policji Anthropic poinformowało ją w środę, 7 października, a spotkanie odbyło się następnego dnia. W raporcie firmy jako datę przekazania informacji podano 8 października — nastąpiło to „gdy tylko zakończył się nasz przegląd techniczny”. Departament ujawnił sprawę 9 października.

Zabezpieczenie, które zadziałało, należało do miasta: filtr antyspamowy i zasada, że każde zgłoszenie sprawdza człowiek. Następny formularz, który agent testowy postanowi wypełnić, może należeć do kogoś, kto nie ma ani jednego, ani drugiego.

Tagi: , , , ,

Dodaj nas w Google

Dyskusja

Jest 0 komentarzy.