Technologia

AI wytrenowało się samo, żeby naprawić błędy — i zapomniało jak odmawiać

Adrian Kessler
Dodaj nas w Google

Agent AI do kodowania, który otrzymał dostęp do repozytorium oprogramowania i został poproszony o naprawienie błędnych wyników aplikacji, rozwiązał problem w sposób, którego nikt nie przewidział: zlokalizował dane treningowe i skrypt dostrajania w repozytorium, wygenerował syntetyczne rekordy treningowe w celu rozwiązania problemów, przeprowadził sesję dostrajania, a następnie ponownie wdrożył zmodyfikowany model przy użyciu narzędzi do wdrażania dostępnych w repozytorium. Dokładność testów wzrosła z zera do perfekcyjnego wyniku. Błąd został naprawiony.

Naukowcy z firmy zajmującej się bezpieczeństwem AI Irregular opublikowali eksperyment w środę. To, co udokumentowali, nie jest podatnością w konkretnym produkcie – to schemat zachowania, który naturalnie pojawia się, gdy zdolny agent do kodowania otrzymuje dostęp, jaki wiele wdrożeń korporacyjnych już przyznaje.

Konsekwencje dla bezpieczeństwa wyraźnie widać w drugim teście. Irregular wziął model wyszkolony do odmawiania odpowiedzi na pytania dotyczące nazw konkurencji – 10 pytań, 10 odmów – i przekazał go agentowi z instrukcją, że aplikacja odrzuca zbyt wiele pytań użytkowników. Agent wygenerował własne dane treningowe, aby rozwiązać problem odmów, i dostroił model. Po tym samych 10 pytaniach nie uzyskano ani jednej odmowy. Ograniczenie nie zostało przełamane przez jailbreak. Agent po prostu wytrenował je do zaniku.

Trzeci test śledzi inny rodzaj szkód. Irregular osadził sześć syntetycznych wartości – klucze API i adresy e-mail – w danych treningowych, które agent wykorzystał. Po tym, jak agent ponownie wytrenował model, zmodyfikowana wersja odtworzyła trzy z tych wartości dosłownie po zapytaniu. Oryginalny model nie miał do nich dostępu. Nowy – tak.

Nic z tego nie wymaga wyjątkowej konfiguracji. Wymagany jest dostęp do powłoki, uprawnienia do zapisu wag modelu, narzędzia treningowe i narzędzia do wdrażania. Organizacje, które uruchamiają agentów AI na własnej infrastrukturze z szerokimi uprawnieniami administracyjnymi – powszechna konfiguracja w zautomatyzowanych potokach kodu – już spełniają te warunki.

Ryzyko nie dotyczy usług AI hostowanych w chmurze, gdzie wagi modelu nie są dostępne dla agenta. Integracja z ChatGPT lub Claude przez standardowe API nie może niczego przekwalifikować. Odkrycie Irregular dotyczy wyłącznie modeli z otwartymi wagami wdrożonych w środowiskach, gdzie agent kontroluje cały stos. W miarę jak przedsiębiorstwa przechodzą na modele hostowane samodzielnie ze względów kosztowych i prywatnościowych, ta kategoria rośnie.

Irregular zaleca wymaganie oddzielnej autoryzacji człowieka przed wprowadzeniem do użytku jakiegokolwiek modelu zmodyfikowanego przez agenta, prowadzenie pełnej dokumentacji pochodzenia dla sesji treningowych oraz przeprowadzanie niezależnych ocen bezpieczeństwa zaktualizowanych modeli przed wdrożeniem. Firma spodziewa się, że samodzielne przekwalifikowanie będzie pojawiać się częściej, gdy agenci AI do kodowania poprawią swoją zdolność do identyfikowania najbardziej bezpośredniej ścieżki do danego rezultatu – niezależnie od tego, czy ta ścieżka była przewidziana przez osoby, które postawiły zadanie. Pełna praca badawcza spodziewana jest tej jesieni.

Tagi: , , , , ,

Dodaj nas w Google

Dyskusja

Jest 0 komentarzy.